NLP文本分类学习系列(二)
2020-07-22 本文已影响0人
柠樂helen
Task2 数据读取与数据分析
-
读取数据
第一列为新闻的类别,第二列为新闻的字符。
读取数据 -
数据洞察
- 赛题数据中,新闻文本的长度是多少?
- 赛题数据的类别分布是怎么样的,哪些类别比较多?
- 赛题数据中,字符分布是怎么样的?
文本长度分布2
答1:文本长度平均为872个字符,最小的有64个,最长的有7125个,大部分在1000以下。
文本类别分布在数据集中标签的对应的关系如下:{'科技': 0, '股票': 1, '体育': 2, '娱乐': 3, '时政': 4, '社会': 5, '教育': 6, '财经': 7, '家居': 8, '游戏': 9, '房产': 10, '时尚': 11, '彩票': 12, '星座': 13}
答2:由此可见,“体育”、“股票” 占比最高,“科技”、“娱乐”次之,类别分布不是很均衡。
答3:最多的字符,平均30次/篇,高频的字符很可能是标点或停用词,需要过滤。
引用官方说明
通过上述分析我们可以得出以下结论:
1.赛题中每个新闻包含的字符个数平均为1000个,还有一些新闻字符较长;
2.赛题中新闻类别分布不均匀,科技类新闻样本量接近4w,星座类新闻样本量不到1k;
3.赛题总共包括7000-8000个字符;
通过数据分析,我们还可以得出以下结论:
1.每个新闻平均字符个数较多,可能需要截断;
2.由于类别不均衡,会严重影响模型的精度;
本章作业
- 假设字符3750,字符900和字符648是句子的标点符号,请分析赛题每篇新闻平均由多少个句子构成?
- 统计每类新闻中出现次数对多的字符
句子个数分布