NLP文本分类学习系列(二)

2020-07-22  本文已影响0人  柠樂helen

Task2 数据读取与数据分析

文本长度分布
文本长度分布2

答1:文本长度平均为872个字符,最小的有64个,最长的有7125个,大部分在1000以下。

文本类别分布

在数据集中标签的对应的关系如下:{'科技': 0, '股票': 1, '体育': 2, '娱乐': 3, '时政': 4, '社会': 5, '教育': 6, '财经': 7, '家居': 8, '游戏': 9, '房产': 10, '时尚': 11, '彩票': 12, '星座': 13}
答2:由此可见,“体育”、“股票” 占比最高,“科技”、“娱乐”次之,类别分布不是很均衡。

字符词频分布

答3:最多的字符,平均30次/篇,高频的字符很可能是标点或停用词,需要过滤。

引用官方说明
通过上述分析我们可以得出以下结论:
1.赛题中每个新闻包含的字符个数平均为1000个,还有一些新闻字符较长;
2.赛题中新闻类别分布不均匀,科技类新闻样本量接近4w,星座类新闻样本量不到1k;
3.赛题总共包括7000-8000个字符;
通过数据分析,我们还可以得出以下结论:
1.每个新闻平均字符个数较多,可能需要截断;
2.由于类别不均衡,会严重影响模型的精度;

本章作业

  1. 假设字符3750,字符900和字符648是句子的标点符号,请分析赛题每篇新闻平均由多少个句子构成?
  2. 统计每类新闻中出现次数对多的字符
统计句子个数
句子个数分布
上一篇下一篇

猜你喜欢

热点阅读