计算机毕业设计hadoop+spark+hive小说数据分析可视

2023-08-28 本文已影响0人计算机毕业设计大全

流程
1.爬取17k的小说数据约5-10万，存入mysql数据库；
2.使用mapreduce对mysql中的小说数据集进行数据清洗，转为.csv文件上传至hdfs文件系统；
3.根据.csv文件结构，使用hive建库建表；
4.一半分析指标使用hive_sql完成，一半分析指标使用Spark-Scala完成;
5.将分析结果使用sqoop导入mysql数据库；
6.使用Flask+echarts构建可视化大屏；
创新点：Python爬虫、海量数据、可视化、实时计算spark+离线计算hive双实现
可选装知识图谱、推荐系统、后台管理、预测系统等，实现界面如下(可0秒无缝衔接选装上)

1.png

2.png

3.png

7.png

8.png

9.png

10.png

11.png

12.png

计算机毕业设计hadoop+spark+hive小说数据分析可视

猜你喜欢

热点阅读