计算机毕业设计hadoop+spark+hive小说数据分析可视
2023-08-28 本文已影响0人
计算机毕业设计大全
流程
1.爬取17k的小说数据约5-10万,存入mysql数据库;
2.使用mapreduce对mysql中的小说数据集进行数据清洗,转为.csv文件上传至hdfs文件系统;
3.根据.csv文件结构,使用hive建库建表;
4.一半分析指标使用hive_sql完成,一半分析指标使用Spark-Scala完成;
5.将分析结果使用sqoop导入mysql数据库;
6.使用Flask+echarts构建可视化大屏;
创新点:Python爬虫、海量数据、可视化、实时计算spark+离线计算hive双实现
可选装知识图谱、推荐系统、后台管理、预测系统等,实现界面如下(可0秒无缝衔接选装上)
![](https://img.haomeiwen.com/i21576447/02362ac9c641fa75.png)
![](https://img.haomeiwen.com/i21576447/e645b78dce491584.png)
![](https://img.haomeiwen.com/i21576447/a21fd5ff70a533bc.png)
![](https://img.haomeiwen.com/i21576447/8bc4f4c074b2fa39.png)
![](https://img.haomeiwen.com/i21576447/8830349bd471e1b5.png)
![](https://img.haomeiwen.com/i21576447/7ba6604627742aef.png)
![](https://img.haomeiwen.com/i21576447/3997f978c9be20a4.png)
![](https://img.haomeiwen.com/i21576447/c8e72e061743cf1b.png)
![](https://img.haomeiwen.com/i21576447/4d7ad14a4753df9f.png)