Python爬虫(九)_非结构化数据与结构化数据

2017-12-03  本文已影响124人  小七奇奇

爬虫的一个重要步骤就是页面解析与数据提取。更多内容请参考:Python学习指南

页面解析与数据提取

实际上爬虫一共就四个主要步骤:

  1. 定(要知道你准备在哪个范围或者网站去搜索)
  2. 爬(将所有的网站的内容全部爬下来)
  3. 取(分析数据,去掉对我们没用处的数据)
  4. 存(按照我们想要的方式存储和使用)
  5. 表(可以根据数据的类型通过一些图标展示)

以前学的就是如何从网站去爬数据,而爬下来的数据却没做分析,现在,就开始对数据做一些分析。

数据,可分为非结构化数据结构化数据

非结构化的数据处理

文本、电话号码、邮箱地址

HTML文件

结构化的数据处理

JSON文件

XML文件

上一篇 下一篇

猜你喜欢

热点阅读