python爬虫 非结构化数据与结构化的数据提取

2018-11-23  本文已影响0人  现实里的童话xklss

页面解析和数据提取

页面解析和数据提取

一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

非结构化的数据处理

文本、电话号码、邮箱地址

正则表达式

HTML 文件

正则表达式
XPath
CSS选择器

结构化的数据处理

JSON 文件

JSON Path
转化成Python类型进行操作(json类)

XML 文件

转化成Python类型(xmltodict)
XPath
CSS选择器
正则表达式

上一篇 下一篇

猜你喜欢

热点阅读