scrapy爬虫框架(一):scrapy框架简介
2018-08-21 本文已影响0人
渔父歌
一、安装scrapy框架
#打开命令行输入如下命令:
pip install scrapy
二、创建一个scrapy项目
安装完成后,python会自动将 scrapy命令添加到环境变量中去,这时我们就可以使用 scrapy命令来创建我们的第一个 scrapy项目了。
打开命令行,输入如下命令
scrapy startproject yourproject
这里的 startproject
命令将会在当前目录下创建一个 scrapy项目,后面跟着的参数是需要创建的项目的名称。
比如这里我们会创建一个名为 yourproject
的项目,项目结构如下:
yourproject/
scrapy.cfg
yourproject/
__init__.py
items.py
pipelines.py
settings.py
spiders/
__init__.py
...
这些文件分别是:
- scrapy.cfg: 项目的配置文件
- yourproject/: 该项目的python模块。该项目的所有代码都在这个目录下
- yourproject/items.py: 项目中的item文件,我们在这个文件里定义要爬取的数据,有点类似于 Django的 model。
- yourproject/pipelines.py:项目中的pipelines文件(我把这个称为通道文件,意思就是数据处理的通道),对爬取到的数据进行处理(如:储存)
- yourproject/settings.py: 项目的设置文件,设置全局变量的值、通道的开启和关闭以及多个通道和爬虫的执行优先级
- yourproject/spiders/: 爬虫的主要逻辑都在这个文件夹里,包括页面请求、数据提取、反爬措施等。
.