Scrapy初始

Scrapy框架(爬虫框架)

　　Scrapy是一个为了爬取网站数据，提取结构性数据而编写的应用框架，非常出名，非常强悍。

　　所谓的框架就是一个已经被集成了各种功能（高性能异步下载，队列，分布式，解析，持久化存储等）的具有很强通用性的项目模板。

　　对于框架的学习，重点是要学习其框架的特性、各个功能的用法即可。

　　1、pip3 install wheel

进入下载目录，执行 pip3 install Twisted-19.2.1-cp36-cp36m-win_amd64.whl

pip3 install pywin32

　　5、pip3 install scrapy

　　1、创建项目: scrapy startproject xxx

　　2、创建爬虫文件: scrapy genspider first www.xxx.com

　　3、执行爬虫文件：scrapy crawl first

　　4、执行爬虫文件不打印日志: scrapy crawl budejie --nolog

　　5、执行爬虫文件并持久化存储到csv文件中: scrapy crawl budejie -o budejie.csv

文件存储: 可以实现任意文件类型的存储

　　2、mysql存储:

　　　　a、创建连接

　　　　b、创建游标

　　　　c、使用事务

　　　　d、关闭游标和连接

　　3、redis存储

　　　　a、创建连接

　　　　b、存储的数据需要进行json序列化

　　　　c、关闭连接

相关阅读:
读本地json的方法
告诉你如何应对HR索要薪资证明！
函数声明与函数表达式
原型的动态性
工作实际需求andjs进阶图书
表单元素操作，button，点击下载按钮实现-长知识
grunt注意要点
重新认识块级元素--DIV
GO语言学习：变量间赋值
GO语言学习：单通道

原文地址：https://www.cnblogs.com/youhongliang/p/12182747.html