百度图片爬虫

爬虫工具：webmagic

爬取百度图片，不能通过获取html然后通过匹配标签的形式，而是要找到对应的提供json数据的请求，最初自信满满的按官方文档注解形式写了model，pipeline，然后就运行时就发现问题很大。

开始是获取不到html，然后通过调试发现可以获得rayText，但是只有简单的外层标签和数据，并没有图片相关数据。

我将代码放到下面，processor中定义了一个静态变量Set，用来保存图片url，剩下的就根据需求自己扩展了。

下面是pageProcessor的实现方法

接着是开启线程

将图片通过io保存到本地文件夹中

最后，头像成功的保存到本地了

相关阅读:
【Impala】为Impala Daemon服务配置Executor和Coordinator角色
[Mysql]ERROR 1064 (42000): You have an error in your SQL syntax； check the manual that corresponds
C/C++ 计算文件ROF再计算VAOF
C/C++ 判断进程32位还是64位
商业化管理
数据库设计 ER图
单例模式及其序列化/反序列化
IDEA怎么生成UML类图
UML 类图描述
单例设计模式——readResolve()源码分析

原文地址：https://www.cnblogs.com/gqymy/p/9782886.html