总结
a,分析http请求
1,请求方式
2,url
3,2种本质格式:form data(request.post()), request payload(json数据类型)
4,请求头:
--user-agent:当前用户使用的设备(request.get(www.zhihu))
--referer : 上一次请求的url携带过来('weixingongzhonghao')
--content-type: 请求体格式 application/json
--host:域名
--cookie :cookie本质上也是请求头
b,代理
爬虫目的: 伪造浏览器,作出的一系列行为。
1,requests模块,通过它发送请求。拿回来字符串
2,beautifulsoup,对拿回来的字符串进行解析。把字符串结构化成对象,对对象进行操作。
web:
--请求头,请求体
--cookies
--csrf
过程总结:
-- 检测网络请求
-- 尝试