在爬取网页的过程中,经常会出现不久前可以爬取的网页现在无法爬取了,这是因为您的IP被爬取网站的服务器所屏蔽了。此时代理服务可以为您解决这一麻烦,设置代理时,首先需要找到代理地址,例如“122.114.31.177”,对应的端口号为“808”,完整的格式为“122.114.31.177:808”,如下:
import requests #设置代理IP与对应的端口号 proxy={'http':'122.114.31.177:808','https':'122.114.31.177:808'} # response=requests.get('http://www.mingrisoft.com/',proxies=proxy) print(response.content)
由于实例中代理IP是免费的,所以使用的时间不固定,超出使用的时间范围该地址将失效