用python写爬虫呢,最常见的过滤方式有BeautifulSoup, css selector, XPath, 如果使用前两个,BeautifulSoup包就能解决,然而使用XPath,就要引入lxml包了。
接下来我以我的博客为例,教大家怎么使用XPath。
我们要做什么:
关于XPath, 网上有诸多语法教程,我不再详细介绍。
我们要抓取的是 http://www.cnblogs.com/chenyansu/ 中第三篇文章,7月15日的文章的简介,它在网页中显示为这样的:
在chrome浏览器中右键点击相关正文,选择最后的检查选项:将在右边出现一个文档树,相关位置已被选定,右键,copy -> copy XPath
得到结果:'//*[@id="main"]/div[3]/div[2]'
实践代码:
import requests
from lxml import etree
# requests包
testurl = "http://www.cnblogs.com/chenyansu/"
session = requests.Session()
s = session.get(testurl)
# lxml无法处理响应文件,用.content输出正文
s = s.content
# lxml包
# 将对象转化为html
s = etree.HTML(s)
# html拥有xpath方法
x = s.xpath('//*[@id="main"]/div[3]/div[2]')
print(x)
# 循环输出x内容
for child in x:
print(child.text)
总体思路是:
用requests包获得全部网页内容 -> 用.contente选取正文 -> 用lxml转换为html -> 使用XPath -> 将结果循环输出
注意:
利用XPath对table的绝对定位有些问题, 比如说
- '//*[@id="main"]/section/div/table/tbody/tr[8]/td/text()'
这样定位到的会是一个空的list.
建议使用'//td'这样的相对定位,这样将得到所有的表格内容的list,再利用下标或者切片输出。