工作杂记

网站: JavaEye 作者: Jarymin 链接：http://jarymin.javaeye.com/blog/157138 发表时间: 2008年01月01日

声明：本文系JavaEye网站发布的原创博客文章，未经作者书面许可，严禁任何网站转载本文，否则必将追究法律责任！

今天接到一个任务,实现一个Spider,来方便团队的资讯和内容编辑人员,提高团队的开发效率.说实话,这个东西经常看见别人提起,但是实际动手发现一个问题是,简单的功能好做但是普遍的适应性就很差:比如可以在Sina体育版的新闻实现我的需求可是在时政版就不行-_-!

还有一些专题带了Video的,这个就得做一大堆的条件预判断,OMG,网易和Sohu偶还没有考虑呢!

不过我也发现Google的爬虫也是Python的，呵呵,貌似做的好的爬虫至少需要考虑

1.频繁的小文件读取

2.网站的普遍适应性(采集的命中率)

3.高可靠性

暂时就这么多了,经过昨天12小时的coding大概除了一个单页面的alpha版本,效率还有待提高啊:)

Technorati 标签: Python,Spider

本文的讨论也很精彩，浏览讨论>>

JavaEye推荐
普元软件在北京和上海招聘技术高手加盟

相关阅读:
SpringBoot Shiro 配置自定义密码加密器
SpringBoot Druid 配置详解
UOJ #164. 【清华集训2015】V | 线段树
BZOJ 4552 [Tjoi2016&Heoi2016]排序 | 二分答案线段树
51nod 1462 树据结构 | 树链剖分矩阵乘法
BZOJ 3503 [CQOI2014]和谐矩阵
BZOJ 4004 [JLOI2015]装备购买 | 线性基
BZOJ 4785 [Zjoi2017]树状数组 | 二维线段树
LOJ #2145. 「SHOI2017」分手是祝愿
LOJ #2141. 「SHOI2017」期末考试

原文地址：https://www.cnblogs.com/ins/p/1063842.html