工作杂记

全部 Ruby Python PHP Flash C++ .net Rails Flex C C# Django

浏览 2082 次

锁定老帖子主题：工作杂记精华帖 (0) :: 良好帖 (0) :: 新手帖 (0) :: 隐藏帖 (0)
作者	正文
Jarymin 等级: 初级会员性别: 文章: 19 积分: 70 来自: Mars	发表时间：2008-01-18 相关推荐: 工作杂记-YUV的dump和read 工作杂记 2022.3.8 工作杂记记2021年10月-11月 ·复制map 平时工作杂记更多相关推荐 Python 今天接到一个任务,实现一个Spider,来方便团队的资讯和内容编辑人员,提高团队的开发效率.说实话,这个东西经常看见别人提起,但是实际动手发现一个问题是,简单的功能好做但是普遍的适应性就很差:比如可以在Sina体育版的新闻实现我的需求可是在时政版就不行-_-! 还有一些专题带了Video的,这个就得做一大堆的条件预判断,OMG,网易和Sohu偶还没有考虑呢! 不过我也发现Google的爬虫也是Python的，呵呵,貌似做的好的爬虫至少需要考虑 1.频繁的小文件读取 2.网站的普遍适应性(采集的命中率) 3.高可靠性暂时就这么多了,经过昨天12小时的coding大概除了一个单页面的alpha版本,效率还有待提高啊:) Technorati 标签: Python,Spider 声明：ITeye文章版权属于作者，受法律保护。没有作者书面许可不得转载。推荐链接
返回顶楼

imjl 等级: 性别: 文章: 678 积分: 166 来自: 上海	发表时间：2008-01-18 通用难哦。
返回顶楼	回帖地址 0 0 请登录后投票

Jarymin 等级: 初级会员性别: 文章: 19 积分: 70 来自: Mars	发表时间：2008-01-18 确实很难做到通用,不过我的想法是做成独立的API然后调用
返回顶楼	回帖地址 0 0 请登录后投票

论坛首页 → 编程语言技术版

跳转论坛: