最新文章列表

casper js导致cpu使用率过高

  casper.waitForPopup(/popup\.html$/, function() { this.test.assertEquals(this.popups.length, 1); }); casper.withPopup(/popup\.html$/, function() { this.test.assertTitle('Popup title'); ...
薰衣草之子 评论(0) 有857人浏览 2016-01-06 12:23

Java Swing C/S版本12306订票助手

Java Swing C/S版本12306订票助手 https://github.com/xautlx/12306-hunter http://git.oschina.net/xautlx/hunter-12306 本程序完全开放源代码,仅作为技术学习研究交流之 ...
xautlx 评论(0) 有1683人浏览 2013-12-02 18:47

S2JH: 新增定向网站数据crawl爬取解析服务组件模块

基于过滤链设计模式、Htmlunit扩展、异步多线程等特性的简化定向数据爬取解析组件,提供基于天猫商品的数据采集演示单元测试(s2jh\crawl-service\src\test\java\lab\s2jh\crawl\service\test\CrawlServiceTest.java)   说明:此套爬虫设计主要用于一些定向网站数据抓取解析,如电商商品、交友信息等,抓取和解析特定页面的属 ...
xautlx 评论(0) 有1249人浏览 2013-12-02 13:10

从crawl 脚本看 nutch crawl过程 上

crawl 脚本用来实现 nutch 中对于网页的抓取 分析 索引工作。  把工程下下来之后 ,进入到 bin 目录: 两个脚本文件  crawl nutch   crawl 是对nutch 的进一 ...
sharp-fcc 评论(0) 有1150人浏览 2013-05-12 21:43

Nutch 源代码分析(1) Crawl 类

  (以下分析针对的是 nutch 1.4)   Crawl 类是运行抓取程序的入口,代码不多,但关联的其他类不少。   抓取的流程是:   1. 将初始的 URL 地址注入到 crawlDb   2. 从crawldb中生成一个url的子集用于抓取   3. 抓取网页   4. 分析网页   5. 更新 crawlDb ,增加新抓取的 url   6. 循环执行 2-5 步,直到达到指定 ...
裴小星 评论(0) 有3604人浏览 2012-04-06 23:20

最近博客热门TAG

Java(141747) C(73651) C++(68608) SQL(64571) C#(59609) XML(59133) HTML(59043) JavaScript(54918) .net(54785) Web(54513) 工作(54116) Linux(50906) Oracle(49876) 应用服务器(43288) Spring(40812) 编程(39454) Windows(39381) JSP(37542) MySQL(37268) 数据结构(36423)

博客人气排行榜

    博客电子书下载排行

      >>浏览更多下载

      相关资讯

      相关讨论

      Global site tag (gtag.js) - Google Analytics