最新文章列表

nutch inject 详解

nutch的inject 有二个job 第一个job 如下图 map :InjectMapper 功能如下   1  url是否有tab分割的k-v 对如果有记录下来, 2  如果配置了过滤使用 URLNormalizers和 URLFilters 对url 进行格式化和过滤, 3  如果过滤的url 不为空则创建CrawlDatum对象,状态 STATUS_INJECTED,设置fet ...
chengqianl 评论(0) 有1839人浏览 2012-07-16 14:27

最近博客热门TAG

Java(141744) C(73648) C++(68605) SQL(64561) C#(59606) XML(59133) HTML(59043) JavaScript(54917) .net(54783) Web(54511) 工作(54116) Linux(50906) Oracle(49867) 应用服务器(43287) Spring(40811) 编程(39452) Windows(39381) JSP(37540) MySQL(37267) 数据结构(36421)

博客人气排行榜

    博客电子书下载排行

      >>浏览更多下载

      相关资讯

      相关讨论

      Global site tag (gtag.js) - Google Analytics