`

深入学习Heritrix---解析Frontier(链接工厂)

阅读更多
Frontier是Heritrix最核心的组成部分之一,也是最复杂的组成部分.它主要功能是为处理链接的线程提供URL,并负责链接处理完成后的一些后续调度操作.并且为了提高效率,它在内部使用了Berkeley DB.本节将对它的内部机理进行详细解剖.

在Heritrix的官方文档上有一个Frontier的例子,虽然很简单,但是它却解释Frontier实现的基本原理.在这里就不讨论,有兴趣的读者可以参考相应文档.但是不得不提它的三个核心方法:
(1)next(int timeout):为处理线程提供一个链接.Heritrix的所有处理线程(ToeThread)都是通过调用该方法获取链接的.

(2)schedule(CandidateURI caURI):调度待处理的链接.
(3)finished(CrawlURI cURI):完成一个已处理的链接.
整体结构如下:
BdbMultipleWorkQueues:
它是对Berkeley DB的简单封装.在内部有一个Berkeley Database,存放所有待处理的链接.
 

package org.archive.crawler.frontier;
public class BdbMultipleWorkQueues 
{
//存放所有待处理的URL的数据库
    private Database pendingUrisDB = null;


 
//由key获取一个链接
    public CrawlURI get(DatabaseEntry headKey)
    
throws DatabaseException {
        DatabaseEntry result 
= new DatabaseEntry();
        
        
// From Linda Lee of sleepycat:
        
// "You want to check the status returned from Cursor.getSearchKeyRange
        
// to make sure that you have OperationStatus.SUCCESS. In that case,
        
// you have found a valid data record, and result.getData()
        
// (called by internally by the binding code, in this case) will be
        
// non-null. The other possible status return is
        
// OperationStatus.NOTFOUND, in which case no data record matched
        
// the criteria. "
        
//由key获取相应的链接
        OperationStatus status = getNextNearestItem(headKey, result);
        CrawlURI retVal 
= null;
        
if (status != OperationStatus.SUCCESS) {
            LOGGER.severe(
"See '1219854 NPE je-2.0 "
                    
+ "entryToObject'. OperationStatus "
                    
+ " was not SUCCESS: "
                    
+ status
                    
+ ", headKey "
                    
+ BdbWorkQueue.getPrefixClassKey(headKey.getData()));
            
return null;
        }

        
try {
            retVal 
= (CrawlURI)crawlUriBinding.entryToObject(result);
        }
 catch (RuntimeExceptionWrapper rw) {
            LOGGER.log(
                Level.SEVERE,
                
"expected object missing in queue " +
                BdbWorkQueue.getPrefixClassKey(headKey.getData()),
                rw);
            
return null
        }

        retVal.setHolderKey(headKey);
        
return retVal;//返回链接
    }


    
//从等处理列表获取一个链接
    protected OperationStatus getNextNearestItem(DatabaseEntry headKey,
            DatabaseEntry result) 
throws DatabaseException {
        Cursor cursor 
= null;
        OperationStatus status;
        
try {
            
//打开游标
            cursor = this.pendingUrisDB.openCursor(nullnull);
            
// get cap; headKey at this point should always point to 
            
// a queue-beginning cap entry (zero-length value)
            status = cursor.getSearchKey(headKey, result, null);
            
if(status!=OperationStatus.SUCCESS || result.getData().length > 0{
                
// cap missing
                throw new DatabaseException("bdb queue cap missing");
            }

            
// get next item (real first item of queue)
            status = cursor.getNext(headKey,result,null);
        }
 finally 
            
if(cursor!=null{
                cursor.close();
            }

        }

        
return status;
    }


 
/**
     * Put the given CrawlURI in at the appropriate place. 
     * 添加URL到数据库
     * 
@param curi
     * 
@throws DatabaseException
     
*/

    
public void put(CrawlURI curi, boolean overwriteIfPresent) 
    
throws DatabaseException {
        DatabaseEntry insertKey 
= (DatabaseEntry)curi.getHolderKey();
        
if (insertKey == null{
            insertKey 
= calculateInsertKey(curi);
            curi.setHolderKey(insertKey);
        }

        DatabaseEntry value 
= new DatabaseEntry();
        crawlUriBinding.objectToEntry(curi, value);
        
// Output tally on avg. size if level is FINE or greater.
        if (LOGGER.isLoggable(Level.FINE)) {
            tallyAverageEntrySize(curi, value);
        }

        OperationStatus status; 
        
if(overwriteIfPresent) {
            
//添加
            status = pendingUrisDB.put(null, insertKey, value);
        }
 else {
            status 
= pendingUrisDB.putNoOverwrite(null, insertKey, value);
        }

        
if(status!=OperationStatus.SUCCESS) {
            LOGGER.severe(
"failed; "+status+ " "+curi);
        }

    }

    
}
 BdbWorkQueue:
代表一个链接队列,该队列中所有的链接都具有相同的键值.它实际上是通过调用BdbMultipleWorkQueues的get方法从等处理链接数据库中取得一个链接的.

package org.archive.crawler.frontier;

public class BdbWorkQueue extends WorkQueue
implements Comparable, Serializabl
{
//获取一个URL
    protected CrawlURI peekItem(final WorkQueueFrontier frontier)
    
throws IOException {
        
/**
         * 关键:从BdbFrontier中返回pendingUris
         
*/
        
final BdbMultipleWorkQueues queues = ((BdbFrontier) frontier)
            .getWorkQueues();
        
        DatabaseEntry key 
= new DatabaseEntry(origin);
        CrawlURI curi 
= null;
        
int tries = 1;
        
while(true) {
            
try {
                
//获取链接
                curi = queues.get(key);
            } 
catch (DatabaseException e) {
                LOGGER.log(Level.SEVERE,
"peekItem failure; retrying",e);
            }
         
    
return curi;
    }
}
 WorkQueueFrontier:
实现了最核心的三个方法.

public CrawlURI next()
    
throws InterruptedException, EndedException {
        
while (true) { // loop left only by explicit return or exception
            long now = System.currentTimeMillis();

            
// Do common checks for pause, terminate, bandwidth-hold
            preNext(now);
            
            
synchronized(readyClassQueues) {
                
int activationsNeeded = targetSizeForReadyQueues() - readyClassQueues.size();
                
while(activationsNeeded > 0 && !inactiveQueues.isEmpty()) {
                    activateInactiveQueue();
                    activationsNeeded
--;
                }
            }
                   
            WorkQueue readyQ 
= null;
            Object key 
= readyClassQueues.poll(DEFAULT_WAIT,TimeUnit.MILLISECONDS);
            
if (key != null) {
                readyQ 
= (WorkQueue)this.allQueues.get(key);
            }
            
if (readyQ != null) {
                
while(true) { // loop left by explicit return or break on empty
                    CrawlURI curi = null;
                    
synchronized(readyQ) {
                        
/**取出一个URL,最终从子类BdbFrontier的
                         * pendingUris中取出一个链接
                         
*/
                        curi 
= readyQ.peek(this);                     
                        
if (curi != null) {
                            
// check if curi belongs in different queue
                            String currentQueueKey = getClassKey(curi);
                            
if (currentQueueKey.equals(curi.getClassKey())) {
                                
// curi was in right queue, emit
                                noteAboutToEmit(curi, readyQ);
                                
//加入正在处理队列中
                                inProcessQueues.add(readyQ);
                                
return curi; //返回
                            }
                            
// URI's assigned queue has changed since it
                            
// was queued (eg because its IP has become
                            
// known). Requeue to new queue.
                            curi.setClassKey(currentQueueKey);
                            readyQ.dequeue(
this);//出队列
                            decrementQueuedCount(1);
                            curi.setHolderKey(
null);
                            
// curi will be requeued to true queue after lock
                            
//  on readyQ is released, to prevent deadlock
                        } else {
                            
// readyQ is empty and ready: it's exhausted
                            
// release held status, allowing any subsequent 
                            
// enqueues to again put queue in ready
                            readyQ.clearHeld();
                            
break;
                        }
                    }
                    
if(curi!=null) {
                        
// complete the requeuing begun earlier
                        sendToQueue(curi);
                    }
                }
            } 
else {
                
// ReadyQ key wasn't in all queues: unexpected
                if (key != null) {
                    logger.severe(
"Key "+ key +
                        
" in readyClassQueues but not allQueues");
                }
            }

            
if(shouldTerminate) {
                
// skip subsequent steps if already on last legs
                throw new EndedException("shouldTerminate is true");
            }
                
            
if(inProcessQueues.size()==0) {
                
// Nothing was ready or in progress or imminent to wake; ensure 
                
// any piled-up pending-scheduled URIs are considered
                this.alreadyIncluded.requestFlush();
            }    
        }
    }


//将URL加入待处理队列
    public void schedule(CandidateURI caUri) {
        
// Canonicalization may set forceFetch flag.  See
        
// #canonicalization(CandidateURI) javadoc for circumstance.
        String canon = canonicalize(caUri);
        
if (caUri.forceFetch()) {
            alreadyIncluded.addForce(canon, caUri);
        } 
else {
            alreadyIncluded.add(canon, caUri);
        }
    }
 
 
BdbFrontier:
继承了WorkQueueFrontier,是Heritrix唯一个具有实际意义的链接工厂.

package org.archive.crawler.frontier;
public class BdbFrontier extends WorkQueueFrontier implements Serializable 
{
    
/** 所有待抓取的链接*/
    
protected transient BdbMultipleWorkQueues pendingUris;

    
//初始化pendingUris,父类为抽象方法
    protected void initQueue() throws IOException {
        
try {
            
this.pendingUris = createMultipleWorkQueues();
        } 
catch(DatabaseException e) {
            
throw (IOException)new IOException(e.getMessage()).initCause(e);
        }
    }

   
private BdbMultipleWorkQueues createMultipleWorkQueues()
    
throws DatabaseException {
        
return new BdbMultipleWorkQueues(this.controller.getBdbEnvironment(),
            
this.controller.getBdbEnvironment().getClassCatalog(),
            
this.controller.isCheckpointRecover());
    }
    
protected BdbMultipleWorkQueues getWorkQueues() {
        
return pendingUris;
    }


}
BdbUriUniqFilter:
实际上是一个过滤器,它用来检查一个要进入等待队列的链接是否已经被抓取过.

//添加URL
    protected boolean setAdd(CharSequence uri) {
        DatabaseEntry key 
= new DatabaseEntry();
        LongBinding.longToEntry(createKey(uri), key);
        
long started = 0;
        
        OperationStatus status 
= null;
        
try {
            
if (logger.isLoggable(Level.INFO)) {
                started 
= System.currentTimeMillis();
            }
            
//添加到数据库
            status = alreadySeen.putNoOverwrite(null, key, ZERO_LENGTH_ENTRY);
            
if (logger.isLoggable(Level.INFO)) {
                aggregatedLookupTime 
+=
                    (System.currentTimeMillis() 
- started);
            }
        } 
catch (DatabaseException e) {
            logger.severe(e.getMessage());
        }
        
if (status == OperationStatus.SUCCESS) {
            count
++;
            
if (logger.isLoggable(Level.INFO)) {
                
final int logAt = 10000;
                
if (count > 0 && ((count % logAt) == 0)) {
                    logger.info(
"Average lookup " +
                        (aggregatedLookupTime 
/ logAt) + "ms.");
                    aggregatedLookupTime 
= 0;
                }
            }
        }
        
//如果存在,返回false
        if(status == OperationStatus.KEYEXIST) {
            
return false// not added
        } else {
            
return true;
        }
    }
分享到:
评论

相关推荐

    避开10大常见坑:DeepSeekAPI集成中的错误处理与调试指南.pdf

    在日常的工作和学习中,你是否常常为处理复杂的数据、生成高质量的文本或者进行精准的图像识别而烦恼?DeepSeek 或许就是你一直在寻找的解决方案!它以其高效、智能的特点,在各个行业都展现出了巨大的应用价值。然而,想要充分发挥 DeepSeek 的优势,掌握从入门到精通的知识和技能至关重要。本文将从实际应用的角度出发,为你详细介绍 DeepSeek 的基本原理、操作方法以及高级技巧。通过系统的学习,你将能够轻松地运用 DeepSeek 解决实际问题,提升工作效率和质量,让自己在职场和学术领域脱颖而出。现在,就让我们一起开启这场实用又高效的学习之旅吧!

    前端分析-2023071100789

    前端分析-2023071100789

    基于kinect的3D人体建模C++完整代码.cpp

    基于kinect的3D人体建模C++完整代码.cpp

    搞机工具箱10.1.0.7z

    搞机工具箱10.1.0.7z

    GRU+informer时间序列预测(Python完整源码和数据)

    GRU+informer时间序列预测(Python完整源码和数据),python代码,pytorch架构,适合各种时间序列直接预测。 适合小白,注释清楚,都能看懂。功能如下: 代码基于数据集划分为训练集测试集。 1.多变量输入,单变量输出/可改多输出 2.多时间步预测,单时间步预测 3.评价指标:R方 RMSE MAE MAPE,对比图 4.数据从excel/csv文件中读取,直接替换即可。 5.结果保存到文本中,可以后续处理。 代码带数据,注释清晰,直接一键运行即可,适合新手小白。

    性价比革命:DeepSeekAPI成本仅为GPT-4的3%的技术揭秘.pdf

    在日常的工作和学习中,你是否常常为处理复杂的数据、生成高质量的文本或者进行精准的图像识别而烦恼?DeepSeek 或许就是你一直在寻找的解决方案!它以其高效、智能的特点,在各个行业都展现出了巨大的应用价值。然而,想要充分发挥 DeepSeek 的优势,掌握从入门到精通的知识和技能至关重要。本文将从实际应用的角度出发,为你详细介绍 DeepSeek 的基本原理、操作方法以及高级技巧。通过系统的学习,你将能够轻松地运用 DeepSeek 解决实际问题,提升工作效率和质量,让自己在职场和学术领域脱颖而出。现在,就让我们一起开启这场实用又高效的学习之旅吧!

    基于ANSYS LSDyna的DEM-SPH-FEM耦合模拟滑坡入水动态行为研究,基于ANSYS LSDyna的DEM-SPH-FEM耦合的滑坡入水模拟分析研究,基于ansys lsdyna的滑坡入水

    基于ANSYS LSDyna的DEM-SPH-FEM耦合模拟滑坡入水动态行为研究,基于ANSYS LSDyna的DEM-SPH-FEM耦合的滑坡入水模拟分析研究,基于ansys lsdyna的滑坡入水模拟dem-sph-fem耦合 ,基于ANSYS LSDyna; 滑坡入水模拟; DEM-SPH-FEM 耦合,基于DEM-SPH-FEM耦合的ANSYS LSDyna滑坡入水模拟

    auto_gptq-0.6.0-cp311-cp311-manylinux_2_17_x86_64.manylinux2014_x86_64.whl

    auto_gptq-0.6.0-cp311-cp311-manylinux_2_17_x86_64.manylinux2014_x86_64.whl

    复件 复件 建设工程可行性研究合同[示范文本].doc

    复件 复件 建设工程可行性研究合同[示范文本].doc

    13考试真题最近的t64.txt

    13考试真题最近的t64.txt

    Microsoft Visual C++ 2005 SP1 Redistributable PackageX86

    好用我已经解决报错问题

    嵌入式开发入门:用C语言点亮LED灯的全栈开发指南.pdf

    # 踏入C语言的奇妙编程世界 在编程的广阔宇宙中,C语言宛如一颗璀璨恒星,以其独特魅力与强大功能,始终占据着不可替代的地位。无论你是编程小白,还是有一定基础想进一步提升的开发者,C语言都值得深入探索。 C语言的高效性与可移植性令人瞩目。它能直接操控硬件,执行速度快,是系统软件、嵌入式开发的首选。同时,代码可在不同操作系统和硬件平台间轻松移植,极大节省开发成本。 学习C语言,能让你深入理解计算机底层原理,培养逻辑思维和问题解决能力。掌握C语言后,再学习其他编程语言也会事半功倍。 现在,让我们一起开启C语言学习之旅。这里有丰富教程、实用案例、详细代码解析,助你逐步掌握C语言核心知识和编程技巧。别再犹豫,加入我们,在C语言的海洋中尽情遨游,挖掘无限可能,为未来的编程之路打下坚实基础!

    auto_gptq-0.4.2-cp38-cp38-win_amd64.whl

    auto_gptq-0.4.2-cp38-cp38-win_amd64.whl

    自动立体库设计方案.pptx

    自动立体库设计方案.pptx

    手把手教你用C语言实现贪吃蛇游戏:从算法设计到图形渲染.pdf

    # 踏入C语言的奇妙编程世界 在编程的广阔宇宙中,C语言宛如一颗璀璨恒星,以其独特魅力与强大功能,始终占据着不可替代的地位。无论你是编程小白,还是有一定基础想进一步提升的开发者,C语言都值得深入探索。 C语言的高效性与可移植性令人瞩目。它能直接操控硬件,执行速度快,是系统软件、嵌入式开发的首选。同时,代码可在不同操作系统和硬件平台间轻松移植,极大节省开发成本。 学习C语言,能让你深入理解计算机底层原理,培养逻辑思维和问题解决能力。掌握C语言后,再学习其他编程语言也会事半功倍。 现在,让我们一起开启C语言学习之旅。这里有丰富教程、实用案例、详细代码解析,助你逐步掌握C语言核心知识和编程技巧。别再犹豫,加入我们,在C语言的海洋中尽情遨游,挖掘无限可能,为未来的编程之路打下坚实基础!

    性能对决:DeepSeek-V3与ChatGPTAPI在数学推理场景的基准测试.pdf

    在日常的工作和学习中,你是否常常为处理复杂的数据、生成高质量的文本或者进行精准的图像识别而烦恼?DeepSeek 或许就是你一直在寻找的解决方案!它以其高效、智能的特点,在各个行业都展现出了巨大的应用价值。然而,想要充分发挥 DeepSeek 的优势,掌握从入门到精通的知识和技能至关重要。本文将从实际应用的角度出发,为你详细介绍 DeepSeek 的基本原理、操作方法以及高级技巧。通过系统的学习,你将能够轻松地运用 DeepSeek 解决实际问题,提升工作效率和质量,让自己在职场和学术领域脱颖而出。现在,就让我们一起开启这场实用又高效的学习之旅吧!

    从零到一:手把手教你用Python调用DeepSeekAPI的完整指南.pdf

    在日常的工作和学习中,你是否常常为处理复杂的数据、生成高质量的文本或者进行精准的图像识别而烦恼?DeepSeek 或许就是你一直在寻找的解决方案!它以其高效、智能的特点,在各个行业都展现出了巨大的应用价值。然而,想要充分发挥 DeepSeek 的优势,掌握从入门到精通的知识和技能至关重要。本文将从实际应用的角度出发,为你详细介绍 DeepSeek 的基本原理、操作方法以及高级技巧。通过系统的学习,你将能够轻松地运用 DeepSeek 解决实际问题,提升工作效率和质量,让自己在职场和学术领域脱颖而出。现在,就让我们一起开启这场实用又高效的学习之旅吧!

    为什么你的switch总出bug?90%新手不知道的break语句隐藏规则.pdf

    # 踏入C语言的奇妙编程世界 在编程的广阔宇宙中,C语言宛如一颗璀璨恒星,以其独特魅力与强大功能,始终占据着不可替代的地位。无论你是编程小白,还是有一定基础想进一步提升的开发者,C语言都值得深入探索。 C语言的高效性与可移植性令人瞩目。它能直接操控硬件,执行速度快,是系统软件、嵌入式开发的首选。同时,代码可在不同操作系统和硬件平台间轻松移植,极大节省开发成本。 学习C语言,能让你深入理解计算机底层原理,培养逻辑思维和问题解决能力。掌握C语言后,再学习其他编程语言也会事半功倍。 现在,让我们一起开启C语言学习之旅。这里有丰富教程、实用案例、详细代码解析,助你逐步掌握C语言核心知识和编程技巧。别再犹豫,加入我们,在C语言的海洋中尽情遨游,挖掘无限可能,为未来的编程之路打下坚实基础!

    用deepseek变现实操流程

    用deepseek变现实操流程,小白必看。

    10个必知的DeepSeekAPI调用技巧:从鉴权到限流全解析.pdf

    在日常的工作和学习中,你是否常常为处理复杂的数据、生成高质量的文本或者进行精准的图像识别而烦恼?DeepSeek 或许就是你一直在寻找的解决方案!它以其高效、智能的特点,在各个行业都展现出了巨大的应用价值。然而,想要充分发挥 DeepSeek 的优势,掌握从入门到精通的知识和技能至关重要。本文将从实际应用的角度出发,为你详细介绍 DeepSeek 的基本原理、操作方法以及高级技巧。通过系统的学习,你将能够轻松地运用 DeepSeek 解决实际问题,提升工作效率和质量,让自己在职场和学术领域脱颖而出。现在,就让我们一起开启这场实用又高效的学习之旅吧!

Global site tag (gtag.js) - Google Analytics