Lucene Payload 的研究与应用<一>

sealbird

浏览: 602471 次
性别:
来自: 广州

最近访客更多访客>>

ladies_killer

wbsh583

u012363178

dilimic120

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

lucene 全文检索数据结构 IBM 搜索引擎

http://www.ibm.com/developerworks/cn/opensource/os-cn-lucene-pl/index.htmlLucene Payload 的研究与应用

文档选项
打印本页

   将此页作为电子邮件发送

级别：初级

杨筱强 (yangxq@cn.ibm.com), 软件工程师, IBM
马蕤 (marui@cn.ibm.com), 软件工程师, IBM
赵胜 (zhaos@cn.ibm.com), WebSphere Information Integrator部门经理, IBM中国软件开发中心

2008 年 11 月 06 日

Payload (元数据) 诞生于 Lucene 的2.2 版本，它是在 Lucene 2.1 索引文件格式的基础上扩展而来，提供了一种可以灵活配置的高级索引技术，在某些特定应用场景下能优化基于 Lucene 构建的应用的搜索性能。本文重点研究了 Payload 的实现原理、索引结构的变化、接口 API ，在本文的最后举例说明了 Payload 是如何帮助改善搜索体验的。
Lucene 是最初是由 Douglass R. Cutting 博士发布在自己主页上的一个 Java 全文信息检索工具包，后来成为 Apache Jakarta 家族中的一个开源项目，目前已经成为 Apache 基金会的顶级项目。索引是现代搜索引擎的核心，建立索引的过程就是把源数据处理成方便查询的索引文件的过程。 Lucene 采用的是一种被称为倒排索引 (Inverted Index) 的机制，倒排索引也是大多现代搜索引擎的基础。

Payload (元数据) 诞生于 Lucene 的2.2 版本，它是在 Lucene 2.1 索引文件格式的基础上扩展而来，提供了一种可以灵活配置的高级索引技术。本文重点研究了 Payload 的实现原理、索引结构的变化、接口 API ，在本文的最后举例说明了 Payload 是如何帮助改善搜索体验的。

Payload 的出现

倒排索引就是说我们维护了一个词条表，对于这个表中的每个词条，都有一个链表描述了有哪些文档包含了这个词条。假定我们有三篇文档 D0，D1，D2：

D0 = "it is what it is"
D1 = "what is it"
D2 = "it is a banana"

那么，我们可以创建如下倒排索引结构：

Term      Posting-list
"a":      {2}
"banana": {2}
"is":     {0, 1, 2}
"it":     {0, 1, 2}
"what":   {0, 1}

一般情况下，将一个词条所索引的文档（一般用文档编号表示）称之为 Posting，那么一个词条索引的多个文档就称之为 Posting-list。除了在 Posting-list 中记录文档编号，Lucene 也在Posting-list 中添加了词频和位置信息。词频的添加有助于结果的排序，位置信息的添加解决了短语检索的问题。

在Lucene 2.1 中，记录位置信息的即 .prx 文件，它的格式如下：

ProxFile (.prx) --> <TermPositions> TermCount
TermPositions --> <Positions> DocFreq
Positions --> <PositionDelta> Freq
PositionDelta --> VInt

仔细观察我们可以发现，文档 D0 中 what 词条是加粗显示而文档 D1 中的 what 则没有。显然，Lucene 2.1 的索引结构是无法表示出两者的差异。为了解决这个问题，从 Lucene2.2 开始，引入了 Payload 的概念。 Payload 即词条 (Term) 的元数据或称载荷， Lucene 支持用户在索引的过程中将词条的元数据添加的索引库中，同时也提供了在检索结果时读取 Payload 信息的功能。Payload 的诞生为用户提供了一种可灵活配置的高级索引技术，为支持更加丰富的搜索体验创造了条件。

那么 Lucene 是如何改进索引文件以支持 Payload 功能的呢？

回页首

索引结构的变化

为了更加形象的描述改进后的索引结构，我们用不同的颜色表示出文档 ID ，词频，位置和 Payload，如图 1 所示，（U表示下划线，B表示粗体）

图 1：Lucene的索引结构

对比 Lucene2.1 的索引结构，Lucene2.2 的索引结构的表达式如下：

ProxFile (.prx) --> <TermPositions> TermCount
TermPositions --> <Positions> DocFreq
Positions --> <PositionDelta,Payload?> Freq
Payload --> <PayloadLength?,PayloadData>
PositionDelta --> VInt
PayloadLength --> VInt
PayloadData --> bytePayloadLength

从上面的索引表达式中可以看出只有当一个词汇包含 Payload 信息时，Lucene 才会为之分配相应的 Payload 存储空间，这是一种高效率的空间实现。Lucene2.2 之后的 Payload 特指词条的元数据，那么文档的元数据如何表示呢?

我们知道，Lucene 中 Document 由 Field 组成，而 Field 由 Term 组成，文档的 Payload 可以用存储的 Field 表示。这样存在的问题是，如果需要读取大量的文档的元数据，因为 Field 的索引信息与存储信息是分开的，那么 I/O 效率将是较差的。而 Payload 信息则是直接存储在索引中，因此可以利用词条的 Payload 功能存储文档级别的元数据。文档级 Payload 可表示为如下图2所示格式（省略了词频和位置信息）：

图 2：文档级的 Payload 表示

如图2所示，以文档的 url 信息为例，通过为每一个文档构造一个特殊的词条 ”url” ，将每个文档的 ur l值作为 payload 信息，把 Payload 与文档编号关联起来，这样就可以实现文档级的 Payload。

回页首

Payload 相关的 API

从 Lucene2.2 的索引结构可以看出，Payload 的存储与词条的位置信息是紧密联系在一起的，因此 Payload 的存储和检索 API 位于Token类和 TermPositions 类当中。

向词条中存储 Payload 信息

org.apache.lucene.analysis.Token
void setPayload(Payload payload)

Payload 信息的构造函数

org.apache.lucene.index.Payload
Payload(byte[] data)

Payload(byte[] data,
        int offset,
        int length)

从位置信息中检索 Payload

org.apache.lucene.index.TermPositions
boolean next();
int doc()
int freq();

int nextPosition();

int getPayloadLength();
byte[] getPayload(byte[] data,
                  int offset)

回页首

Payload 的应用场景举例

场景一：改进的 Lucene 的区间检索

日期检索是区间检索的常见例子，如用户需要在图书馆中检索特定年代的图书，满足如下条件：

Date>1954/08/01 & Date<1955/08/01

常见的做法就是将日期作为一个独立 Field 进行存储，利用 RangeQuery 进行区间检索，Posting-list 的格式如图3中左图所示。如果图书日期分布区间很广，用 Field 存储日期信息，我们需要将日期细化到年月日进行存储，因此词条数目是非常庞大的。这种情况下，我们可以利用 Payload 功能来减少词条的数目，提高检索效率，可以将日期的年月作为词条，日作为 Payload 信息，这几乎将词条数目减小了近 30 倍，改进后的存储结构如图3右图所示：

图 3：使用 Payload 存储日期信息

场景二：提高特定词汇的评分

利用 Payload 功能，还可以提高文档中特定词汇的评分，如黑体词汇、斜体词汇等，从而优化搜索结果排序。

下面还以文档 D0 和 D1 为例说明如何设置和检索 Payload。

D0 = "it is what it is"
D1 = "what is it"

Step1：在 Analyzer 处理过程中，为特殊词汇添加评分 Payload

final byte BoldBoost = 5;

final byte ItalicBoost = 5;
…
Token token = new Token(…);
…
if (isBold) {//如果是黑体字
token.setPayload(
    new Payload(new byte[] {BoldBoost}));
}else if（isItalic）{//如果是斜体字
token.setPayload(
    new Payload(new byte[] { ItalicBoost }));
}
…
return token;

Step2：重写 Similarity （主要负责排名和评分）

Similarity boostingSimilarity =
new DefaultSimilarity() {
    // @override
    public float scorePayload(byte [] payload,
                              int offset,
                              int length) {

      //读取payload的值，payload存储的即为词汇的评分。
      if (length == 1) return payload[offset];
    };

Step3：使用重写的 boostingSimilarity 进行检索

Query btq = new BoostingTermQuery(
                new Term(“field”, “what”));

Searcher searcher = new IndexSearcher(…);
Searcher.setSimilarity(boostingSimilarity);
…
Hits hits = searcher.search(btq);

分享到：

javascript图片浏览器的核心——图片预加载 ... | lucene搜索结果排序之Payload

2010-08-06 10:36
浏览 939
评论(0)
分类:编程语言
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

Lucene5学习之TermVector项向量: 通过阅读博文链接<https://iamyida.iteye.com/blog/2201196>，我们可以更深入地探讨如何在实践中使用这一特性，解决实际的搜索问题。同时，熟悉源码能够帮助我们更好地理解Lucene内部的工作机制，以便于定制化开发和...

lucene原理分析: #### 一、Lucene概述与核心组件 **Lucene**是一款高性能、全功能的全文搜索引擎库，由Java编写而成。它能够为应用系统提供强大的搜索功能，而无需开发者深入理解信息检索理论。Lucene的核心组件包括以下几个方面： ...

计算机硬件控制_驱动级键盘鼠标同步_PS2接口UDP协议多机协同_基于rabirdwinio和pynput的跨设备输入共享系统_实现多台Windows电脑的键盘鼠标同步操作_支持.zip: 计算机硬件控制_驱动级键盘鼠标同步_PS2接口UDP协议多机协同_基于rabirdwinio和pynput的跨设备输入共享系统_实现多台Windows电脑的键盘鼠标同步操作_支持

嵌入式八股文面试题库资料知识宝典-TCPIP协议栈.zip: 嵌入式八股文面试题库资料知识宝典-TCPIP协议栈.zip

少儿编程scratch项目源代码文件案例素材-开膛手杰克.zip: 少儿编程scratch项目源代码文件案例素材-开膛手杰克.zip

基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型: 基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型，个人经导师指导并认可通过的高分设计项目，评审分99分，代码完整确保可以运行，小白也可以亲自搞定，主要针对计算机相关专业的正在做大作业的学生和需要项目实战练习的学习者，可作为毕业设计、课程设计、期末大作业，代码资料完整，下载可用。基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现遥感图像滑坡识别源码+数据集+训练好的模型基于深度学习CNN网络+pytorch框架实现

电力弹簧技术在主动配电网规划与运行优化调度中的应用研究: 内容概要：本文详细探讨了电力弹簧技术在主动配电网规划及运行优化调度中的应用。首先介绍了电力弹簧技术作为智能电网调控手段的优势，如自适应性强、响应速度快、节能环保等。接着阐述了主动配电网规划的目标和策略，包括优化电网结构、提高能源利用效率和降低故障风险。随后讨论了运行优化调度的原则和方法，强调了实时监测、智能调度策略以及优化调度模型的重要性。最后通过实际案例分析展示了电力弹簧技术在提升电网稳定性、可靠性和能效方面的显著效果，展望了其广阔的应用前景。适合人群：从事电力系统规划、运行管理的研究人员和技术人员，以及对智能电网感兴趣的学者和学生。使用场景及目标：适用于希望深入了解电力弹簧技术及其在主动配电网规划和运行优化调度中具体应用的专业人士。目标是掌握电力弹簧技术的工作原理、优势及其在实际项目中的实施方法。其他说明：本文不仅提供了理论分析，还有具体的案例支持，有助于读者全面理解电力弹簧技术的实际应用价值。

嵌入式八股文面试题库资料知识宝典-C语言思维导图.zip: 嵌入式八股文面试题库资料知识宝典-C语言思维导图.zip

电路教学与科研案例的结合—以最大功率传输定理为例.pdf: 电路教学与科研案例的结合—以最大功率传输定理为例.pdf

【HarmonyOS文件系统】分布式架构下的多设备协同与文件管理：构建万物互联新生态: 内容概要：本文深入介绍了HarmonyOS文件系统及其在万物互联时代的重要性。HarmonyOS自2019年发布以来，逐步覆盖多种智能设备，构建了庞大的鸿蒙生态。文件系统作为其中的“数字管家”，不仅管理存储资源，还实现多设备间的数据协同。文章详细介绍了常见的文件系统类型，如FAT、NTFS、UFS、EXT3和ReiserFS，各自特点和适用场景。特别强调了HarmonyOS的分布式文件系统（hmdfs），它通过分布式软总线技术，打破了设备界限，实现了跨设备文件的无缝访问。此外，文章对比了HarmonyOS与Android、iOS文件系统的差异，突出了其在架构、跨设备能力和安全性方面的优势。最后，从开发者视角讲解了开发工具、关键API及注意事项，并展望了未来的技术发展趋势和对鸿蒙生态的影响。适合人群：对操作系统底层技术感兴趣的开发者和技术爱好者，尤其是关注物联网和多设备协同的用户。使用场景及目标：①理解HarmonyOS文件系统的工作原理及其在多设备协同中的作用；②掌握不同文件系统的特性和应用场景；③学习如何利用HarmonyOS文件系统进行应用开发，提升跨设备协同和数据安全。阅读建议：本文内容详实，涵盖了从基础概念到高级开发技巧的多个层次，建议读者结合自身需求，重点关注感兴趣的部分，并通过实践加深理解。特别是开发者可参考提供的API示例和开发技巧，尝试构建基于HarmonyOS的应用。

嵌入式八股文面试题库资料知识宝典-海康嵌入式笔试题.zip: 嵌入式八股文面试题库资料知识宝典-海康嵌入式笔试题.zip

三电平有源电力滤波器仿真：基于瞬时无功功率理论的双闭环控制与SVPWM调制技术: 内容概要：本文详细介绍了基于瞬时无功功率理论的三电平有源电力滤波器（APF）仿真研究。主要内容涵盖并联型APF的工作原理、三相三电平NPC结构、谐波检测方法（ipiq）、双闭环控制策略（电压外环+电流内环PI控制）以及SVPWM矢量调制技术。仿真结果显示，在APF投入前后，电网电流THD从21.9%降至3.77%，显著提高了电能质量。适用人群：从事电力系统研究、电力电子技术开发的专业人士，尤其是对有源电力滤波器及其仿真感兴趣的工程师和技术人员。使用场景及目标：适用于需要解决电力系统中谐波污染和无功补偿问题的研究项目。目标是通过仿真验证APF的有效性和可行性，优化电力系统的电能质量。其他说明：文中提到的仿真模型涉及多个关键模块，如三相交流电压模块、非线性负载、信号采集模块、LC滤波器模块等，这些模块的设计和协同工作对于实现良好的谐波抑制和无功补偿至关重要。

基于环比增长的销售统计分析——2019年中青杯全国数学建模竞赛C题.pdf: 基于环比增长的销售统计分析——2019年中青杯全国数学建模竞赛C题.pdf

嵌入式八股文面试题库资料知识宝典-linux面试题.zip: 嵌入式八股文面试题库资料知识宝典-linux面试题.zip

嵌入式八股文面试题库资料知识宝典-linux常见面试题.zip: 嵌入式八股文面试题库资料知识宝典-linux常见面试题.zip

基于Matlab的小电流接地系统单相故障仿真分析及其应对策略研究: 内容概要：本文探讨了小电流接地系统在配电网络中的应用，特别是在单相故障情况下的仿真分析。文中介绍了小电流接地系统的背景和发展现状，重点讨论了两种常见的接地方式——中性点不接地和中性点经消弧线圈接地。利用Matlab作为仿真工具，作者构建了详细的电路模型，模拟了单相故障的发生过程，并通过多个结果图表展示了故障电流、电压波形及系统运行状态。此外，文章还包括了详细的设计说明书和PPT介绍，帮助读者全面理解仿真过程和技术细节。适合人群：从事电力系统研究、维护的技术人员，尤其是关注配电网络安全和稳定的工程师。使用场景及目标：适用于希望深入了解小电流接地系统的工作原理和故障处理机制的专业人士。通过本研究，读者可以掌握如何使用Matlab进行电力系统仿真，评估不同接地方式的效果，优化配电网络的安全性能。其他说明：随文附带完整的仿真工程文件、结果图、设计说明书及PPT介绍，便于读者进一步探索和实践。

少儿编程scratch项目源代码文件案例素材-激烈的殴斗.zip: 少儿编程scratch项目源代码文件案例素材-激烈的殴斗.zip

嵌入式八股文面试题库资料知识宝典-小米嵌入式软件工程师笔试题目解析.zip: 嵌入式八股文面试题库资料知识宝典-小米嵌入式软件工程师笔试题目解析.zip

车辆主动避撞技术：紧急制动与紧急转向策略及其临界安全距离分析: 内容概要：本文详细探讨了车辆主动避撞技术中的两种常见策略——纵向紧急制动避撞和横向紧急转向避撞。首先介绍了这两种避撞策略的基本概念，接着深入分析了临界纵向安全距离的概念及其对避撞模式选择的影响。文中特别强调了五次多项式换道轨迹模型在计算横向紧急转向避撞安全距离中的应用。最后，通过一个简化的程序实现了避撞策略的模拟和可视化展示，帮助读者更好地理解不同避撞方式的应用场景和技术细节。适合人群：汽车工程技术人员、交通安全研究人员、自动驾驶开发者。使用场景及目标：适用于研究和开发车辆主动避撞系统的专业人士，旨在提高对避撞策略的理解，优化避撞算法的设计，提升行车安全性。其他说明：文章不仅提供了理论分析，还结合了具体的数学模型和程序实现，使读者能够从多个角度全面掌握车辆避撞技术的关键要素。

基于MPPSK调制的数字对讲机系统.pdf: 基于MPPSK调制的数字对讲机系统.pdf

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论