lucene索引和搜索过程中的核心类介绍

yuyiming1986

浏览: 64368 次
性别:
来自: 成都

最近访客更多访客>>

zhuxinyu

wmlwml0000

bjforevermuyb

Liu.Guo.Zhu

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

lucene

lucene

lucene索引和搜索过程中的核心类介绍

lucene是一个工具包，一个Java类库,是一个1M多的jar文件，并不是一个完整的搜索程序，Lucene只专注于文本的索引和搜索功能，它能够让应用程序在不需要了解复杂的索引和搜索的实现的情况下，通过调用简单封装API，为应用程序添加上搜索功能。

1.执行简单的索引过程需要用到以下几个类:IndexWriter Directory Analyzer Document Field

IndexWriter:(写索引)是索引过程的核心组件，这个类负责创建新的索引或者打开已有索引，以及向索引中添加，删除或者更新被索引的信息。可以把IndexWriter当作一个提供针对索引文件的写入操作，但不能用于读取或者搜索索引。IndexWriter需要开辟一定空间来存储索引，此功能可以由Directory完成.

Directory:用来描述Lucene索引的存放位置。它是一个抽象类，它的子类负责具体指定索引的存储路径，可以使用FSDirectory.open()方法来获取真实文件在文件系统中的存储路径。

Analyzer:IndexWriter不能直接索引文本，文本首先需要被分词成词汇单元，而Analyzer负责从被索引文本文件中提取词汇单元，并进行一些处理，比如说，剔出停用词(a, the ,this对搜索无意义的词),如果被索引内容不是纯文本文档，需要首先将其转换成文本文档格式。(索引本质上就是词汇单元到文件之间的映射，所以建立索引和搜索索引处理的都是词汇单元).

Document:用来描述文档的，这里的文档可以指一个 HTML 页面，一封电子邮件，或者是一个文本文件。一个 Document 对象由多个 Field 对象组成的。可以把一个 Document 对象想象成数据库中的一个记录，而每个 Field 对象就是记录的一个字段。

Field:索引中每个文档都包含一个或者多个不同的域，这个域就是Field,而每个域都有一个域名和对应的域值。Field 对象是用来描述一个文档的某个属性的，比如一封电子邮件的标题和内容可以用两个 Field 对象分别描述。

2.执行简单的搜索过程需要用到以下几个类:IndexSearch, Term, Query, TermQuery,TopDocs

IndexSearch:类用于搜索IndexWriter类创建的索引

TermQuery:是Lucene提供的最基本的查询类型,Query的子类，用来匹配指定域中包含特定项的文档。生成一个TermQuery对象由如下语句完成： TermQuery termQuery = new TermQuery(new Term(“fieldName”,”queryWord”)); 它的构造函数只接受一个参数，那就是一个Term对象。

Query:这是一个抽象类，它有多个实现，比如TermQuery, BooleanQuery, PrefixQuery. 这个类的目的是把用户输入的查询字符串封装成Lucene能够识别的Query。

Term:Term 是搜索的基本单位，一个Term对象有两个String类型的域组成。生成一个Term对象可以有如下一条语句来完成：Term term = new Term(“fieldName”,”queryWord”); 其中第一个参数代表了要在文档的哪一个Field上进行查找，第二个参数代表了要查询的关键词

TopDocs:用来保存搜索结果，是一个简单的指针容器，指针一般指向前N个排名的搜索结果.TopDocs会记录前N个结果中每个结果的int docID和浮点型分数。

分享到：