lucene大数据量的动态更新问题解决方式. 用内存

longgangbai

浏览: 7356695 次
性别:
来自: 上海

最近访客更多访客>>

liuqibo861129

sdcharles

paladin1988

ljq867

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

搜索引擎的开发应用

lucene 数据结构搜索引擎华为多线程

问题:
目前索引里面已经有1000多万的数据了，现在需要每几分钟就增量得添加新的内容到索引中。
但是，我发现新加入索引后，整个索引结构都要重新调整。非常耗时（长达半个小时）。

不知道大家有没有什么比较好的办法，加快这个过程？

回答:

我觉得用lucene做，一个原则索引里面尽量少存储，索引文件小了，optimize要移动的数据块也小。
还有Lucene实在不适合做实时，有一个办法，将新索引建在内存中，新建在内存上的searcher与硬盘索引searcher合并为MutliSearcher提供给前端搜索，内存到达一定量时再后台合并到主索引上，合并完成用新的Searcher替换MutliSearcher。
Lucene2.3已经放出来了，添加了很多新功能，可以去看看

大量索引的更方案: 索引分开, 周索引,月索引,全部索引

提高搜索性能方式

搜索
1、对于按创建时间的排序可以使用doc.id的方式
new SortField(null, SortField.DOC, reverse)排序方式尽量使用INT类型的字段
也就是按照写入索引的顺序排序
2、对于时间字符串的排序可以转换成整数进行排序
3、去掉不必要的parse
使用TermQuery替换
4、TermQuery和Term可以只保留一个实例
createTerm(text)
5、减少Doc到model的转换
索引出来String到Date的转换多余而且费时
直接使用Doc对象包装成JSONObject
6、MultiFieldQueryParser改成自己用boolean查询重构
7、减少请求参数的包装类
8、搜索排序方法可以作为常量
将sort参数变成int型，使用swich进行判断
10、使用HitCollector类来适应不同情况下，Hits的大小
新、旧接口
相关搜索接口
11、使用尽可能快的磁盘IO
12、日志，先写文件，每天批量入库
13、增量索引使用reopen
新的reopen()方法只会加载那些变更过的索引片断，而不是重新加载完整的索引。
14、setMergeFactor 在做实时索引的时候，可以设置的小一点
这样就会及时索引进去

索引
索引
1、t.termText()替换为new String(t.termBuffer(),0,t.termLength())
2、StringReader 和TokenStream对象都需要close
3、索引时Document只用一个、Field只用几个
一个Document对象对应多个Field实例
Field有新的setValue方法，动态改变属性
不能只有一个Field实例
例如：idField, bodyField
必须等Document都到索引中之后，才可以重新设置值
4、索引中Field的命名只使用2个字符表示
5、有些索引字段可以考虑使用0，1替代字符串，排序采用整数来排
6、减少索引的存储字段，一般只存ID
7、索引的时候只用一个IndexWriter对象
8、3.1版本有个新的方法writer.ramSizeInBytes()
根据RAM的使用情况，来决定是不需要刷新到磁盘。
之前：setMaxBufferedDocs
9、批量索引的时候，尽可能多使用一些内存，采用非复合的文件方式，完成后集中优化合并索引文件
fsWriter.addIndexesNoOptimize
fsWriter.setUseCompoundFile(false);
需要注意不要超过系统的允许打开文件数
10、重复使用单一的Token实例，在analyzer中。
11、Turn off auto-commit if there are stored fields and term vectors
设置autoCommit=false，直到writer close之后才会生效
默认是true
12、如果总是同时在多个分词的字段中查询，可以考虑将多个Field合并到一个Field中
13、增加mergeFactor，但是不要太大
反复调试获取经验值
14、关闭一些实际上没用的功能（不要存储一些不必要的字段，尽量不要打开term vectors）
15、使用更快的analyzer
16、加快获得document数据的速度
比如：从数据库、文件获取数据的速度
17、索引的时候可以考虑使用多线程
使用多线程addDocuments
需要测试，然后确定线程数
18、可以分开索引，然后合并
并行索引机制

分享到：

关于lucene的学习笔记liui :转关于luncene ... | lucene 自定义SORT

2009-03-17 15:55
浏览 4694
评论(7)
查看更多

7 楼 lazzyGaGa 2010-08-31

你好可不可以请教你个问题？

你说一个索引里面尽量少存储。

就是当文本文档不存储的情况下，要怎么做高亮好了，怎么提取摘要？

谢谢！！

呵呵经常关注你博客！

6 楼 longgangbai 2010-08-08

一两个月不上JE突然发现JE中某一些人就是喜欢装X，讨论个问题就要么是进行人身攻击之类，要么是谩骂别人。。。JE杯具。。。

5 楼 longgangbai 2010-08-08

riching 写道

有个问题请教一下，每天的索引有2G，如果每次查询跨度是一个月，查询方式应该怎么设计？

如果你的数据每天有2G，其实你的问题可以采用分布式的，先各个建立索引然后合并一起索引，但是这个也不是必需的。。也可以由其他方式：如有的网站采用多个搜索引擎分别检索查询，然后合并一起。。

4 楼 longgangbai 2010-08-08

sealbird 写道

不了解lucene就不要说不适合做适时的

我不敢说了解多少，但是我以前在华为移动项目中使用，现在经常关注这方面，我也知道一些大的搜索引擎也不是天天实时更新的如果google等，google大约28天整体搜索一次。
针对基于数据库中数据的搜索引擎那么就实时更新很正常如采用compass等。

3 楼 sealbird 2010-08-03

1 楼 riching 2010-07-17 引用
有个问题请教一下，每天的索引有2G，如果每次查询跨度是一个月，查询方式应该怎么设计？
数据量蛮大的,不知是新增的的多还是更新的多,如果有这么大的数量,考虑用分布式了,以后可以动态增加机器

2 楼 sealbird 2010-08-03

不了解lucene就不要说不适合做适时的

1 楼 riching 2010-07-17

有个问题请教一下，每天的索引有2G，如果每次查询跨度是一个月，查询方式应该怎么设计？

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论