Lucene中，一些常用Filter的用法 -

weitao1026

浏览: 1062719 次
性别:
来自: 上海

最近访客更多访客>>

vicento4

723499280

liuzidong

s1986q

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

Lucene中，一些常用Filter的用法

博客分类：

lucene/solr/nuth/elasticsearch/MG4J

lucene

Lucene中，一些常用Filter的用法和例子，今天，我们在来看下不在Filter家族中的一个特殊的filter，属于Lucene捐赠模块的特殊包中的类DuplicateFilter，这个filter的作用是用来对某个字段进行去重操作的，类似数据库中的Distinct关键字，可以实现对某个列的结果集去重，这个去重的字段，一般情况下是不建议分词的，因为分词后，可能去重效果不准确.

举个例子，来说明分词后去重，会造成什么情况，假如我们的索引name一列中有中国，和伟大的中国，那么就对这个name列去重后，就会发现lucene只保留了伟大的中国这个字段，为什么呢？因为切词后伟大的中国会被分成伟大|的|中国，进行去重时，Lucene认为中国是重复的，而伟大的中国是不重复的，又因为伟大的中国里包含中国，所以最后的结果就会只保留伟大的中国，而没有中国。所以无论使用这个过滤器去重，还是使用grouping或fact去重，大多数情况下操作的字段是不能分词的，这一点需要注意！

下面我们来具体看下DuplicateFilter这个特殊的过滤器，怎么使用。在这之前我们先来看下我们简单的测试数据.

Java代码复制代码收藏代码
1.name===type
2.a===>中国
3.a===>法国
4.b===>中国
5.c===>英国
6.d===>英国
7.b===>英国

分别对对name和type去重后的效果(注意一次只能去重一个字段)

Java代码复制代码收藏代码
1.a
2.c
3.d
4.b

Java代码复制代码收藏代码
1.法国
2.中国
3.英国

下面给出具体的代码实现，需要额外导入的包

Java代码复制代码收藏代码
1.org.apache.lucene.sandbox.queries

核心代码

Java代码复制代码收藏代码
1.      //群交流 324714439
2.      //String field="name";
3.          String field="type";
4.DuplicateFilter filter=new DuplicateFilter(field);//去重过滤
5.Query q=new MatchAllDocsQuery();//对所有结果去重
6.TopDocs s=search.search(q, filter, 100);

可以看出，核心的代码量很少，却可以高效的完成去重工作，去重技术在我们的实际运用中也是一项很常用的技术，有时候我们可能只需要查看不重复的记录，而没有一些类似统计的功能，如果需要去重并统计个数，那么就需要使用分组功能或分面功能了,当然，如果我们只需要简单的对字段去重，那么就可以使用DuplicateFilter简洁高效的来完成这项任务。

分享到：

Lucene的内置的分词器 | Lucene的特殊的分词需求

2017-01-12 10:03
浏览 889
评论(0)
分类:企业架构
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Lucene中，一些常用Filter的用法

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

Lucene中，一些常用Filter的用法

评论

发表评论

相关推荐

elasticsearch异常信息汇总

Elasticsearch的架构

怎么在Ubuntu上打开端口

Elasticsearch工作原理

Elasticsearch的路由（Routing）特性

Elasticsearch中的segment理解

Elasticsearch的路由（Routing）特性

Elasticsearch 的 Shard 和 Segment

开源大数据查询分析引擎现状

大数据处理方面的 7 个开源搜索引擎

开源大数据查询分析引擎现状

elasticsearch 把很多类型都放在一个索引下面 会不会导致查询慢

腾讯大数据Hermes爱马仕的系统

配置高性能Elasticsearch集群的9个小贴士

Elasticsearch与Solr

大数据杂谈微课堂|Elasticsearch 5.0新版本的特性与改进

ElasticSearch性能优化策略

ES索引优化

分词与索引的关系

Elasticsearch中的segment理解

最近访客更多访客>>

elasticsearch 把很多类型都放在一个索引下面会不会导致查询慢