`
tiankong6622
  • 浏览: 55234 次
社区版块
存档分类
最新评论

solr4.4 + mmseg4j-1.9.1中文分词

阅读更多
1、solr配置请参考solr4.4.0配置笔记.txt

2、mmseg4j-1.9.1下载地址 http://mmseg4j.googlecode.com/files/mmseg4j-1.9.1.zip
   mmseg4j 1.8.3 只支持 lucene 2.9/3.0 接口 和 solr1.4。其它没改动
   mmseg4j 1.8.5 支持 lucene 3.1, solr3.1
   mmseg4j 1.9.0 支持 lucene 4.0, solr4.0

3、在E:\private_project\solr\solr_home\solr文件夹下建立lib和dic两个文件夹

4、解压mmseg4j-1.9.1.zip,并将mmseg4j-1.9.1\dist文件夹下的3个jar复制到刚刚新建的lib文件夹下,即E:\private_project\solr\solr_home\solr\lib下面

5、解压mmseg4j-1.9.1\dist下面的mmseg4j-core-1.9.1.jar,将3个*.dic文件复制到E:\private_project\solr\solr_home\solr\dic下面

6、编辑E:\private_project\solr\solr_home\solr\collection1\conf下面的schema.xml,在合适的位置加上下面的代码
   <field name="simple" type="textSimple" indexed="true" stored="true"/>  
   <field name="complex" type="textComplex" indexed="true" stored="true"/>  
   <field name="MaxWord" type="textMaxWord" indexed="true" stored="true"/> 


   <copyField source="simple" dest="text" />  
   <copyField source="complex" dest="text"/>  
   <copyField source="MaxWord" dest="text"/>


 
 <fieldType name="textComplex" class="solr.TextField">  
      <analyzer>  
	<tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" dicPath="E:/private_project/solr/solr_home/solr/dic"/>  
      </analyzer>  
   </fieldType>  
   <fieldType name="textMaxWord" class="solr.TextField">  
      <analyzer>  
	<tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="max-word" dicPath="E:/private_project/solr/solr_home/solr/dic"/>  
      </analyzer>  
   </fieldType>  
   <fieldType name="textSimple" class="solr.TextField">  
      <analyzer>  
	<tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="simple" dicPath="E:/private_project/solr/solr_home/solr/dic"/>  
      </analyzer>  
   </fieldType>


   注意dicPath为你的*.dic文件存放的路径

7、编辑E:\private_project\solr\solr_home\solr\collection1\conf下面的solrconfig.xml,在合适的位置加上下面的代码
   <lib dir="E:/private_project/solr/solr_home/solr/lib" regex=".*\.jar" />
   注意dir为从mmseg4j-1.9.1\dist下复制的那3个jar包的路径

8、重启tomcat,访问http://localhost:8080/solr/#/collection1/analysis ,“Analyse Fieldname / FieldType:”类型选择MaxWord,然后在“Field Value (Index)”
   下面的文本框里输入“solr是一个伟大的开源的搜索引擎”,就能看到搜索效果

   MMSeg 算法有两种分词方法:Simple和Complex,都是基于正向最大匹配。Complex 加了四个规则过虑。官方说:词语的正确识别率达到了 98.41%。mmseg4j 已经实现了这两种分词算法
分享到:
评论

相关推荐

    兼容solr4.10.3的mmseg4j-1.9.1分词器

    "兼容solr4.10.3的mmseg4j-1.9.1分词器" 这个标题表明我们正在讨论的是一个针对Solr 4.10.3版本优化的mmseg4j分词器,版本号为1.9.1。mmseg4j是一款广泛使用的Java实现的中文分词库,它提供了高效且精准的中文分词...

    Solr3.2 + mmseg4j-1.8.4中文搜索引擎_Demo

    Solr3.2 + mmseg4j-1.8.4中文搜索引擎Demo是一个演示项目,旨在展示如何在Solr...这个Demo不仅展示了Solr的灵活性和可扩展性,还突显了mmseg4j在中文处理上的优势,对于学习和实践Solr中文搜索是一个非常实用的资源。

    mmseg4j-solr-2.2.0.jar mmseg4j-analysis-1.9.1.jar mmseg4j-solr-2.2.0.jar

    本人用的solr是4.10的,经过本人亲测可用,放心下载,包含以下3个jar包: mmseg4j-analysis-1.9.1.jar, mmseg4j-core-1.9.1.jar, mmseg4j-solr-2.2.0.jar

    mmseg4j-1.9.1 修改bug版本

    在mmseg4j-1.9.1\mmseg4j-analysis\src\main\java\com\chenlb\mmseg4j\analysis\MMSegTokenizer.java 中的 public void reset() throws IOException(){ ... super.reset();//已添加完这个,重新打包 }

    mmseg4j-solr-2.4.0.jar

    而mmseg4j-solr-2.4.0.jar是mmseg4j分词库的Solr插件版本,专为Solr设计,使得开发者可以方便地将mmseg4j的分词功能集成到Solr中,以提升搜索性能和精确度。 在Solr 6.3版本下,要使用mmseg4j-solr-2.4.0.jar,首先...

    mmseg4j-solr-mmseg4j-solr-2.2.0.zip

    mmseg4j-solr是一个专门针对Solr的中文分词组件,它在2.2.0版本中提供了高效的分词能力,为中文信息检索带来了显著的改进。 首先,我们来理解一下mmseg4j-solr的核心——mmseg(Maximum Matching Segment,最大匹配...

    mmseg4j-solr-2.2.0-with-mmseg4j-core.zip

    在这个压缩包中,包含的两个核心文件mmseg4j-core-1.10.0.jar和mmseg4j-solr-2.2.0.jar是实现Solr中文分词功能的关键。mmseg4j-core-1.10.0.jar是mmseg4j的核心分词引擎,提供了基本的分词算法和数据结构。而mmseg4j...

    mmseg4j-analysis-1.9.1.jar 修复了reset错误

    reset close call missing reset called multiple times or subclass does not call super reset Please see Javadocs of ...mmseg4j analysis 1 9 1 jar"&gt;在solr4 7中使用mmseg4j1 9 1时会出现contract violation...

    mmseg4j-solr-2.1.0-with-mmseg4j-core.zip

    《mmseg4j-solr-2.1.0-with-mmseg4j-core.zip:Solr4.8与mmseg4j分词器的集成详解》 在信息检索和文本挖掘领域,搜索引擎扮演着至关重要的角色,而Apache Solr作为一款高效、可扩展的开源全文搜索平台,被广泛应用...

    solr中文分词包mmseg4j-core-1.10.0.jar和mmseg4j-solr-2.3.0.jar

    mmseg4j-solr-2.3.0-with-mmseg4j-core是Solr的中文分词包,该压缩包含有mmseg4j-core-1.10.0.jar和mmseg4j-solr-2.3.0.jar。

    mmseg4j-solr全版本及配置

    总结来说,掌握mmseg4j-solr的配置和使用是提升Solr中文搜索能力的关键。从选择合适的版本,到正确配置Solr的schema,再到设定词典路径,每个环节都需要细致入微的考虑。通过深入理解这些知识点,开发者能够为自己的...

    mmseg4j-solr总共4个文件

    里面包含了mmseg4j-solr-2.0.0.jar,mmseg4j-solr-2.1.0.jar,mmseg4j-solr-2.2.0.jar,mmseg4j-solr-2.3.0.jar总共4个文件,其中: mmseg4j-solr-2.0.0.jar 要求 lucene/solr &gt;= 4.3.0。在 lucene/solr [4.3.0, 4.7.1]...

    mmseg4j-1.9.1

    mmseg4j用Chih-Hao Tsai 的MMSeg算法实现的中文分词器,并实现lucene的analyzer和solr的TokenizerFactory以方便在Lucene和Solr中使用。 MMSeg 算法有两种分词方法:Simple和Complex,都是基于正向最大匹配。Complex...

    mmseg4j-solr-2.3.2-with-mmseg4j-core

    该压缩包包含`mmseg4j-solr-2.3.2.jar`和`mmseg4j-core-1.10.0.jar`,其中solr-2.3.2不是官方的版本,该版本有改动,使得mmseg4j可以很好的支持Solr6,如果你的Solr低于Solr6,请使用官方的mmseg4j-solr-2.3.0.jar...

    mmseg4j-solr-2.3.0.jar

    mmseg4j中文分词器 mmseg4j-core-1.10.0.jar mmseg4j-solr-2.3.0.jar两个主要依赖包

    tomcat+solr3.6+mmseg4j

    通过以上步骤,你将成功地在Tomcat中整合Solr3.6并利用MMSEG4J实现中文分词。这只是一个基础的配置,实际应用中可能需要根据业务需求进行更复杂的定制和优化。例如,为满足实时性要求,可能需要配置实时索引和搜索;...

    solr mmseg4j 中文分词器

    mmseg4j-solr-2.3.0.jar 支持 solr5.x 版本以上 分词器本身并未做升级还是mmseg4j-core-1.10.0 和 mmseg4j-analysis-1.9.1.jar为了方便也一并上传

    mmseg4j-solr-master

    《mmseg4j-solr-master:中文分词利器与应用探索》 在现代信息处理领域,中文分词是至关重要的第一步,它涉及到搜索引擎优化、文本挖掘、情感分析等多个应用场景。mmseg4j-solr是一款针对Solr的高效中文分词工具,...

    mmseg4j-solr-2.3.0&mmseg4j;-core.zip

    总之,mmseg4j作为优秀的中文分词工具,与Solr的结合使得Solr在处理中文文本时表现出色。通过理解mmseg4j的基本原理,掌握其在Solr中的配置和自定义词库的使用,我们可以更好地利用这一工具来优化搜索引擎,提升中文...

    mmseg4j.jar

    在提供的压缩包文件中,包含了三个主要的jar文件:mmseg4j-core-1.10.0.jar、mmseg4j-solr-2.4.0.jar和mmseg4j-analysis-1.9.1.jar。每个组件都有其特定的功能: 1. **mmseg4j-core-1.10.0.jar**:这是mmseg4j的...

Global site tag (gtag.js) - Google Analytics