论坛首页 Java企业应用论坛

修改imdict分词的机制,让其允许附加词库

浏览 3430 次
精华帖 (0) :: 良好帖 (0) :: 新手帖 (0) :: 隐藏帖 (0)
作者 正文
   发表时间:2010-01-18  
    一直喜欢中科院的分词,但由于共享版有时间限制,虽有破解版,但这样用破解就不爽,在其官网找了一个java版的中科院分词imdict-chinese-analyzer 
下载地址是
    http://ictclas.org/OpenSrcDownCount.asp?PacketId=48&url=down/imdict-chinese-analyzer.zip
用了以后,觉得效果不错,但最大的硬伤是不允许附加词库,但既然源代码都到手了,这种不允许附加的机制当然能改。
最后没有改动源代码,仅仅自己另外写了几个类实现了

使用方式请看附件里面的readme.txt

//不加入默认词库,词库里面没有陆河县这个词,结果是 广东 陆 河 县 onedear
//附加词库后,结果是“广东 陆河县 onedear ”

同时也曾带上词性,但不是很准,所以附件里面的工程就取消了,主要是没有一个很好的算法跟思想,对多义词不知道应如何处理。希望大家能给给意见。
   发表时间:2010-01-22  
兄弟,我下载了你的这个,也按照你的方法试了,好像没起什么效果,分词和以前的效果一样,根本就没有加入你的词库,是不是你提供的去掉了这个功能?
0 请登录后投票
   发表时间:2010-01-25  
geniuslph 写道
兄弟,我下载了你的这个,也按照你的方法试了,好像没起什么效果,分词和以前的效果一样,根本就没有加入你的词库,是不是你提供的去掉了这个功能?


//不加入默认词库,词库里面没有陆河县这个词,结果是 广东 陆 河 县 onedear
//附加词库后,结果是“广东 陆河县 onedear ”
这个效果能看到不,能看到的话就是添加词库了
0 请登录后投票
   发表时间:2010-02-11  
我也是根据你说的做了,结果还是一样的啊,你看看:


2010-02-11 23:24:27增加了1个词语
写入到了默认词库。。。
2010-02-11 23:24:31广东 陆 河 县 onedear


没有任何改变....
0 请登录后投票
   发表时间:2010-02-25  
ljishen 写道
我也是根据你说的做了,结果还是一样的啊,你看看:


2010-02-11 23:24:27增加了1个词语
写入到了默认词库。。。
2010-02-11 23:24:31广东 陆 河 县 onedear


没有任何改变....


是个bug来的,
运行了这句代码new ImdictExtend().addMyDict("myDict.dict", true);
当前运行不生效,会在下一次生效
0 请登录后投票
论坛首页 Java企业应用版

跳转论坛:
Global site tag (gtag.js) - Google Analytics