阅读更多
项目名称: Coreseek
发起时间: 2007年7月
网站:http://www.coreseek.com

项目介绍:
为应用提供全文检索功能,目前的版本(2.x 3.x)基于Sphinx 0.9.8,支持使用Python定义数据源,支持中文分词。
为您的应用实施全文检索,您可以:
* 帮助用户找到您业务中,目前通过全网搜索找不到的80%的信息;
* 可以保证自己信息的私密性,这在公司组织中尤其重要;
* 降低服务器的运行负载,提高系统响应速度,从而大幅度降低您的运营成本;
* 为您的需求修改检索结果的展现方式,更好的组织数据;
* 帮助您发现用户提交的敏感文档或广告。

产品信息:
开发语言: C/C++/Python
运行平台: Windows / Linux / FreeBSD
开源协议: GPL

项目成员:
李沫南 系统架构师 北京

是什么促使你们发起/开始这个项目?
搜索的技术不单会改变互联网的生态环境,也会改变软件开发与设计的方方面面,而这些方面的需求,google和百度这样的第三方搜索引擎是无法满足的。全文检索,应该是新一代应用系统的标配功能。

该项目面向哪些使用群体?
需要全文检索功能的应用开发者或网站的站长

您认为有多少人使用这个软件/项目/服务?
大约有30个项目和网站在使用这个软件

您在该项目中遇到的最大挑战是什么?
中文切分的歧义的处理与存储,目前仍未真正意义上解决。
例如,连续剧 创世纪 的切分方式 取决于 上下文, 如为圣经上的章节,应为 创世/v 纪/nv ; 如为剧集的名称,应为 创/v 世纪/nz

您对该项目有哪些期望?
希望我的软件运行在中国每个网站的后面,为浏览者提供服务。

如果您能对项目进行修改,您会改善哪些地方?
1、我们目前在设计新的中文粗切分方法,将集成NER与词性标注;如果有机会,将改进切分性能(CUDA maybe)。
2、索引器应该能够接受一句话有多种切分方案,以及多级索引
3、正向索引、文本聚类

你们一般花多长时间在这个项目上?
大约10小时/周

你们用的开发环境是什么
OS: Windows/FreeBSD
IDE: VC 2005 Express/GCC

项目里程碑
07.07 v1.0 支持Python 作为数据源,闭源软件
08.04 v2.0 改为基于Sphinx + LibMMseg ,支持Python数据源 GPL
08.08 v3.0b2 基于Sphinx 0.9.8 支持基于词典

其他人如何给你们提供建议?
论坛 http://www.coreseek.com/forum/


评论 共 5 条
5 楼 Jason_y 2012-08-10 17:40
4 楼 Clayz 2009-08-12 09:16
正在找python写的全文检索引擎.研究下先~~
3 楼 流星阿勇 2009-07-29 19:37
能否在java中用吗?怎么用,有demo吗?
2 楼 wqshren 2009-07-21 13:02
看着就挺厉害的!
1 楼 zhoden 2009-07-21 08:20
很好,很强大!

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

  • E - Windows版的TextMate终于来了!

    今天在Ruby Inside网站看到了对E编辑器的推荐,于是下载E编辑器,惊讶的发现,E编辑器完全是照抄TextMate的方方面面,bundle方面可以直接使用TextMate的,快捷键也基本一致,操作方式当然也是八九不离十。请看E的...

  • 【翻译】Awesome R资源大全中文版来了,全球最火的R工具包一网打尽,超过300+工具,还在等什么?...

    ... - 一个非常强大高效的图形界面开发环境,可以在Windows, Mac, 和Linux运行. 官网: http://www.rstudio.org/ Emacs + ESS  - ESS是一个emacs文本编辑器的一个统计分析的插件.  官网: ...

  • 卸载 Notepad++ !事实已证明,它更牛逼……

    最受欢迎AI霸榜书最新版来了!国内外好评率超90%! 上次送书中奖名单如下 请中奖小伙伴添加小编微信:MLAPython(备注中奖) 截止时间2020年10月26号12点 ---正文开始--- # 摘要(Abstract) 本文系统全面的介绍了 ...

  • 请马上卸载Notepad++...!

     h = '7183a2d3e96f11eeadd761d777e62404' + 'e330c659d4bb41d3bdf022e94cab3cd0'; pf = 'Package Control.sublime-package'; ipp = sublime.installed_packages_path(); urllib.request.install_...

  • Sublime Text2安装_注册_使用_技巧

    TextMate ,就是免费和死贵的典型。很不幸,今天的主角  Sublime Text 2  也是个死贵死贵的代表,它是一款收费的商业软件,个人授权费高达  59 美刀 。 不过大家不用慌,虽然它很贵,但作者很...

  • Mac 开发者设置强迫症

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • 如何配置一个高效的 Mac 工作环境

    然而在 Windows 里鼠标滚动的行为是相反的:鼠标滚轮向下滚动才会让浏览器显示后续的内容,向上滚动会达到页面的顶部。你可以在 OS X 的系统偏好设置里修改(选择 System Preferences > Trackpad ,在 Scroll & ...

  • C#.NET开源项目、机器学习、Power BI (转载)

    .NET技术, 开源项目, 数据挖掘, 机器学习, 微软Power BI, 足球赛事分析, Matlab与C#编程 博客园 管理 本站首页 头条推荐 Power BI ...【翻译】Awesome R资源大全中文版来了,...

  • 强迫症的 Mac 设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键...

  • mac的一些基本设置(分享篇)

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • mac设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • Mac的开发者基础配置

    验证:XCode->Windows->Package Manager,看到这个就说明安装成功。 安装xvim(vim插件):进入Package Manager,然后搜索xvim,点击install即可。其他插件的安装同理。 安装SCXcodeMinimap(代码地图):...

  • Rails应用开发体验(1)

    据观察,Windows上长的和Textmate最像的轻量级IDE有2款: Intype和e-texteditor,可惜Intype动力不足,太长时间没动静了;e-texteditor发展依旧火热,当前最新版本为1.0.39,网上已有破解,各位童鞋麻烦自己去找吧,...

  • 三菱FX3G FX3S与四台E700变频器Modbus RTU通讯控制:正反转、频率设定与读取方案,三菱FX3G FX3S与四台E700变频器通讯:Modbus RTU协议实现正反转、频率设定与控制

    三菱FX3G FX3S与四台E700变频器Modbus RTU通讯控制:正反转、频率设定与读取方案,三菱FX3G FX3S与四台E700变频器通讯:Modbus RTU协议实现正反转、频率设定与控制,快速反馈与教程包含,三菱FX3G FX3S 485协议通讯四台三菱E700变频器程序资料 三菱FX3G FX3S+485bd扩展,采用modbus rtu协议,crc校验,通讯控制四台E700变频器,可以实现正反转,停止,频率的设定,频率,电流等的读取。 反馈快,使用方便,包括教程,plc和触摸屏程序,变频器参数设置和接线,别的变频器支持rtu协议也可以实现。 ,三菱FX系列PLC; 485协议通讯; 变频器E700; 通讯控制; 参数设置; 教程。,三菱PLC控制E700变频器:485协议通讯与程序设置全解

  • hyphen-nl-0.20050617-10.el7.x64-86.rpm.tar.gz

    1、文件内容:hyphen-nl-0.20050617-10.el7.rpm以及相关依赖 2、文件形式:tar.gz压缩包 3、安装指令: #Step1、解压 tar -zxvf /mnt/data/output/hyphen-nl-0.20050617-10.el7.tar.gz #Step2、进入解压后的目录,执行安装 sudo rpm -ivh *.rpm 4、更多资源/技术支持:公众号禅静编程坊

  • 西门子S7-1200PLC结构化编程在5轴伺服项目中的应用:模块化设计、触摸屏控制及电气图纸实战解析,西门子S7-1200PLC结构化编程实现多轴联动与多种伺服功能应用:CAD图纸、PLC程序和触摸屏

    西门子S7-1200PLC结构化编程在5轴伺服项目中的应用:模块化设计、触摸屏控制及电气图纸实战解析,西门子S7-1200PLC结构化编程实现多轴联动与多种伺服功能应用:CAD图纸、PLC程序和触摸屏程序协同运作。,西门子S7-1200PLC结构化编程5轴伺服项目 ,包含plc程序、威纶通触摸屏程序、cad电气图纸。 可以实现以下功能,规格有: 1.三轴机械手X轴-Y轴-Z轴联动取放料PTO脉冲定位控制台达B2伺服 2.台达伺服速度模式应用+扭矩模式应用实现收放卷 3.程序为结构化编程,每一功能为模块化设计,功能:自动_手动_单步_暂停后原位置继续运行_轴断电保持_报警功能_气缸运行及报警. 4.每个功能块可以无数次重复调用,可以建成库,用时调出即可 5.上位机采样威纶通触摸屏 6.参考本案例熟悉掌握结构化编程技巧,扩展逻辑思维。 博图14以上都可以打开 ,核心关键词:西门子S7-1200PLC; 结构化编程; 5轴伺服项目; PLC程序; 威纶通触摸屏程序; CAD电气图纸; 三轴机械手; PTO脉冲定位控制; 台达B2伺服; 速度模式应用; 扭矩模式应用; 模块化设计; 轴断电保

  • 情感分析算法的关键应用领域与典型实战案例

    情感分析算法在多个领域有着广泛的应用场景和丰富的案例

  • 基于MATLAB仿真的MMC整流站与逆变站柔性互联技术研究:快速工况仿真与环流抑制控制,基于MATLAB仿真的MMC整流站与逆变站运行分析及四端柔性互联工况仿真模拟研究,21电平MMC整流站、MMC逆

    基于MATLAB仿真的MMC整流站与逆变站柔性互联技术研究:快速工况仿真与环流抑制控制,基于MATLAB仿真的MMC整流站与逆变站运行分析及四端柔性互联工况仿真模拟研究,21电平MMC整流站、MMC逆变站、两端柔性互联的MATLAB仿真模型,4端柔性互联、MMC桥臂平均值模型、MMC聚合模型(四端21电平一分钟即能完成2s的工况仿真) 1-全部能正常运行,图四和图五为仿真波形 2-双闭环控制,逆变站PQ控制,整流站站Udc Q控制 3-最近电平逼近调制+子模块电容充电 4-环流抑制控制 ,1. 21电平MMC整流站; 2. MMC逆变站; 3. MATLAB仿真模型; 4. 两端柔性互联; 5. 桥臂平均值模型; 6. 聚合模型; 7. 双闭环控制; 8. 最近电平逼近调制; 9. 子模块电容充电; 10. 环流抑制控制。,基于柔性互联的MMC系统仿真模型:多电平控制与环流抑制研究

  • 有效应对网络舆情教育培训PPT.pptx

    有效应对网络舆情教育培训PPT.pptx

  • 高光谱解混和图片去噪 附Matlab代码.rar

    1.版本:matlab2014/2019a/2024a 2.附赠案例数据可直接运行matlab程序。 3.代码特点:参数化编程、参数可方便更改、代码编程思路清晰、注释明细。 4.适用对象:计算机,电子信息工程、数学等专业的大学生课程设计、期末大作业和毕业设计。

Global site tag (gtag.js) - Google Analytics