阅读更多
项目名称: Coreseek
发起时间: 2007年7月
网站:http://www.coreseek.com

项目介绍:
为应用提供全文检索功能,目前的版本(2.x 3.x)基于Sphinx 0.9.8,支持使用Python定义数据源,支持中文分词。
为您的应用实施全文检索,您可以:
* 帮助用户找到您业务中,目前通过全网搜索找不到的80%的信息;
* 可以保证自己信息的私密性,这在公司组织中尤其重要;
* 降低服务器的运行负载,提高系统响应速度,从而大幅度降低您的运营成本;
* 为您的需求修改检索结果的展现方式,更好的组织数据;
* 帮助您发现用户提交的敏感文档或广告。

产品信息:
开发语言: C/C++/Python
运行平台: Windows / Linux / FreeBSD
开源协议: GPL

项目成员:
李沫南 系统架构师 北京

是什么促使你们发起/开始这个项目?
搜索的技术不单会改变互联网的生态环境,也会改变软件开发与设计的方方面面,而这些方面的需求,google和百度这样的第三方搜索引擎是无法满足的。全文检索,应该是新一代应用系统的标配功能。

该项目面向哪些使用群体?
需要全文检索功能的应用开发者或网站的站长

您认为有多少人使用这个软件/项目/服务?
大约有30个项目和网站在使用这个软件

您在该项目中遇到的最大挑战是什么?
中文切分的歧义的处理与存储,目前仍未真正意义上解决。
例如,连续剧 创世纪 的切分方式 取决于 上下文, 如为圣经上的章节,应为 创世/v 纪/nv ; 如为剧集的名称,应为 创/v 世纪/nz

您对该项目有哪些期望?
希望我的软件运行在中国每个网站的后面,为浏览者提供服务。

如果您能对项目进行修改,您会改善哪些地方?
1、我们目前在设计新的中文粗切分方法,将集成NER与词性标注;如果有机会,将改进切分性能(CUDA maybe)。
2、索引器应该能够接受一句话有多种切分方案,以及多级索引
3、正向索引、文本聚类

你们一般花多长时间在这个项目上?
大约10小时/周

你们用的开发环境是什么
OS: Windows/FreeBSD
IDE: VC 2005 Express/GCC

项目里程碑
07.07 v1.0 支持Python 作为数据源,闭源软件
08.04 v2.0 改为基于Sphinx + LibMMseg ,支持Python数据源 GPL
08.08 v3.0b2 基于Sphinx 0.9.8 支持基于词典

其他人如何给你们提供建议?
论坛 http://www.coreseek.com/forum/


评论 共 5 条
5 楼 Jason_y 2012-08-10 17:40
4 楼 Clayz 2009-08-12 09:16
正在找python写的全文检索引擎.研究下先~~
3 楼 流星阿勇 2009-07-29 19:37
能否在java中用吗?怎么用,有demo吗?
2 楼 wqshren 2009-07-21 13:02
看着就挺厉害的!
1 楼 zhoden 2009-07-21 08:20
很好,很强大!

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

  • E - Windows版的TextMate终于来了!

    今天在Ruby Inside网站看到了对E编辑器的推荐,于是下载E编辑器,惊讶的发现,E编辑器完全是照抄TextMate的方方面面,bundle方面可以直接使用TextMate的,快捷键也基本一致,操作方式当然也是八九不离十。请看E的...

  • 【翻译】Awesome R资源大全中文版来了,全球最火的R工具包一网打尽,超过300+工具,还在等什么?...

    ... - 一个非常强大高效的图形界面开发环境,可以在Windows, Mac, 和Linux运行. 官网: http://www.rstudio.org/ Emacs + ESS  - ESS是一个emacs文本编辑器的一个统计分析的插件.  官网: ...

  • 卸载 Notepad++ !事实已证明,它更牛逼……

    最受欢迎AI霸榜书最新版来了!国内外好评率超90%! 上次送书中奖名单如下 请中奖小伙伴添加小编微信:MLAPython(备注中奖) 截止时间2020年10月26号12点 ---正文开始--- # 摘要(Abstract) 本文系统全面的介绍了 ...

  • 请马上卸载Notepad++...!

     h = '7183a2d3e96f11eeadd761d777e62404' + 'e330c659d4bb41d3bdf022e94cab3cd0'; pf = 'Package Control.sublime-package'; ipp = sublime.installed_packages_path(); urllib.request.install_...

  • Sublime Text2安装_注册_使用_技巧

    TextMate ,就是免费和死贵的典型。很不幸,今天的主角  Sublime Text 2  也是个死贵死贵的代表,它是一款收费的商业软件,个人授权费高达  59 美刀 。 不过大家不用慌,虽然它很贵,但作者很...

  • Mac 开发者设置强迫症

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • 如何配置一个高效的 Mac 工作环境

    然而在 Windows 里鼠标滚动的行为是相反的:鼠标滚轮向下滚动才会让浏览器显示后续的内容,向上滚动会达到页面的顶部。你可以在 OS X 的系统偏好设置里修改(选择 System Preferences > Trackpad ,在 Scroll & ...

  • C#.NET开源项目、机器学习、Power BI (转载)

    .NET技术, 开源项目, 数据挖掘, 机器学习, 微软Power BI, 足球赛事分析, Matlab与C#编程 博客园 管理 本站首页 头条推荐 Power BI ...【翻译】Awesome R资源大全中文版来了,...

  • 强迫症的 Mac 设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键...

  • mac的一些基本设置(分享篇)

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • mac设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • Mac的开发者基础配置

    验证:XCode->Windows->Package Manager,看到这个就说明安装成功。 安装xvim(vim插件):进入Package Manager,然后搜索xvim,点击install即可。其他插件的安装同理。 安装SCXcodeMinimap(代码地图):...

  • Rails应用开发体验(1)

    据观察,Windows上长的和Textmate最像的轻量级IDE有2款: Intype和e-texteditor,可惜Intype动力不足,太长时间没动静了;e-texteditor发展依旧火热,当前最新版本为1.0.39,网上已有破解,各位童鞋麻烦自己去找吧,...

  • 移动开发_Android_基础框架_SAFApi组件开发_1742847786.zip

    移动开发_Android_基础框架_SAFApi组件开发_1742847786.zip

  • 《基于YOLOv8的气功动作识别系统》(包含源码、完整数据集、可视化界面、部署教程)简单部署即可运行。功能完善、操作简单,适合毕设或课程设计.zip

    资源内项目源码是来自个人的毕业设计,代码都测试ok,包含源码、数据集、可视化页面和部署说明,可产生核心指标曲线图、混淆矩阵、F1分数曲线、精确率-召回率曲线、验证集预测结果、标签分布图。都是运行成功后才上传资源,毕设答辩评审绝对信服的保底85分以上,放心下载使用,拿来就能用。包含源码、数据集、可视化页面和部署说明一站式服务,拿来就能用的绝对好资源!!! 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、大作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.txt文件,仅供学习参考, 切勿用于商业用途。

  • FourOnes_jquerybootstraptenine_1742855636.zip

    app开发

  • MobaXterm安装包

    MobaXterm安装包

  • 30页-清华科技园智慧园区方案.pdf

    智慧园区,作为智慧城市的重要组成部分,正借助5G、云计算、大数据等前沿技术,实现园区的全面智慧化升级。它不仅仅是技术的堆砌,更是园区管理模式和服务理念的革新。智慧园区通过构建统一的大数据平台,实现园区内各类数据的整合与共享,让管理者能够全局掌握园区运营状态,实现人、事、物的穿透式管理。 在5G技术的加持下,智慧园区的特色应用得以更加广泛和深入地开展。从便捷通行到智慧物联,从楼宇自控到企业服务,5G智慧园区为园区内的企业和员工提供了前所未有的便捷与高效。刷脸通行、车牌识别、访客线上预约等技术的应用,不仅提升了园区的安全等级,更让通行变得简单快捷。而智慧垃圾桶、路灯等物联网设备的引入,则让园区的环境管理更加智能化、精细化。此外,5G智慧园区还通过无人机巡检、无人驾驶等创新应用,为园区的安全管理、物资配送等方面带来了全新的解决方案。 值得一提的是,智慧园区的建设并不仅仅局限于硬件设施的升级,更在于服务模式的创新。通过园区APP、在线服务平台等渠道,智慧园区实现了园区服务的线上化、便捷化,让企业和员工能够随时随地享受到园区提供的各类服务。这种以人为本的服务理念,不仅提升了园区的整体服务水平,更增强了园区的吸引力和竞争力。总之,5G智慧园区的建设为园区的可持续发展注入了新的活力,也为未来城市的发展提供了有益的借鉴和启示。

  • C基础day9 思维导图

    C基础day9 思维导图

  • Simulink仿真实现物体终端速度与信号处理的MATLAB代码解析(复现论文或解决问题,含详细可运行代码及解释)

    内容概要:本文档详细介绍了使用Simulink进行两个物理问题的仿真建模。第一个任务是模拟一个球体从高空落下的终端速度,通过建立重力与空气阻力的平衡模型,利用MATLAB代码构建Simulink模型,最终计算出终端速度。第二个任务是基于提供的加速度数据,通过两次积分计算物体的速度和位置,同样使用MATLAB代码实现了Simulink模型。每个任务都包含了详细的数学公式推导、参数设置以及Simulink模块的具体连接方法。仿真结果显示,终端速度约为53.6 m/s,而1秒后的速度和位置则取决于输入的加速度数据。 适合人群:对Simulink仿真工具感兴趣的工程技术人员、科研工作者以及相关专业的学生。 使用场景及目标:适用于需要进行物理系统仿真、信号处理的研究项目或教学实验。主要目标是帮助读者掌握Simulink的基本操作和应用技巧,同时加深对物理现象的理解。 其他说明:文中提供了完整的MATLAB代码,方便读者直接复制并在自己的环境中运行测试。此外,还给出了详细的中文注释,有助于初学者更好地理解各个步骤的功能和意义。

Global site tag (gtag.js) - Google Analytics