阅读更多
项目名称: Coreseek
发起时间: 2007年7月
网站:http://www.coreseek.com

项目介绍:
为应用提供全文检索功能,目前的版本(2.x 3.x)基于Sphinx 0.9.8,支持使用Python定义数据源,支持中文分词。
为您的应用实施全文检索,您可以:
* 帮助用户找到您业务中,目前通过全网搜索找不到的80%的信息;
* 可以保证自己信息的私密性,这在公司组织中尤其重要;
* 降低服务器的运行负载,提高系统响应速度,从而大幅度降低您的运营成本;
* 为您的需求修改检索结果的展现方式,更好的组织数据;
* 帮助您发现用户提交的敏感文档或广告。

产品信息:
开发语言: C/C++/Python
运行平台: Windows / Linux / FreeBSD
开源协议: GPL

项目成员:
李沫南 系统架构师 北京

是什么促使你们发起/开始这个项目?
搜索的技术不单会改变互联网的生态环境,也会改变软件开发与设计的方方面面,而这些方面的需求,google和百度这样的第三方搜索引擎是无法满足的。全文检索,应该是新一代应用系统的标配功能。

该项目面向哪些使用群体?
需要全文检索功能的应用开发者或网站的站长

您认为有多少人使用这个软件/项目/服务?
大约有30个项目和网站在使用这个软件

您在该项目中遇到的最大挑战是什么?
中文切分的歧义的处理与存储,目前仍未真正意义上解决。
例如,连续剧 创世纪 的切分方式 取决于 上下文, 如为圣经上的章节,应为 创世/v 纪/nv ; 如为剧集的名称,应为 创/v 世纪/nz

您对该项目有哪些期望?
希望我的软件运行在中国每个网站的后面,为浏览者提供服务。

如果您能对项目进行修改,您会改善哪些地方?
1、我们目前在设计新的中文粗切分方法,将集成NER与词性标注;如果有机会,将改进切分性能(CUDA maybe)。
2、索引器应该能够接受一句话有多种切分方案,以及多级索引
3、正向索引、文本聚类

你们一般花多长时间在这个项目上?
大约10小时/周

你们用的开发环境是什么
OS: Windows/FreeBSD
IDE: VC 2005 Express/GCC

项目里程碑
07.07 v1.0 支持Python 作为数据源,闭源软件
08.04 v2.0 改为基于Sphinx + LibMMseg ,支持Python数据源 GPL
08.08 v3.0b2 基于Sphinx 0.9.8 支持基于词典

其他人如何给你们提供建议?
论坛 http://www.coreseek.com/forum/


评论 共 5 条
5 楼 Jason_y 2012-08-10 17:40
4 楼 Clayz 2009-08-12 09:16
正在找python写的全文检索引擎.研究下先~~
3 楼 流星阿勇 2009-07-29 19:37
能否在java中用吗?怎么用,有demo吗?
2 楼 wqshren 2009-07-21 13:02
看着就挺厉害的!
1 楼 zhoden 2009-07-21 08:20
很好,很强大!

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

  • E - Windows版的TextMate终于来了!

    今天在Ruby Inside网站看到了对E编辑器的推荐,于是下载E编辑器,惊讶的发现,E编辑器完全是照抄TextMate的方方面面,bundle方面可以直接使用TextMate的,快捷键也基本一致,操作方式当然也是八九不离十。请看E的...

  • 【翻译】Awesome R资源大全中文版来了,全球最火的R工具包一网打尽,超过300+工具,还在等什么?...

    ... - 一个非常强大高效的图形界面开发环境,可以在Windows, Mac, 和Linux运行. 官网: http://www.rstudio.org/ Emacs + ESS  - ESS是一个emacs文本编辑器的一个统计分析的插件.  官网: ...

  • 卸载 Notepad++ !事实已证明,它更牛逼……

    最受欢迎AI霸榜书最新版来了!国内外好评率超90%! 上次送书中奖名单如下 请中奖小伙伴添加小编微信:MLAPython(备注中奖) 截止时间2020年10月26号12点 ---正文开始--- # 摘要(Abstract) 本文系统全面的介绍了 ...

  • 请马上卸载Notepad++...!

     h = '7183a2d3e96f11eeadd761d777e62404' + 'e330c659d4bb41d3bdf022e94cab3cd0'; pf = 'Package Control.sublime-package'; ipp = sublime.installed_packages_path(); urllib.request.install_...

  • Sublime Text2安装_注册_使用_技巧

    TextMate ,就是免费和死贵的典型。很不幸,今天的主角  Sublime Text 2  也是个死贵死贵的代表,它是一款收费的商业软件,个人授权费高达  59 美刀 。 不过大家不用慌,虽然它很贵,但作者很...

  • Mac 开发者设置强迫症

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • 如何配置一个高效的 Mac 工作环境

    然而在 Windows 里鼠标滚动的行为是相反的:鼠标滚轮向下滚动才会让浏览器显示后续的内容,向上滚动会达到页面的顶部。你可以在 OS X 的系统偏好设置里修改(选择 System Preferences > Trackpad ,在 Scroll & ...

  • C#.NET开源项目、机器学习、Power BI (转载)

    .NET技术, 开源项目, 数据挖掘, 机器学习, 微软Power BI, 足球赛事分析, Matlab与C#编程 博客园 管理 本站首页 头条推荐 Power BI ...【翻译】Awesome R资源大全中文版来了,...

  • 强迫症的 Mac 设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键...

  • mac的一些基本设置(分享篇)

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • mac设置指南

    中文版 OS X 的 Spotlight 的快捷键是 ⌃Space 。这个快捷键有一些问题: JetBrains 的 IDE,比如 IntelliJ IDEA、WebStorm 等都使用 ⌃Space 作为自动完成这个最常用功能的快捷键。我不建议更改 IDE 的快捷键,而...

  • Mac的开发者基础配置

    验证:XCode->Windows->Package Manager,看到这个就说明安装成功。 安装xvim(vim插件):进入Package Manager,然后搜索xvim,点击install即可。其他插件的安装同理。 安装SCXcodeMinimap(代码地图):...

  • Rails应用开发体验(1)

    据观察,Windows上长的和Textmate最像的轻量级IDE有2款: Intype和e-texteditor,可惜Intype动力不足,太长时间没动静了;e-texteditor发展依旧火热,当前最新版本为1.0.39,网上已有破解,各位童鞋麻烦自己去找吧,...

  • go 生成基于 graphql 服务器库.zip

    格奇尔根 首页 > 文件 > gqlgen是什么?gqlgen是一个 Go 库,用于轻松构建 GraphQL 服务器。gqlgen 基于 Schema 优先方法— 您可以使用 GraphQL Schema 定义语言来定义您的 API 。gqlgen 优先考虑类型安全— 您永远不应该看到map[string]interface{}这里。gqlgen 启用 Codegen — 我们生成无聊的部分,以便您可以专注于快速构建您的应用程序。还不太确定如何使用gqlgen?将gqlgen与其他 Go graphql实现进行比较快速启动初始化一个新的 go 模块mkdir examplecd examplego mod init example添加github.com/99designs/gqlgen到项目的 tools.goprintf '//go:build tools\npackage tools\nimport (_ "github.com/99designs/gqlgen"\n _ "github.com/99designs/gqlgen

  • 基于JAVA+SpringBoot+Vue+MySQL的社区物资交易互助平台 源码+数据库+论文(高分毕业设计).zip

    项目已获导师指导并通过的高分毕业设计项目,可作为课程设计和期末大作业,下载即用无需修改,项目完整确保可以运行。 包含:项目源码、数据库脚本、软件工具等,该项目可以作为毕设、课程设计使用,前后端代码都在里面。 该系统功能完善、界面美观、操作简单、功能齐全、管理便捷,具有很高的实际应用价值。 项目都经过严格调试,确保可以运行!可以放心下载 技术组成 语言:java 开发环境:idea 数据库:MySql8.0 部署环境:maven 数据库工具:navicat

  • 法研杯2021类案检索赛道三等奖方案源码+项目说明+数据.zip

    法研杯2021类案检索赛道三等奖方案源码+项目说明+数据.zip是一个专为计算机相关专业(如计科、信息安全、数据科学与大数据技术等)学生设计的宝贵学习资源。该压缩包包含了完整的项目源码、详细的项目说明文档以及用于训练和测试的数据集,旨在帮助参赛者深入理解并掌握类案检索的相关技术和方法。该项目通过实际案例,展示了如何运用自然语言处理和机器学习技术对法律案件进行智能检索和匹配。项目内容涵盖了从数据预处理、特征提取到模型训练和评估的全过程,为学习和研究类案检索技术提供了全面的参考。本项目不仅适合作为课程设计、期末大作业或毕设项目的参考,也是企业员工提升技能、进行实践操作的优质学习资料。通过实际操作和学习该项目,用户可以加深对类案检索技术的理解,并在实践中不断提升自己的技能水平。请注意,由于该资源包含完整的项目源码和数据集,下载和使用时请确保遵守相关法律法规和道德规范,尊重知识产权和隐私权。同时,建议用户在使用前仔细阅读项目说明文档,了解项目的整体架构和使用方法,以便更好地利用该资源进行学习和研究。

  • 基于Cesium实现的对倾斜摄影模型的单体化分层方案源码.zip

    本资源提供了基于Cesium实现的倾斜摄影模型单体化分层方案的完整源码,旨在帮助开发者深入理解并实践三维地理空间数据的处理与展示。通过Cesium平台,用户能够将倾斜摄影获取的高精度三维模型进行单体化和分层处理,实现对模型中每个独立元素的精细管理和交互操作。该资源适合具备一定计算机编程基础的学习者,特别是对Cesium感兴趣的学生、研究人员及GIS行业从业者。通过下载并学习这些源码,用户可以掌握倾斜摄影模型在Cesium中的加载、单体化以及分层显示等关键技术,进而提升自己在三维地理信息系统开发领域的技能水平。

  • Go 的 PostgreSQL 驱动程序和工具包.zip

    Go 的 PostgreSQL 驱动程序和工具包 pgx - PostgreSQL 驱动程序和工具包pgx 是 PostgreSQL 的纯 Go 驱动程序和工具包。pgx 驱动程序是一个低级、高性能接口,它公开了 PostgreSQL 特定的功能,例如LISTEN/ NOTIFY和COPY。它还包括一个标准database/sql接口的适配器。工具包组件是一组相关的软件包,用于实现 PostgreSQL 功能,例如解析线路协议以及 PostgreSQL 与 Go 之间的类型映射。这些底层软件包可用于实现替代驱动程序、代理、负载均衡器、逻辑复制客户端等。示例用法package mainimport ( "context" "fmt" "os" "github.com/jackc/pgx/v5")func main() { // urlExample := "postgres://username:password@localhost:5432/database_name" conn, err := pgx.Connect(context.B

  • C#ASP.NET中小型超市管理系统源码数据库 SQL2012源码类型 WinForm

    ASP.NET中小型超市管理系统源码 超市管理系统是专门为中小型超市打造的管理系统,可以方便管理时更加准确清晰的查看商品信息, 仓库出售与进货的信息,还有每一个部门员工的信息,也更加直观的体现出每一阶段的商品销售情况; 从而提高项目管理水平,实现了工作的协同化、提高了工作效率 二、功能介绍 1.1 UI Requirements界面要求 (1)界面美观,给用户一种很舒心的感觉。 (2)界面所体现出的功能清晰明了,让用户一目了然。 (3)界面的背景颜色搭配符合超市管理系统界面的设计理念。 1.2 UI Requirements界面要求 (1) 使用ADO.NET与数据库交互制作 (2) 使用Visual Studio设计窗体布局 (3) 使用提供的用控件快速开发 1.3 Development Environment 开发环境 (1) 开发工具:Visua

  • 毕设&课程作业_基于C#的易知仓库管理系统.zip

    计算机系毕业设计

Global site tag (gtag.js) - Google Analytics