• 13 款开源的全文搜索引擎(转)


    add by zhj:  Nutch是一个开源的web搜索引擎,呵呵,它跟商业搜索引擎如Google,百度的技术差不多,原来自己一不小心就进入了商业搜索引擎的领域,之前还以为商业搜索引擎离自己非常遥远呢,今天我还要想Solr, Elasticsearch这些全文搜索引擎与Google,百度这些商业搜索引擎有什么区别,看了一些文章后知道了,原来主要差别就是Solr, Elasticsearch没有网络爬虫。我们可以近似的认为Nutch是在Solr, Elasticsearch的基础上加了网络爬虫功能。不过,我还是不明白搜索引擎与数据库查询到底有什么技术方面的区别,反正都是用的索引嘛,为何需要专门的搜索引擎呢?有时间还要好好研究一下

    原文:xum2008的博客 主要介绍13款现有的开源搜索引擎,你可以将它们用在你的项目中以实现检索功能。 

    1.  Lucene 

    Lucene的开发语言是Java,也是Java家族中最为出名的一个开源搜索引擎,在Java世界中已经是标准的全文检索程序,它提供了完整的查询引擎和索引引擎,没有中文分词引擎,需要自己去实现,因此用Lucene去做一个搜素引擎需要自己去架构.另外它不支持实时搜索,但linkedin和twitter有分别对Lucene改进的实时搜素. 其中Lucene有一个C++移植版本叫CLucene,CLucene因为使用C++编写,所以理论上要比lucene快. 

    官方主页:http://lucene.apache.org/ 

    CLucene官方主页:http://sourceforge.net/projects/clucene/ 

    2.  Sphinx 

    Sphinx是一个用C++语言写的开源搜索引擎,也是现在比较主流的搜索引擎之一,在建立索引的事件方面比Lucene快50%,但是索引文件比Lucene要大一倍,因此Sphinx在索引的建立方面是空间换取事件的策略,在检索速度上,和lucene相差不大,但检索精准度方面Lucene要优于Sphinx,另外在加入中文分词引擎难度方面,Lucene要优于Sphinx.其中Sphinx支持实时搜索,使用起来比较简单方便. 

    官方主页:http://sphinxsearch.com/about/sphinx/ 

    3.  Xapian 

    Xapian是一个用C++编写的全文检索程序,它的api和检索原理和lucene在很多方面都很相似,算是填补了lucene在C++中的一个空缺. 

    官方主页:http://xapian.org/ 

    4.  Nutch 

    Nutch是一个用java实现的开源的web搜索引擎,包括爬虫crawler,索引引擎,查询引擎。商业搜索引擎(如Google,百度)不开源,搜索结果不纯粹是根据网页本身的价值进行排序,而是有众多商业利益考虑。Nutch提供了开源的解决方案,帮助人们很容易地建立一个搜索引擎,为用户提供优质的搜索结果,并能从一台机器扩展到成百上千台。通过Nutch,我们可以对百度、谷歌这样的搜索巨头的内部机制有所了解,并能根据自己的需要打造适合自己的搜索引擎。Nutch是基于Lucene的,Lucene为Nutch提供了文本索引和搜索的API. 对于应该使用Lucene还是使用Nutch,应该是如果你不需要抓取数据的话,应该使用Lucene,最常见的应用是:你有数据源,需要为这些数据提供一个搜索页面,在这种情况下,最好的方式是直接从数据库中取出数据,并用Lucene API建立索引。

    官方主页:http://nutch.apache.org/ 

    5.  DataparkSearch 

    DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型.  其中支持HTTP,HTTPS,FTP,NNTP等下载网页.包括索引引擎,检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).能个性化定制搜索结果,拥有完整的日志记录. 

    官方主页:http://www.dataparksearch.org/ 

    6.  Zettair 

    Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气,是业界第一个系统提出倒排序索引差分压缩算法的人,倒排列表的压缩大大提高了检索和加载的性能,同时空间膨胀率也缩小到相当优秀的水平. 由于Zettair是源于学术界,代码是由RMIT University的搜索引擎组织写的,因此它的代码简洁精炼,算法高效,是学习倒排索引经典算法的非常好的实例. 其中支持linux,windows,mac os等系统. 

    官方主页:http://www.seg.rmit.edu.au/zettair/about.html 

    7.  Indri 

    Indri是一个用C语言和C++语言写的全文检索引擎系统,是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目. 特点是跨平台,API接口支持Java,PHP,C++. 

    官方主页:http://www.lemurproject.org/indri/ 

    8.  Terrier 

    Terrier是由School of Computing Science,Universityof Glasgow用java开发的一个全文检索系统. 

    官方主页:http://terrier.org/ 

    9.  Galago 

    Galago是一个用java语言写的关于文本搜索的工具集. 其中包括索引引擎和查询引擎,还包括一个叫TupleFlow的分布式计算框架(和google的MapReduce很像).这个检索系统支持很多Indri查询语言. 

    官方主页:http://www.galagosearch.org/ 

    10.  Zebra 

    Zebra是一个用C语言实现的检索程序,特点是对大数据的支持,支持EMAIL,XML,MARC等格式的数据. 

    官方主页:https://www.indexdata.com/zebra 

    11.  Solr 

    Solr是一个用java开发的独立的企业级搜索应用服务器,它提供了类似于Web-service的API接口,它是基于Lucene的全文检索服务器,也算是Lucene的一个变种,很多一线互联网公司都在使用Solr,也算是一种成熟的解决方案. 

    官方主页:http://lucene.apache.org/solr/ 

    12.  Elasticsearch 

    Elasticsearch是一个采用java语言开发的,基于Lucene构造的开源,分布式的搜索引擎. 设计用于云计算中,能够达到实时搜索,稳定可靠. Elasticsearch的数据模型是JSON. 

    官方主页:http://www.elasticsearch.org/ 

    13.  Whoosh 

    Whoosh是一个用纯python写的开源搜索引擎. 

    官方主页:https://bitbucket.org/mchaput/whoosh/wiki/Home 

  • 相关阅读:
    Struts2 与 Spring MVC
    RESTful Web Service
    [找程序员代写推荐]spring Scurity终于测试OK了,复杂的功能还待深入研究!发布出来一起探讨吧!
    [找程序员代写推荐]1、拖地要30分钟, 只有一个拖把 2、擦窗要30分钟, 只有一块抹布 3、切菜要30分钟, 只有一把刀 假设只有以上工具才能完成工作时,完成此三件 工作需要两个人工作多长时间?
    [原]精简高效CSS系列之二——浮动float
    [找程序员代写推荐]struts2验证+拦截器+国际化+下载excle文档+struts2二级联动+OGNL表达试+ssh集成部分代码, 项目下载、
    [原]精简高效CSS系列之一——CSS样式用法
    [原]反对网抄,没有规则可以创建目标"install" 靠谱解答
    如何鉴别程序抄袭c语言程序代写
    [原]CSS+DIV总结
  • 原文地址:https://www.cnblogs.com/ajianbeyourself/p/4287145.html
Copyright © 2020-2023  润新知