`
阅读更多

 

Hadoop的发行版除了社区的Apache Hadoop外,ClouderaHortonworksMapREMCIBMIntel华为等都提供了自己的商业版本。商业版主要是提供了专业的技术支持,这对一些大型企业尤其重要。每个发行版都有自己的一些特点,本文就各个发行版做简单介绍。

 

2008 年成立的 Cloudera  是最早将 Hadoop 商用的公司,为合作伙伴提供 Hadoop 的商用解决方案,主要是包括支持咨询服务培训2009Hadoop的创始人 Doug Cutting也加盟 Cloudera公司。Cloudera 产品主要为CDHCloudera  ManagerCloudera  SupportCDHClouderaHadoop发行版,完全开源,比Apache Hadoop在兼容性,安全性,稳定性上有所增强。Cloudera  Manager是集群的软件分发及管理监控平台,可以在几个小时内部署好一个Hadoop集群,并对集群的节点及服务进行实时监控。Cloudera  Support即是对Hadoop的技术支持。Cloudera 的标价为每年每个节点4000美元Cloudera开发并贡献了可实时处理大数据的Impala项目。

 

2011年成立的Hortonworks是雅虎与硅谷风投公司Benchmark Capital合资组建的公司。公司成立之初就吸纳了大约25名至30名专门研究Hadoop的雅虎工程师,上述工程师均在2005年开始协助雅虎开发Hadoop,这些工程师贡献了Hadoop 80%的代码。雅虎工程副总裁、雅虎Hadoop开发团队负责人Eric Baldeschwieler出任Hortonworks的首席执行官。Hortonworks 的主打产品是Hortonworks Data Platform (HDP),也同样是100%开源的产品,HDP除了常见的项目外还包含了Ambari,一款开源的安装和管理系统。HCatalog,一个元数据管理系统,HCatalog现已集成到Facebook 开源的Hive中。HortonworksStinger开创性地极大地优化了Hive项目。Hortonworks为入门提供了一个非常好的,易于使用的沙盒。Hortonworks开发了很多增强特性并提交至核心主干,这使得Apache Hadoop能够在包括Windows ServerWindows Azure在内的Microsoft Windows平台上本地运行。定价以集群为基础,10个节点每年为12500美元

 

2009年成立的MapR公司在Hadoop领域显得有点特立独行,它提供了一款独特的发行版 。Hadoop在性能(Hadoop1.X及其之前的设计中,所有的meta data操作都要通过集中式的NameNode来进行,NameNode有可能是性能的瓶颈;M/R 应用程序需要通过NameNode来访问HDFS, 这就涉及到额外的进程切换和网络传输开销),可用性与扩展性(NameNodeJobTracker单点问题),企业级应用上的弱点(比如完全可读写的文件系统,snapshotmirror等等)各大厂商均知,MapR则认为,Hadoop的这些缺陷来自于其架构设计本身,小修小补不能解决问题。他们选择了一条艰难得多的路: 用新架构重写HDFS,同时在API级别,和目前的Hadoop 发行版保持兼容。这家2009年成立的创业公司,在蛰伏了两年之后,终于一鸣惊人,大放异彩。他们成功实现了构建一个HDFS的私有替代品,这个替代品比当前的开源版本快三倍,自带快照功能,而且支持无NameNode单点故障(SPOF),并且在API上和开源版兼容,所以可以考虑将其作为替代方案MapR版本不再需要单独的NameNode机器,元数据分散在集群中,也类似数据默认存储三份,正如OpenStack对象存储系统Swift的设计。也不再需要用网络附加存储(NAS)来协助NameNode做元数据备份,提高了机器使用率。还有个重要的特点是可以使用nfs直接访问hdfs,提供了与旧有应用的兼容性。镜像功能也很适合做数据备份,而且支持跨数据中心的镜像,快照功能对于数据的恢复作用明显。MapR还领导着Apache Drill项目,该项目是Google Dremel的开源实现,目的是在Hadoop上执行类似SQL的交互实时查询。MapR有免费和商业两个版本,免费版本在功能上有所缩减。据报道MapR标价也为每年每个节点4000美元

 

EMCPivotal  HD除了所有Apache Hadoop发行版都必不可少的管理工具之外,它还提供了一个高效的数据装载器,另外还有一个Hadoop虚拟机,重头戏是HAWQHAWG是一个构建在HDFS上的通过SQL进行数据分析的方案,即构建在HDFS上的MPP DB。相比HivePIG等其他SQL解释器,它有完备的DBMS管理功能,支持标准SQL语法,在性能上更加接近原有DB如果之前使用了Greenplum数据库,那么Pivotal HD就是一个完美的选择。

 

IBM推出了InfoSphere BigInsights大数据平台,由许多开源技术如 Apache HadoopPigHiveHbaseFlume等以及许多 IBM 技术如针对IBMDB2数据库的连接件以及BigSheets等组成BigSheets是一种基于浏览器的、使用电子表格隐喻(spreadsheet-metaphor)的界面,用于探究和分析Hadoop里面的数据。IBM平台管理,安全认证,作业调度算法,与DB2netezza的集成上做了增强。从IBM中国开发中心信息管理总经理朱辉下面这句话就可以看出IBM对于BigInsights的定位:BigInsights并没有替代OLAP(Online Analytical Processing)OLTP(Online Transaction Processing)应用程序,但它可以整合其中,用于过滤大量原始数据并合并结果,将结果以结构化数据的形式保存在DBMS或数据仓库中

 

传统的硬件厂商Intel华为也提供了Hadoop发行版。

 

Intel的商业版本,主要是强调其能提供全面的软硬件解决方案设计针对硬件具有更好的性能优化,以及提供集群管理工具和安装工具简化了 Hadoop 的安装和配置,能够提供项目规划到实施各阶段专业的咨询服务,实际中采购Intel版本貌似动力不足。

 

华为在硬件上具有天然的优势,在网络,虚拟化,PC机等都有很强的硬件实力。华为的FusionInsight Hadoop版本基于Apache Hadoop,构建NameNodeJobTrackerHiveServerHA功能,进程故障后系统自动Failover,无需人工干预,这个也是对Hadoop的小修补,远不如MapR解决的彻底。华为在Hadoop社区中的ContributorCommitter也是国内最多的,算是国内技术实力较强的公司。

 

MicrosoftHortonworks相互合作,特别是合作将Apache Hadoop引入到Windows Server操作系统和Windows Azure云服务中。

 

Oracle通过将自己的软硬件与ClouderaApache Hadoop发行版本结合到一起,提供一个大数据应用产品。而像SAPTalend这样的软件提供商则同时支持几个不同的发行版本

 

4
1
分享到:
评论
4 楼 yangshangchuan 2013-11-09  
hanwangkun 写道
不要只单单介绍,能否给初学者一些建议,学习哪个版本更好些。


初学者用社区版比较好
3 楼 dacoolbaby 2013-11-08  
用Cloudera就好了嘛。。。
2 楼 white_crucifix 2013-11-08  
hanwangkun 写道
不要只单单介绍,能否给初学者一些建议,学习哪个版本更好些。


当然是社区版啊,其他都是商业版
1 楼 hanwangkun 2013-11-08  
不要只单单介绍,能否给初学者一些建议,学习哪个版本更好些。

相关推荐

    Hadoop发行版现状

    Hadoop发行版现状

    浪潮Hadoop发行版介绍

    七、浪潮Hadoop发行版产品与服务 除了上述组件外,浪潮还提供全面的产品和服务,包括技术支持、培训、定制化开发等,以确保用户能够充分利用Hadoop发行版解决实际业务问题,提升数据分析能力,从而在大数据时代获得...

    英特尔Hadoop发行版 2.3中文手册全套

    英特尔 Apache Hadoop* 软件发行版安全指南 2.3 57页 英特尔 Apache Hadoop* 软件发行版REST API 手册2.3 95页 英特尔 Apache Hadoop* 软件发行版操作管理 手册 2.3 75页 英特尔 Apache Hadoop* 软件发行版安装手册 ...

    英特尔Hadoop发行版白皮书

    Intel 的 Hadoop 发行版是经过测试和验证的稳定版本, Intel 的集 群管理工具和安装工具简化了 Hadoop 的安装和配置。

    英特尔Hadoop发行版 2.2 新手指南

    ### 英特尔Hadoop发行版 2.2 新手指南关键知识点解析 #### 一、简介 **1.1 文档目的** 本文档旨在为英特尔®Hadoop发行版的新用户提供一套全面的指南,帮助他们从零开始安装、部署、验证,并开始使用该发行版。...

    英特尔Hadoop发行版2.2产品单页

    ### 英特尔Hadoop发行版2.2关键知识点解析 #### 一、英特尔Hadoop发行版概述 - **背景**: 随着大数据时代的到来,企业面临着前所未有的数据处理挑战。Hadoop作为一款开源的大数据处理框架,因其强大的分布式处理...

    Hadoop发行版CM5与CDH5集群部署手册.pdf

    Hadoop发行版CM5与CDH5集群部署手册.pdf

    CDH5Hadoop发行版离线安装手册.docx

    与其他Hadoop发行版如Hortonworks的HDPS相比,CDH以其丰富的生态系统和强大的社区支持脱颖而出。CDH分为免费版和付费版,其中免费版虽然缺少一些高级管理功能,但在功能性和性能上依然表现出色。 **1.2 为什么选择...

    英特尔Hadoop发行版 2.2 开发者指南

    【英特尔Hadoop发行版2.2开发者指南】是专为开发者设计的一份详细文档,旨在帮助用户快速理解和应用英特尔优化的Hadoop环境。Hadoop是一个分布式计算框架,它改变了大数据处理的游戏规则,允许用户处理和存储超出...

    英特尔Hadoop发行版+企业级解决方案.pdf

    英特尔Hadoop发行版凭借其出色的企业级特性、丰富的功能模块以及广泛的行业应用,成为了企业构建高性能、高稳定性的大数据处理平台的理想选择。无论是电信、金融、医疗还是制造业,都能够从中受益,实现数据驱动的...

    Hadoop发行版主流厂商对比分析.docx

    【Hadoop发行版主流厂商对比分析】 在大数据处理领域,Hadoop已经成为不可或缺的基石,而各大主流厂商如Cloudera、华为和星环等...选择Hadoop发行版时,应根据具体需求和场景,综合考虑各厂商的技术优势和生态兼容性。

    Hadoop各商业发行版之比较.pdf

    Hortonworks是由雅虎工程师创立的,其Hadoop发行版Hortonworks Data Platform (HDP)也是开源的。HDP包含了稳定版本的Apache Hadoop组件,并且拥有Ambari这样的安装和管理系统,以及HCatalog元数据服务。HDP强调了...

    Hadoop的发行版本.pdf

    【Hadoop发行版本详解】 Hadoop作为开源大数据处理...总的来说,选择Hadoop发行版本应根据具体需求和应用场景,考虑稳定性、安全性以及新特性的需求。同时,关注社区更新和版本维护,以便及时获取最新的功能和优化。

    Hadoop各商业发行版之比较.docx

    《Hadoop各商业发行版之比较》 Hadoop,作为大数据处理的核心框架,因其开源、分布式的特点,吸引了众多企业和开发者参与其中。除了Apache Hadoop的社区版本,各大科技巨头纷纷推出了自己的商业发行版,旨在为企业...

    英特尔Hadoop发行版 2.2 管理手册

    ### 英特尔Hadoop发行版 2.2 管理手册知识点解析 #### 一、概述 **Intel® Manager for Hadoop**是英特尔针对Apache Hadoop开发的一款集成了安装、配置、监控和管理Hadoop集群的强大工具。它简化了Hadoop集群的...

    window版本下的hadoop 2.7.2版本的hadoop.dll和winutils.exe

    要在Windows上设置Hadoop开发环境,首先需要下载Hadoop 2.7.2的二进制发行版,这通常包括`hadoop.dll`和`winutils.exe`。下载后,解压到本地文件夹,并确保你有Java JDK安装且版本兼容(Hadoop 2.7.2通常需要Java 7...

    英特尔Apache Hadoop 软件发行版安装手册2.3

    该手册为2013年2月版本,主要目的是提供关于英特尔提供的Apache Hadoop发行版v2.3的安装指导和相关信息。手册详细说明了安装过程中需要注意的条款、法律责任以及英特尔的免责声明。此外,手册中还包含了对英特尔产品...

Global site tag (gtag.js) - Google Analytics