Hadoop的发行版除了社区的Apache hadoop外,cloudera,hortonworks,mapR,EMC,IBM,INTEL,华为等等都提供了自己的商业版本。商业版主要是提供了专业的技术支持,这对一些大型企业尤其重要。每个发行版都有自己的一些特点,本文就各发行版做简单介绍。
2008 年成立的 Cloudera 是最早将 Hadoop 商用的公司,为合作伙伴提供 Hadoop 的商用解决方案,主要是包括支持,咨询服务,培训。2009年hadoop的创始人 Doug Cutting也任职于 Cloudera 公司。Cloudera产品主要为CDH,Cloudera Manager,Cloudera Support。CDH是Cloudera的hadoop发行版,完全开源,比Apache hadoop在兼容性,安全性,稳定性上有增强。Cloudera Manager是集群的软件分发及管理监控平台,可以在几个小时内部署好一个hadoop集群,并对集群的节点及服务进行实时监控。Cloudera Support即是对hadoop的技术支持。cloudera的标价为每年每个节点4000美元。
2011年成立的Hortonworks是雅虎与硅谷风投公司Benchmark Capital合资组建的公司。公司成立之初吸纳了大约25名至30名专门研究Hadoop的雅虎工程师,上述工程师均在2005年开始协助雅虎开发Hadoop,这些工程师贡献了hadoop 80%的代码。。雅虎工程副总裁、雅虎Hadoop开发团队负责人Eric Baldeschwieler出任Hortonworks的首席执行官。Hortonworks 的主打产品是Hortonworks Data Platform (HDP),也同样是100%开源的产品,HDP除了常见的项目外还包含了Ambari,一款开源的安装和管理系统。HCatalog,一个元数据管理系统。
HDP的Datasheet中描述的版本特点是:
集成和测试封装——HDP包括稳定版本的Apache Hadoop的所有关键组件,集成和测试封装。
安装方便——HDP包括一个现代化的,直观的用户界面的安装和配置工具。
管理和监控服务——HDP包括直观的仪表板,为监测集群和建立警示。
数据集成服务——HDP包括Talend大数据平台,领先的开源整合工具,轻松连接Hadoop集群,而无需编写Hadoop代码的数据系统集成工具。
元数据服务——HDP包括的Apache HCatalog,从而简化了Hadoop的应用程序之间和Hadoop和其他数据系统之间的数据共享。
高可用性——HDP与成熟的高可用性解决方案的无缝集成。
定价以集群为基础,每10个节点每年为12500美元。
cloudera和hortonworks均是在不断的提交代码完善Apache hadoop,而2009年成立的MapR公司在Hadoop领域显得有点特立独行,它提供了一款独特的发行版 。Hadoop在性能(在当前Hadoop的设计中,所有的meta data操作都要通过集中式的Namenode来进行,Namenode有可能是性能的瓶颈;M/R 应用程序需要通过DataNode来访问HDFS, 这就涉及到格外的进程切换和网络传输开销),可靠性与扩展性(namenode,jobtracker单点问题),企业级应用上的弱点(比如完全可读写的文件系统,snapshot,mirror等等)各大厂商均知,MapR则认为,Hadoop的这些缺陷来自于其架构设计本身,小修小补不能解决问题。他们选择了一条艰难得多的路: 用新架构重写HDFS,同时在API级别,和目前的Hadoop 发行版保持兼容。这家2009年成立的创业公司,在蛰伏了两年之后,终于一鸣惊人,大放异彩。他们成功的“构建一个HDFS的私有替代品,这个替代品比当前的开源版本快三倍,自带快照功能,而且支持无Namenode单点故障(SPOF),并且在API上和兼容,所以可以考虑将其作为替代方案。” mapR版本不再需要单独的namenode机器,元数据分散在集群中,也类似数据默认存储三份。也不再需要用NAS来协助namenode做元数据备份,提供了机器使用率。还有个重要的特点的可以使用nfs直接访问hdfs,提供了与旧有应用的兼容性。镜像功能也很适合做数据备份,而且支持跨数据中心的镜像,快照功能对于数据的恢复作用明显。据报道mapR标价也为每年每个节点4000美元。
mapR有免费和商业两个版本,免费版本在功能上有所缩减。
EMC的Greenplum HD是基于mapR版本二次开发改造而成,特点同mapR。
IBM在去年5月推出了InfoSphere BigInsights软件。该软件包括Apache Hadoop发行版、面向MapReduce编程的Pig编程语言、针对IBM的DB2数据库的连接件以及IBM BigSheets,后者是一种基于浏览器的、使用电子表格隐喻(spreadsheet-metaphor)的界面,用于探究和分析Hadoop里面的数据。IBM在平台管理,安全认证,作业调度算法,与DB2及netezza的集成上做了增强。从IBM中国开发中心信息管理总经理朱辉下面这句话就可以看出IBM对于biginsights的定位:BigInsights并没有替代OLAP(Online Analytical Processing)或OLTP(Online Transaction Processing)应用程序,但它可以整合其中,用于“过滤大量原始数据并合并结果,将结果以结构化数据的形式保存在DBMS或数据仓库中”。
传统的硬件厂商,华为,Intel也提供hadoop的版本
Intel 的商业版本,主要是强调其能提供全面的软硬件解决方案设计,针对硬件具有更好的性能优化,以及提供集群管理工具和安装工具简化了 Hadoop 的安装和配置,能够提供项目规划到实施各阶段专业的咨询服务,实际中采购Intel版本貌似动力不足。
华为在硬件上具有天然的优势,在网络,虚拟化,PC机等都有很强的硬件实力。华为的hadoop版本基于自研的Hadoop HA平台,构建NameNode、JobTracker、HiveServer的HA功能,进程故障后系统自动Failover,无需人工干预,这个也是对hadoop的小修补,远不如mapR解决的彻底。华为在hadoop社区中的Contributor和committer也是国内最多的,算是国内技术实力较强的公司。
相关推荐
标题中的“Hadoop各商业发行版之比较”指的是对不同公司提供的基于Apache Hadoop的商业版本的分析和对比。这些商业发行版通常包含了Hadoop的核心组件,并提供了额外的支持和服务,以满足企业级用户的需求。 Hadoop...
《Hadoop各商业发行版之比较》 Hadoop,作为大数据处理的核心框架,因其开源、分布式的特点,吸引了众多企业和开发者参与其中。除了Apache Hadoop的社区版本,各大科技巨头纷纷推出了自己的商业发行版,旨在为企业...
【Hadoop发行版本详解】 Hadoop作为开源大数据处理框架,其发行版本的更新与改进对开发者和企业至关重要。本文主要探讨了Hadoop的不同发行版本及其特点,帮助用户选择适合的版本。 1. **1.xx发行版本系列**:这是0...
英特尔®Hadoop发行版是一个稳定可靠的商业版本,包含了HDFS、HBase和MapReduce框架等关键组件。这些组件经过优化,能够在英特尔平台上提供最佳性能。此外,该发行版还包括一系列高级功能和服务,如Zookeeper...
【英特尔Hadoop发行版2.2开发者指南】是专为开发者设计的一份详细文档,旨在帮助用户快速理解和应用英特尔优化的Hadoop环境。Hadoop是一个分布式计算框架,它改变了大数据处理的游戏规则,允许用户处理和存储超出...
4. **CDH**: CDH是Cloudera对Hadoop生态的商业发行版,它包含了经过测试和优化的Hadoop组件,包括HDFS、MapReduce、YARN等,同时也包含了其他如Hive(SQL查询工具)、Pig(数据流编程工具)、Oozie(工作流调度器)...
Cloudera则是一家早期将Hadoop商业化的公司,提供包括支持、咨询服务和培训在内的Hadoop解决方案。Cloudera的Hadoop发行版CDH在兼容性、安全性、稳定性方面进行了增强,并提供了Cloudera Manager这样的集群管理和...
Hadoop商业版本的运营企业,比如Cloudera和Hortonworks,通常会收取一定的费用。这些费用用于提供技术支持、咨询服务和培训等。此外,商业版Hadoop还会开发一些特定的特性,如Cloudera的Impala项目用于实时处理...
Hadoop商业发行版也相继推出,如Cloudera、Hortonworks等,它们为Hadoop提供附加产品及技术支持。Cloudera是最早提供Hadoop商业解决方案的公司之一,其产品线涵盖CDH、Cloudera Manager和Cloudera Support等。CDH是...
### 大数据之路选择Hadoop还是MaxCompute? #### 一、Hadoop与MaxCompute概述 ##### 1.1 Hadoop介绍与发展历程 Hadoop是由Apache软件基金会开发的一个开源分布式计算平台,采用Java语言编写,旨在支持大规模数据...
Hadoop版本主要分为原生Apache Hadoop版本和Hadoop商业发行版两种。其中,商业发行版Hadoop多为原生Apache Hadoop的集群模式下的优化版,除少数社区版外,商业发行版大多需要付费使用,且对于初学者而言使用难度较大...
市场上有许多基于Hadoop的商业发行版,如Cloudera公司的CDH(Cloudera Distribution Including Apache Hadoop),目前最新的版本为CDH4,它是基于Apache Hadoop 0.20.2版本进行演化的。 #### 二、Hadoop的核心组件 ...
Cloudera Distribution Including Apache Hadoop 是一个基于 Apache Hadoop 的商业发行版,由 Cloudera 公司维护。它提供了一个完整的 Hadoop 解决方案,包括安装、配置和支持服务。 本手册提供了 Hadoop 配置、...
- **Hadoop三大发行版本**:Apache是最基础的版本,Cloudera适用于大型企业,Hortonworks则以其优秀的文档支持著称。 综上所述,大数据不仅是一种技术概念,它已经深入到各个行业中,成为推动业务创新和决策优化的...