新浪科技讯 7月8日下午消息,阿里云计算发布大数据产品——ODPS。通过ODPS在线服务,小型公司花几百元即可分析海量数据。ODPS可在6小时内处理100PB数据,相当于1亿部高清电影。此前,全球掌握这种能力的公司仅有Google、亚马逊(323.81, -9.74,-2.92%)等少数几家。
阿里云ODPS团队在一封公开信《人人都可以成为BAT》中表示:工业革命后的200多年里,人类对物理资源的利用登峰造极,对数据资源的利用却仍处于起步阶段。Google、Facebook(62.76, -2.53, -3.88%)、阿里巴巴(滚动资讯)等互联网公司先行一步,触碰到了大数据的魅力。然而,人类拥有的绝大部分数据还无法产生价值。
采用传统方案处理大规模数据,一般得耗资数千万自建数据中心,请专业技术人员维护运作。一旦数据总量超过100TB,技术挑战会非常大。Hadoop开源运动降低了这一成本,不过自建一个像样的Hadoop集群,仍然需要上百万的起步资金。专业的Hadoop人才则更加稀缺。
相比而言,使用ODPS的成本和门槛则低得多。ODPS采取按量收费的模式,目前定价0.3元/GB,即开即用,一个月内免费。根据大部分公司的数据量来测算,一般每月只需花费数百元。
在对外商用之前,ODPS只是阿里巴巴内部秘密使用。阿里小贷最先将ODPS应用到商业领域。如今,超过36万人从阿里小贷借款,最小贷款额为1元,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。阿里小贷每笔贷款成本3毛钱,不到普通银行的1/1000。
据悉,淘宝、支付宝等阿里巴巴最核心的数据业务,都运行在ODPS平台。比如阿里妈妈广告的核心算法,点击预测模型的训练等。ODPS商用,意味着阿里云将这种大数据处理能力对外开放,此举将大幅降低社会创新成本。
目前,全球提供类似服务的仅有Google和亚马逊,国内尚无同类产品可供比较。阿里云方面表示,ODPS将比Google BigQuery更强大,不仅支持更丰富的SQL语法,还将提供MapReduce编程模型和机器学习建模能力,可以服务更多应用场景。(木南)
以下为阿里云ODPS团队公开信《人人都可以成为BAT》全文:
阿里云计算最重要的一款产品——ODPS,正式开放商用。从今天起,花个几百块钱,人人都能来玩大数据。
简单来说,ODPS(Open Data Processing Service)是一项Web服务,大家不用花大钱建数据中心,就能分析海量数据。我们测过,100PB的数据任务可在6小时内跑完。这个数据量相当于1亿部高清电影。
工业革命后的200多年里,人类对物理资源的利用登峰造极。第一次信息革命过去70年了,我们对数据资源的利用却只是刚开了头。Google、Facebook、阿里巴巴等先行一步,摸到了大数据的冰山一角。然而,人类拥有的大部分数据,还无法产生价值。
如何让数据产生价值?先得拥有大规模处理能力,然后才是挖掘、算法和分析。传统的做法是这样的:租个机房,买一堆昂贵的设备搭建数据仓库,再请一帮技术人员来维护运转。一旦触发bug,或者当数据总量超过100TB时,你的工程师们可能会被这些麻烦搞崩溃。
Hadoop开源系统很伟大,大大降低了成本。阿里是中国玩Hadoop玩得最好的几家公司之一,Hadoop支撑了淘宝、支付宝早期业务的快速发展。不过,自建一个像样的Hadoop集群,得百万起步资金,专业的Hadoop人才更是稀缺。门槛还是太高。
有没有更好的方案?从2009年初,写下“飞天”第一行代码时,我们就坚信这一方案存在。我们用了五年时间,写下250万行代码,终于在自主研发的“飞天”平台上成功搭建ODPS。我们把数据海洋里的“水”灌进ODPS,设定好一套参数,拧开水龙头,出来的就是“鲜榨果汁”!
100年前,福特推出了全球第一条流水生产线。一个个零部件扔进流水线,90分钟后,一辆崭新的汽车摆在面前。不知道福特工程师们当时是怎样的心情。当我们拧开ODPS的水龙头时,感受大抵如此。这个比喻还不完全恰当,福特生产线只为福特服务,一条生产线也只能生产一种车型。而ODPS任何人都可以来用,水龙头里流出来的“果汁”,随着原始数据和算法的改变可以千变万化。
我们来看看ODPS都可以榨哪些“果汁”吧。
ODPS之前一直在阿里内部试用。第一个“小白鼠”是阿里小贷。你见过敢贷1块钱给你的银行吗?如今,超过36万人从阿里小贷借款,最小贷款额1块钱,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。另外,阿里小贷每笔贷款成本3毛钱。什么?你问普通银行的贷款成本?先乘个1000再说。
华大基因,2003年国内抗SARS研究的主力军。去年,我们邀请华大在ODPS上试了下基因测序,耗时不到传统方式的十分之一。2010年,欧洲E.coli污染危机,测序和组装耗时两天以上。如果用ODPS,只要几个小时甚至几十分钟。一旦未来真有生物危机爆发,人类可以赢得宝贵的破译时间。
这么高精尖的领域你可能觉得太遥远。说说当前最火的世界杯吧。Google拿英国体育数据提供商Opta Sports的数据,在BigQuery上跑了跑,成功预测了本届世界杯8强名单。ODPS是一款跟Google BigQuery类似的产品,如果哪位有数据,也可以来算一算接下来的比赛。
公共领域的数据挖掘,可以用ODPS吗?当然!结合中国气象局的精准预报数据,高德(20.95, 0.06, 0.29%)地图不久后就能告诉你:“前方道路已严重积水,您的车辆驶入可能会遭水淹,建议绕道行驶。”如今,每盒药品上都有一张电子身份证,从生产、流通、储存、配送、销售到使用,全过程的数据都跑在ODPS上,一旦发现问题药品,监管部门可以立即采取措施。我们期待未来每一桶油、每一道菜的数据都跑在ODPS上,食品安全问题需要通过创新的方式来解决。
生产电饭煲的工厂,应该跟ODPS没什么关系吧?别说,未来还真可能有关系。手机、电视、手表、汽车、空调……这些工业时代的经典产品,现在都变成了互联网终端。谁说电饭煲、鞋子、衣服不会呢?如果未来的制造工厂都变成互联网公司,数据将成为最基本的生产要素。你不懂算法、不会建模、不会分析,没关系,那些有数据分析能力的公司会帮你做。
眼下,阿里巴巴各项数据业务都在用ODPS“榨果汁”,比如淘宝在算你最中意哪个淘女郎,天猫在算你什么时候想吃车厘子,菜鸟在算卡车走哪条路可能会被雷劈,支付宝在算你何时会从屌丝变成高富帅。如果大家也想“榨果汁”,欢迎来试。ODPS的水龙头就装在阿里云官网aliyun.com上,一个月内免费。
The World Is Flat. 从某种意义上而言,人人都可以成为BAT,哪怕你的公司只有几号人。我们希望,在技术这件事情上,大家变得更加平等!
阿里云ODPS团队
2014年7月8日
转载请注明:数据时代·数据价值_www.shujujiazhi.com » 大数据产品ODPS 6小时处理100PB数据
相关推荐
阿里云ODPS(Open Data Processing Service)是一款大数据处理服务,主要面向海量数据的批处理、交互式查询和分析。ODPS提供了SQL接口,使得开发者能够用熟悉的SQL语法进行大数据操作,极大地降低了大数据处理的门槛...
阿里云ODPS机器学习平台,简称PAI,是构建在阿里云ODPS计算服务之上的一个全面的机器学习解决方案。这个平台旨在简化大数据处理、建模、离线预测以及在线预测的过程,为算法开发者和使用者提供了一个高效且易用的...
1. **大数据存储**:ODPS提供了海量数据的存储能力,支持TB到PB级别的数据存储,采用列式存储方式,优化了数据分析的效率。 2. **离线计算**:ODPS提供了SQL-like的查询语言ODPS SQL,用于进行大数据的离线分析,...
ODPS采用了分布式计算模型,能够处理PB级别的数据,并且提供了SQL接口,使得数据分析师和开发者可以使用熟悉的SQL语言进行大数据处理,大大降低了大数据应用的门槛。书中详细阐述了ODPS的数据模型,如表的创建、数据...
4. **AnalyticDB**: 阿里云AnalyticDB(原名ADS)是一款实时在线分析服务,能够提供毫秒级的查询响应速度,适用于实时业务分析。它基于列式存储,优化了大数据分析性能,适合电商、金融等需要实时数据洞察的行业。 ...
阿里云提供了ECS(Elastic Compute Service)作为计算基础,ODPS(Open Data Processing Service)用于大数据处理,MaxCompute作为大数据存储和分析平台,以及RDS(Relational Database Service)等数据库服务。...
开放数据处理服务(ODPS)是由阿里巴巴集团研发的一种大数据处理与分析平台,基于飞天内核构建,旨在提供PB级别的数据处理能力。ODPS通过RESTful API接口对外提供服务,使得开发者能够方便地进行大规模数据的存储、...
- **数据处理能力**:阿里云不仅提供了强大的计算能力,还构建了一个能够处理海量数据的大数据平台。该平台支持离线和在线应用,可以处理数十亿级别的网页数据,并提供毫秒级的响应速度。 - **数据价值挖掘**:通过...
ODPS,全称为Open Data Processing Service,是阿里云推出的一种大数据处理服务,旨在为企业提供海量数据的存储和计算能力。《ODPS权威指南》作为最新版的参考资料,深入讲解了ODPS的核心特性和应用场景,是学习和...
通过结合先进的分布式计算技术和丰富的云服务产品,阿里云能够满足用户在存储、计算、数据库以及大数据分析等方面的需求。 #### 二、核心组件解析 ##### 1. **数据中心(DataCenter)** - **硬件基础**:基于x86...
大数据计算服务是阿里云提供的一个快速、完全托管的TB/PB级数据仓库解决方案,它叫做MaxCompute,原名ODPS。MaxCompute向用户提供了完善的数据导入方案以及多种经典的分布式计算模型,能够快速解决用户海量数据计算...
ODPS(Open Data Processing Service)是阿里云推出的一种大数据处理服务,它提供了强大的数据存储和计算能力,帮助企业处理海量数据。而"odps-eclipse-plugin-bundle-0.16.0.zip"则是一个针对ODPS开发的Eclipse集成...
- ODPS(Open Data Processing Service)用于大规模离线数据处理,可以处理PB级别的数据,适合数据分析、报表生成等场景。 - ACE(Alibaba Cloud Engine)是弹性、分布式的应用托管环境,支持Java和PHP,方便开发...
评估重大安全漏洞或隐患云监控指标监控与报警服务开放数据处理服务 ODPS针对 TB/PB 级数据的分布式处理服务 , 彻底解决大数据存储与运算瓶颈开源大数据软件服务 ( 规划 )Spark/Hadoop/…分析数据库服务 ADS海量数据...
MaxCompute是阿里云推出的一款大数据计算服务,专为企业级用户设计。它主要为企业提供大规模数据处理和分析的能力,帮助企业从海量数据中挖掘价值。在V3.7.0版本的专有云企业版中,MaxCompute继续提升了其性能、稳定...
在大数据领域,阿里云提供了ODPS和ADS等服务,用于处理TB至PB级别的数据,实现分布式数据处理和实时高并发在线分析。此外,还有如OTS这样的NoSQL数据库服务,用于海量结构化数据的存储和访问,以及OCS在线缓存服务,...
1. **大数据处理能力**:MaxCompute的核心能力在于处理海量数据,支持PB级别的数据存储和万亿级数据的快速分析。这使得它成为处理大数据场景的理想选择,如大数据挖掘、数据分析、机器学习等。 2. **分布式计算框架...
《阿里云专有云企业版 V3.8.0 MaxCompute 技术白皮书》是阿里云发布的一份详细的技术文档,旨在介绍MaxCompute在专有云企业版中的技术特点和使用指南。MaxCompute是阿里云推出的一种大规模数据处理服务,为企业提供...
ODPS(Open Data Processing Service)是阿里云推出的一种大规模数据处理服务,它提供了一种基于Hadoop MapReduce的计算框架,使得用户可以在云端进行大规模的数据分析。本实践主要围绕ODPS MapReduce的实现原理和...