拥抱开源 - 云上元数据管理 -

数控小J

浏览: 68951 次

最近访客更多访客>>

万里一梦遥

zhangyou1010

amc1989

rrstpit

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

拥抱开源 - 云上元数据管理

博客分类：

hadoop 大数据数据分析

上期我们讲述的是实现数据工程师梦想的一个小目标《梦想成真，只差一步》，里面提到了要实现数据超市的管理，数据工程师需要使用合适的工具将数据进行整理、组合、分类后上架，然后业务分析师和数据科学家就可以使用了。

在整个数据工程师的工作流程中，需要自始至终的进行数据治理：我们需要将每种类型的数据进行清晰的标识以及分类，以利于其它角色的用户进行查找以及使用；我们需要将每种数据的使用范围进行管理以及监控，以使得数据被合理、合法的使用；我们还要管理数据的生存周期以及质量溯源，以利于数据质量可以被监管，无用数据被清除...... 因此本文中我们将着重介绍上图中标红框的部分，介绍实现我们梦想的工具Open Metadata Services - 开源组件Apache Atlas。

这个模块还在Apache的孵化中，最新的版本是8月16号发布的0.7版本。详细文档可以查看以下链接：http://atlas.incubator.apache.org/

Atlas 最早由HortonWorks实现，用来管理Hadoop项目里面的元数据，进而设计为数据治理的框架。后来开源出来给Apache社区进行孵化，目前得到Aetna，Merck，Target，SAS等公司的支持进行发展演进，IBM现在也积极贡献功能，拿来为我所用。(其在HortonWorks公司的介绍材料链接： https://zh.hortonworks.com/apache/atlas/#section_1 ) 从其诞生历史看，该框架天生就支持横向海量扩展，具备良好的集成能力，非常适合在云上使用。以下是其架构图：

Apache网站介绍它的主要功能有：

1、数据分类；

2、集中审计；

3、搜索及溯源；

4、安全及策略引擎；

它的最核心部分Core就是类型管理系统 Type System ，用户可以把数据资产进行类型定义，然后使用Ingest/Export 的模块进行元数据的导入、修改、删除等管理。和外界的接口可以通过Rest API或使用Kafaka进行消息交换。数据对象存放在按照图的模式进行管理的Titan图数据库中，具体Titan又把元数据存放在HBase中，索引存放在Solr中。这样用户可以非常便捷和直观的通过层次图进行浏览信息，可以按照文字进行精确的查找。

如上图，我们将数据资产分成了五类，分别是：Pipeline、Data Set、Report、Model、Notebook，具体存储的属性是红色框部分，描述了以上五种数据资产的详细信息：例如它是哪类型业务，数据质量如何，归在哪个项目里面，具体评级如何、用户访问权限如何等等......

有了这个Open Data Services服务后，我们是否觉得又离梦想近了一步？更详细的使用我们将在未来文章分享。

IBM对开源社区一直采取大力拥抱以及不遗余力地进行支持的态度：

IBM基于Cloud Foundry 打造了世界最大的PaaS平台BlueMix，在上面部署了大量开源的云数据服务业务 - 例如Cloudant源于CouchDB，DataWorks Forge构建在Spark平台之上。现在我们将Atlas开源元数据管理部署到我们的云数据治理中，通过实际使用来促进该项目的大力发展。我们有理由相信，未来IBM 将把开源的魔力继续发扬光大！

更多大数据与分析相关行业资讯、解决方案、案例、教程等请点击查看>>>

0
顶

0
踩

分享到：

SPSS干货分享：区分T检验与F检验 | IBM SPSS Modeler数据库内建模

2016-09-30 10:50
浏览 1906
评论(0)
分类:行业应用
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

拥抱开源 - 云上元数据管理

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

拥抱开源 - 云上元数据管理

评论

发表评论

相关推荐

干货 | 人工智能体系大纲图谱（初、中、高级篇）

Hadoop和大数据：60款顶级开源工具

流式大数据实时处理—技术、平台及应用

一张图，带你读懂 IBM 云上真实洞察数据那些事

全球最值得关注的100家人工智能公司（中国27家）

医疗大数据解决方案

IBM 全新大数据分析平台，助力数据云化

6个用于大数据分析处理的最好工具

InfoSphere Streams——实时大数据分析平台

干货 | 数据挖掘入门必看10个问题

Apache Hadoop 3.0新版本介绍及未来发展方向（内附PDF）

10大天然大数据公司，看他们如何挖掘数据价值

IBM SPSS Modeler数据库内建模

惊艳全球数据行业的16个数据可视化例子

10款超好用的工具助力大数据与分析技术

10款超好用的工具助力大数据与分析技术

数据驱动业务——梦想成真，只差一步

数据可视化神器——Cognos Analytics V11 R4 发布！

助力大数据集成，且看DataStage新玩法

大数据可视化的最新动态

最近访客更多访客>>