【编者按】本文作者为大数据咨询公司 Mammoth Data 的创始人 Andrew Oliver,主要介绍适宜应用大数据的8大项目类型。文章系国内 ITOM 管理平台 OneAPM 编译呈现,以下为正文。
在过去的 12 个月里,笔者一直在大数据的战壕里挖掘。好吧,其实大部分时间我只是坐在比我更聪明的人旁边,看他们怎么在战壕里挖掘数据,再把所做的事情进行简化以上报给管理层。
很少有真正独具一格的 IT 项目,那些听起来比较特别的项目最终也只是大同小异。不过你们今天有眼福了,因为我决定出来冒个泡儿,跟大家分享一下过去 12 个月里接触到的8大项目类型。
1、探索交易周期
那些做电子商务的公司想当然地认为,装几个工具就能掌握网页访客从销售到付款的成交情况。但是很多公司处理的数据集远远不止网页成交率,而且这些数据集主要来自经销商。
每个经销商提供格式各异的不同数据集。当然,从根本上说,这是一个带有BI/可视化前端的核心ETL/数据整合项目。但是,对许多公司而言,要真正了解交易的生命周期(从开始、进展到结束)比想象中要困难。你需要整合大量的 CRM 数据、网站分析数据和财务数据,最后才能肯定地说:“是的,PPC(点击付费广告)带来了交易,但是40%的客户连第一笔交易都未能成功走到付款,那么……”
2、挖掘潜在客户
很多公司都想知道你在做什么,然后再根据你的活动情况向你推销产品。例如,你手机上可能装了一个提供遥测数据的 app,这样公司就会知道你在商场的哪个位置。凭借这些大数据,他们就能预测你在任意时刻的购买需求。
3、衡量营销效果
营销人员做事讲求效益,他们想知道具体要做哪些事情,以及这些事情对KPI有何影响。从本质上说,这又是一个 BI 项目,而且往往涉及到大量的变更数据捕获(CDC)和 ETL 数据整合工作。他们测量的实际KPI变化很大,有时还涉及到 Kylin 或 Greenplum 等工具中的数据库。至于其他情况,可能属于下一个类别——社交媒体。
4、测量社交媒体热度
通常,公众会在公开或半公开的社交网络上谈论你(或你的公司)。在这些地方你可以获取很多有用的信息,比如大家怎么看待你的品牌,你的营销活动是否有成效。既然美国地震勘探局可以通过 Twitter 探测到地震和震级,那么你也可以通过这样的平台了解刚推出的广告活动效果如何。随着越来越多的专业社交平台出现,对于某些垂直行业而言,其数据采集范围远远不止 Twitter 和 Facebook。
5、专攻日志文件
无论是为了入侵检测还是应对安全审计,你都需要捕获并收集日志文件并使其可检索。在这一领域,Splunk 无疑大赚了一笔。当然,在大数据中还有其他更灵活的选择。
6、因为不想买Teradata!
现在已经不是 Teradata 独统天下的时代了,大数据正在从边缘向核心发展,而且 Apache Kylin 的数据库已对所有人开放。得益于 Impala、HAWQ 和 Greenplum,MPP 分布式系统的地位也更加重要。那些价格昂贵、功能单一而且还不能兼容其他数据分析的工具,其发展空间越来越小——更别说是那些只能依靠某单一供应商的私有云。
7、经久不衰的ETL
ETL (Extract-Transform-Load)可能依旧是如今最常见的Hadoop工作负载——而且我敢说,ETL 是适用于 Spark 的最常见的非流式工作负载。顺便提一下,现在已经有上百个创业公司冒出来说自己能够处理这种任务了。
8、先捕获传感器数据再想办法处理
不管是电网、制造业、水泵,还是老司机开的车,都在向我们传递信息。这些信息都需要捕获。甚至有些人已经弄清了该如何处理这些数据。但是,及时捕获数据才是最重要的一步,因为很多人都觉得从技术上来说捕获数据并不那么容易。
此外,笔者还经常督促大家在大数据项目初期就要考虑数据分析问题。为什么呢?因为预先设计并确定好数据流的大小,远比数据已经准备好时再重新考虑整体布局要容易得多。但是有时候还是得细细咀嚼,做最好的打算。
近一年来,笔者见过不少其他项目类型,但是大多数用例都属于以上八种之一。不知各位老司机是否还有补充?
OneAPM 能为您提供端到端的 Java 应用性能解决方案,我们支持所有常见的 Java 框架及应用服务器,助您快速发现系统瓶颈,定位异常根本原因。分钟级部署,即刻体验,Java 监控从来没有如此简单。想阅读更多技术文章,请访问 OneAPM 官方技术博客。
本文转自 OneAPM 官方博客
相关推荐
本书名为《玩转大数据:商业分析+运营推广+营销技巧+实战案例》,由海天电商金融研究中心编著,由清华大学出版社出版,发布于2016年。它是一本关于大数据在商业活动中应用的实战宝典,为读者提供了多个行业的实战...
合肥工业大学的这门“Python玩转大数据”课程,旨在让学生掌握如何利用Python进行大数据分析和处理,从而更好地理解和解决实际问题。 一、Python大数据处理基础 1. Numpy库:Numpy是Python中用于科学计算的核心库...
在本压缩包“Python玩转大数据的大作业.zip”中,我们可以看到一个名为“zgl_resource”的文件,这可能是一个包含一系列资源的文件夹,用于支持一个关于使用Python处理大数据的项目或课程作业。Python作为一门强大的...
玩转大数据:商业分析+运营推广+营销技巧+实战案例读书笔记模板 本书主要讲述了大数据在商业分析、运营推广、营销技巧和实战案例中的应用,旨在帮助读者了解如何运用大数据进行客户定位、营销推广、品牌传播,并...
《玩转大数据:深入浅出大数据挖掘技术》是一门针对大数据挖掘技术的全面教程,旨在帮助学员理解并掌握数据挖掘的核心理念与实用方法。课程强调理论与实践相结合,通过讲解经典算法、使用流行工具和编程实现,使学员...
第一章 玩转大数据:深入浅出大数据挖掘技术1-9.mp4
【玩转大数据:深入浅出大数据挖掘技术】课程旨在为学习者提供全面的数据挖掘知识,其中分类器和决策树作为重要的组成部分,在数据挖掘中起到了至关重要的作用。 首先,我们需要理解数据挖掘的基本概念。数据挖掘是...
Big Data (大数据),或称巨量资料,指的是在传统数据处理应用软件不足以处理的大或复杂的数据集。大数据也可以定义为来自各种来源的大量非结构化或结构化数据。从学术角度而言,大数据的出现促成广泛主题的新颖...
在当前信息化社会中,大数据已经成为了企业决策、科学研究以及日常生活中的关键要素。数据可视化的价值在于,它能够将复杂的数据转化为直观、易于理解的图形,帮助我们更好地挖掘数据背后的故事。本文将详细介绍几个...
【标题】: 广电如何运用大数据:社交网络分析工具的启示 【描述】: 本文探讨了广电行业如何利用大数据进行创新,并结合社交网络分析工具来改进广电大数据的应用策略。 【标签】: 技术方案 正文: 大数据在广电...
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....
【课程大纲】01.数据挖掘概述与数据 共25页02.可视化与多维数据分析 共17页03.分类器与决策树 共48页04-05.其他分类器 共67页06.分类器应用 共4页07.关联分析 共38页08.购物车数据分析 共3页09....