Hadoop Job Tuning

nlslzf

浏览: 1059127 次
性别:
来自: 北京

最近访客更多访客>>

wangyy

u012363178

cwfmaker

windows9834

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

Hadoop生态圈(hadoop/hbase/pig/hive/zookeeper)

Hadoop NoSQL JVM Linux 云计算

Hadoop平台已经成为了大多数公司的分布式数据处理平台，随着数据规模的越来越大，对集群的压力也越来越大，集群的每个节点负担自然就会加重，而且集群内部的网络带宽有限，数据交换吞吐量也在面临考验，由此引发了人们对大规模数据处理进行优化的思考。

本文仅从实践经验出发，针对Hadoop Job优化提出了一些观点，不包含HDFS的优化。

Job Tracker Related

严格来说，下面这个配置项，是决定HDFS文件block数量的多少(也就是文件个数)，但是它会间接的影响Job Tracker的调度和内存的占用(其实更能影响name node内存的使用)。

dfs.block.size

这个配置项定义了在HDFS上每个block的大小，它的值是以字节为单位。可以在配置文件hadoop-site.xml(Hadoop 0.20 以前版本)定义，也可以在JobConf里定义

mapred.map.tasks.speculative.execution=true

mapred.reduce.tasks.speculative.execution=true

这两个是推测执行的配置项，当然如果你从来不关心这两个选项也没关系，它们默认值是true

所谓的推测执行，就是当所有task都开始运行之后，Job Tracker会统计所有任务的平均进度，如果某个task所在的task node机器配置比较低或者CPU load很高（原因很多），导致任务执行比总体任务的平均执行要慢，此时Job Tracker会启动一个新的任务（duplicate task），原有任务和新任务哪个先执行完就把另外一个kill掉，这也是我们经常在Job Tracker页面看到任务执行成功，但是总有些任务被kill，就是这个原因。

mapred.child.java.opts

一般来说，都是reduce耗费内存比较大，这个选项正是用来设置JVM堆的最大可用内存，但是也不要设置太大，如果超过2G，应该考虑从程序设计角度去优化。

Map Related

Input Split的大小，决定了一个Job拥有多少个map，默认64M每个Split，如果输入的数据量巨大，那么默认的64M的block会有几万甚至几十万的Map Task，集群的网络传输会很大，最严重的是给Job Tracker的调度、队列、内存都会带来很大压力。

mapred.min.split.size

这个配置项决定了每个 Input Split的最小值，也间接决定了一个Job的map 数目。

mapred.compress.map.output

压缩Map的输出应该作为一个习惯，这样做有两个好处：

a) 压缩是在内存中进行，所以写入map本地磁盘的数据就会变小，大大减少了本地IO次数

b) Reduce从每个map节点copy数据，也会明显降低网络传输的时间

补充：数据序列化其实效果会更好，无论是磁盘IO还是数据大小，都会明显的降低。

io.sort.mb

以MB为单位，默认100M，通常来看，这个值太小了

这个选项定义了map输出结果在内存占用buffer的大小，当buffer达到一定阈值，会启动一个后台线程来对buffer的内容进行排序，然后写入本地磁盘(一个spill文件)

在内存中的buffer如下图：(kvstart,kvend,kvindex为hadoop源码中操作buffer的变量)

根据map输出数据量的大小，可以适当的调整buffer的大小，注意是适当的调整，不是越大越好，假设内存无限大，io.sort.mb=1024(1G), 和io.sort.mb=300 (300M)，前者未必比后者快，因为1G的数据排序一次和排序3次，每次300MB，

一定是后者快（分而治之的思想）

io.sort.spill.percent

这个值就是上述buffer的阈值，默认是0.8，既80%，当buffer中的数据达到这个阈值，后台线程会起来对buffer中已有的数据进行排序，然后写入磁盘，此时map输出的数据继续往剩余的20% buffer写数据，如果buffer的剩余20%写满，排序还没结束，map task被block等待。

如果你确认map输出的数据基本有序（很少见），排序时间很短，可以将这个阈值适当调高，更理想的，如果你的map输出是有序的数据（基本不可能吧？），那么可以把buffer设的更大，阈值设置为1.

Io.sort.factor

同时打开的文件句柄的数量，默认是10

当一个map task执行完之后，本地磁盘上(mapred.local.dir)有若干个spill文件，map task最后做的一件事就是执行merge sort，把这些spill文件合成一个文件（partition），有时候我们会自定义partition函数，就是在这个时候被调用的。

执行merge sort的时候，每次同时打开多少个spill文件，就是由io.sort.factor决定的。打开的文件越多，不一定merge sort就越快，所以也要根据数据情况适当的调整。

补充：merge排序的结果是两个文件，一个是index，另一个是数据文件，index文件记录了每个不同的key在数据文件中的偏移量（这就是partition）

Reduce Related

提高Reduce的执行效率，除了在Hadoop框架方面的优化，重点还是在代码逻辑上的优化！比如：对Reduce接受到的value可能有重复的，此时如果用Java的Set或者STL的Set来达到去重的目的，那么这个程序不是扩展良好的(non-scalable)，受到数据量的限制，当数据膨胀，内存势必会溢出？

Io.sort.mb/io.sort.factor/ io.sort.spill.percent

其作用和Map阶段的作用一样，都是控制排序时使用内存的大小、句柄数量、阈值大小

mapred.reduce.parallel.copies

Reduce copy数据的线程数量，默认值是5

Reduce到每个完成的Map Task copy数据（通过RPC调用），默认同时启动5个线程到map节点取数据。这个配置还是很关键的，如果你的map输出数据很大，有时候会发现map早就100%了，reduce一直在1% 2%。。。。。。缓慢的变化，那就是copy数据太慢了，5个线程copy 10G的数据，确实会很慢，这时就要调整这个参数了，但是调整的太大，又会事半功倍，容易造成集群拥堵，所以 Job tuning的同时，也是个权衡的过程，你要熟悉你的数据！

mapred.job.shuffle.input.buffer.percent

当指定了JVM的堆内存最大值以后，上面这个配置项就是Reduce用来存放从Map节点取过来的数据所用的内存占堆内存的比例，默认是0.7，既70%，通常这个比例是够了，但是我们讨论的还是大数据的情况，所以这个比例还是小了一些，0.8-0.9之间比较合适。（前提是你的reduce函数不会疯狂的吃掉内存）

mapred.job.shuffle.merge.percent(默认值0.66)

mapred.inmem.merge.threshold(默认值1000)

这是两个阈值的配置项，第一个指的从Map节点取数据过来，放到内存，当达到这个阈值之后，后台启动线程（通常是Linux native process）把内存中的数据merge sort，写到reduce节点的本地磁盘；

第二个指的是从map节点取过来的文件个数，当达到这个个数之后，也进行merger sort，然后写到reduce节点的本地磁盘；这两个配置项第一个优先判断，其次才判断第二个thresh-hold。

从实际经验来看，mapred.job.shuffle.merge.percent默认值确实太小了，完全可以设置到0.8左右；第二个默认值1000，完全取决于map输出数据的大小，如果map输出的数据很大，默认值1000反倒不好，应该小一些，如果map输出的数据不大（light weight），可以设置2000或者以上，都没问题。

后记

大规模数据处理是云计算平台的挑战，涉及的技术难点很多：

并行优化

海量存储（HDFS存在诸多限制）【NoSQL】

大规模数据不仅仅是用来静态的处理，怎么样动起来？比如实时查询、实时更新、状态跟踪（数据的生命周期），目前开源社区的NoSQL技术还没有做到，或者很好的达到这些要求，这也是今后海量存储系统面临的技术难点。

分享到：

扩展CDT做自己的project wizard | 如何在不重启整个hadoop集群的情况下，增加 ...

2011-02-28 15:53
浏览 834
评论(0)
分类:企业架构
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

hadoop_the_definitive_guide_3nd_edition: Tuning a Job 176 Profiling Tasks 177 MapReduce Workflows 180 Decomposing a Problem into MapReduce Jobs 180 JobControl 182 Apache Oozie 182 6. How MapReduce Works . . . . . . . . . . . . . . . . . . . ...

Big Data Made Easy - A Working Guide To The Complete Hadoop Toolset: - **Schedulers**: Fair and Capacity schedulers in Hadoop for managing job priorities. - **Oozie**: A workflow scheduler for managing Hadoop jobs and complex workflows. The chapter includes detailed ...

hive调优总结文档-hive tuning ppt: 以下是对"Hive调优总结文档-hive tuning ppt"中可能涉及的多个知识点的详细阐述： 1. **元数据优化**： - **分区策略**：根据业务需求，合理设计分区字段，减少不必要的数据扫描，例如按日期、地区等进行分区。 -...

基于模糊故障树的工业控制系统可靠性分析与Python实现: 内容概要：本文探讨了模糊故障树（FFTA）在工业控制系统可靠性分析中的应用，解决了传统故障树方法无法处理不确定数据的问题。文中介绍了模糊数的基本概念和实现方式，如三角模糊数和梯形模糊数，并展示了如何用Python实现模糊与门、或门运算以及系统故障率的计算。此外，还详细讲解了最小割集的查找方法、单元重要度的计算，并通过实例说明了这些方法的实际应用场景。最后，讨论了模糊运算在处理语言变量方面的优势，强调了在可靠性分析中处理模糊性和优化计算效率的重要性。适合人群：从事工业控制系统设计、维护的技术人员，以及对模糊数学和可靠性分析感兴趣的科研人员。使用场景及目标：适用于需要评估复杂系统可靠性的场合，特别是在面对不确定数据时，能够提供更准确的风险评估。目标是帮助工程师更好地理解和预测系统故障，从而制定有效的预防措施。其他说明：文中提供的代码片段和方法可用于初步方案验证和技术探索，但在实际工程项目中还需进一步优化和完善。

风力发电领域双馈风力发电机（DFIG）Simulink模型的构建与电流电压波形分析: 内容概要：本文详细探讨了双馈风力发电机（DFIG）在Simulink环境下的建模方法及其在不同风速条件下的电流与电压波形特征。首先介绍了DFIG的基本原理，即定子直接接入电网，转子通过双向变流器连接电网的特点。接着阐述了Simulink模型的具体搭建步骤，包括风力机模型、传动系统模型、DFIG本体模型和变流器模型的建立。文中强调了变流器控制算法的重要性，特别是在应对风速变化时，通过实时调整转子侧的电压和电流，确保电流和电压波形的良好特性。此外，文章还讨论了模型中的关键技术和挑战，如转子电流环控制策略、低电压穿越性能、直流母线电压脉动等问题，并提供了具体的解决方案和技术细节。最终，通过对故障工况的仿真测试，验证了所建模型的有效性和优越性。适用人群：从事风力发电研究的技术人员、高校相关专业师生、对电力电子控制系统感兴趣的工程技术人员。使用场景及目标：适用于希望深入了解DFIG工作原理、掌握Simulink建模技能的研究人员；旨在帮助读者理解DFIG在不同风速条件下的动态响应机制，为优化风力发电系统的控制策略提供理论依据和技术支持。其他说明：文章不仅提供了详细的理论解释，还附有大量Matlab/Simulink代码片段，便于读者进行实践操作。同时，针对一些常见问题给出了实用的调试技巧，有助于提高仿真的准确性和可靠性。

基于西门子S7-200 PLC和组态王的八层电梯控制系统设计与实现: 内容概要：本文详细介绍了基于西门子S7-200 PLC和组态王软件构建的八层电梯控制系统。首先阐述了系统的硬件配置，包括PLC的IO分配策略，如输入输出信号的具体分配及其重要性。接着深入探讨了梯形图编程逻辑，涵盖外呼信号处理、轿厢运动控制以及楼层判断等关键环节。随后讲解了组态王的画面设计，包括动画效果的实现方法，如楼层按钮绑定、轿厢移动动画和门开合效果等。最后分享了一些调试经验和注意事项，如模拟困人场景、防抖逻辑、接线艺术等。适合人群：从事自动化控制领域的工程师和技术人员，尤其是对PLC编程和组态软件有一定基础的人群。使用场景及目标：适用于需要设计和实施小型电梯控制系统的工程项目。主要目标是帮助读者掌握PLC编程技巧、组态画面设计方法以及系统联调经验，从而提高项目的成功率。其他说明：文中提供了详细的代码片段和调试技巧，有助于读者更好地理解和应用相关知识点。此外，还强调了安全性和可靠性方面的考量，如急停按钮的正确接入和硬件互锁设计等。

CarSim与Simulink联合仿真：基于MPC模型预测控制实现智能超车换道: 内容概要：本文介绍了如何将CarSim的动力学模型与Simulink的智能算法相结合，利用模型预测控制(MPC)实现车辆的智能超车换道。主要内容包括MPC控制器的设计、路径规划算法、联合仿真的配置要点以及实际应用效果。文中提供了详细的代码片段和技术细节，如权重矩阵设置、路径跟踪目标函数、安全超车条件判断等。此外，还强调了仿真过程中需要注意的关键参数配置，如仿真步长、插值设置等，以确保系统的稳定性和准确性。适合人群：从事自动驾驶研究的技术人员、汽车工程领域的研究人员、对联合仿真感兴趣的开发者。使用场景及目标：适用于需要进行自动驾驶车辆行为模拟的研究机构和企业，旨在提高超车换道的安全性和效率，为自动驾驶技术研发提供理论支持和技术验证。其他说明：随包提供的案例文件已调好所有参数，可以直接导入并运行，帮助用户快速上手。文中提到的具体参数和配置方法对于初学者非常友好，能够显著降低入门门槛。

基于单片机的鱼缸监测设计(51+1602+AD0809+18B20+UART+JKx2)#0107: 包括：源程序工程文件、Proteus仿真工程文件、论文材料、配套技术手册等 1、采用51单片机作为主控； 2、采用AD0809(仿真0808)检测"PH、氨、亚硝酸盐、硝酸盐"模拟传感； 3、采用DS18B20检测温度； 4、采用1602液晶显示检测值； 5、检测值同时串口上传，调试助手监看； 6、亦可通过串口指令对加热器、制氧机进行控制；

风电领域双馈永磁风电机组并网仿真及短路故障分析与MPPT控制: 内容概要：本文详细介绍了双馈永磁风电机组并网仿真模型及其短路故障分析方法。首先构建了一个9MW风电场模型，由6台1.5MW双馈风机构成，通过升压变压器连接到120kV电网。文中探讨了风速模块的设计，包括渐变风、阵风和随疾风的组合形式，并提供了相应的Python和MATLAB代码示例。接着讨论了双闭环控制策略，即功率外环和电流内环的具体实现细节，以及MPPT控制用于最大化风能捕获的方法。此外，还涉及了短路故障模块的建模，包括三相电压电流特性和离散模型与phasor模型的应用。最后，强调了永磁同步机并网模型的特点和注意事项。适合人群：从事风电领域研究的技术人员、高校相关专业师生、对风电并网仿真感兴趣的工程技术人员。使用场景及目标：适用于风电场并网仿真研究，帮助研究人员理解和优化风电机组在不同风速条件下的性能表现，特别是在短路故障情况下的应对措施。目标是提高风电系统的稳定性和可靠性。其他说明：文中提供的代码片段和具体参数设置有助于读者快速上手并进行实验验证。同时提醒了一些常见的错误和需要注意的地方，如离散化步长的选择、初始位置对齐等。

空手道训练测试系统BLE106版本: 适用于空手道训练和测试场景

【音乐创作领域AI提示词】AI音乐提示词（deepseek,豆包,kimi,chatGPT,扣子空间,manus,AI训练师）: 内容概要：本文介绍了金牌音乐作词大师的角色设定、背景经历、偏好特点、创作目标、技能优势以及工作流程。金牌音乐作词大师凭借深厚的音乐文化底蕴和丰富的创作经验，能够为不同风格的音乐创作歌词，擅长将传统文化元素与现代流行文化相结合，创作出既富有情感又触动人心的歌词。在创作过程中，会严格遵守社会主义核心价值观，尊重用户需求，提供专业修改建议，确保歌词内容健康向上。; 适合人群：有歌词创作需求的音乐爱好者、歌手或音乐制作人。; 使用场景及目标：①为特定主题或情感创作歌词，如爱情、励志等；②融合传统与现代文化元素创作独特风格的歌词；③对已有歌词进行润色和优化。; 阅读建议：阅读时可以重点关注作词大师的创作偏好、技能优势以及工作流程，有助于更好地理解如何创作出高质量的歌词。同时，在提出创作需求时，尽量详细描述自己的情感背景和期望，以便获得更贴合心意的作品。

linux之用户管理教程.md: linux之用户管理教程.md

基于单片机的搬运机器人设计(51+1602+L298+BZ+KEY6)#0096: 包括：源程序工程文件、Proteus仿真工程文件、配套技术手册等 1、采用51/52单片机作为主控芯片； 2、采用1602液晶显示设置及状态； 3、采用L298驱动两个电机，模拟机械臂动力、移动底盘动力； 3、首先按键配置-待搬运物块的高度和宽度（为0不能开始搬运）； 4、按下启动键开始搬运，搬运流程如下：机械臂先把物块抓取到机器车上，机械臂减速机器车带着物块前往目的地机器车减速机械臂把物块放下来机械臂减速机器车回到物块堆积处（此时机器车是空车）机器车减速蜂鸣器提醒按下复位键，结束本次搬运

基于下垂控制的三相逆变器电压电流双闭环仿真及MATLAB/Simulink/PLECS实现: 内容概要：本文详细介绍了基于下垂控制的三相逆变器电压电流双闭环控制的仿真方法及其在MATLAB/Simulink和PLECS中的具体实现。首先解释了下垂控制的基本原理，即有功调频和无功调压，并给出了相应的数学表达式。随后讨论了电压环和电流环的设计与参数整定，强调了两者带宽的差异以及PI控制器的参数选择。文中还提到了一些常见的调试技巧，如锁相环的响应速度、LC滤波器的谐振点处理、死区时间设置等。此外，作者分享了一些实用的经验，如避免过度滤波、合理设置采样周期和下垂系数等。最后，通过突加负载测试展示了系统的动态响应性能。适合人群：从事电力电子、微电网研究的技术人员，尤其是有一定MATLAB/Simulink和PLECS使用经验的研发人员。使用场景及目标：适用于希望深入了解三相逆变器下垂控制机制的研究人员和技术人员，旨在帮助他们掌握电压电流双闭环控制的具体实现方法，提高仿真的准确性和效率。其他说明：本文不仅提供了详细的理论讲解，还结合了大量的实战经验和调试技巧，有助于读者更好地理解和应用相关技术。

光伏并网逆变器全栈开发资料：硬件设计、控制算法及实战经验: 内容概要：本文详细介绍了光伏并网逆变器的全栈开发资料，涵盖了从硬件设计到控制算法的各个方面。首先，文章深入探讨了功率接口板的设计，包括IGBT缓冲电路、PCB布局以及EMI滤波器的具体参数和设计思路。接着，重点讲解了主控DSP板的核心控制算法，如MPPT算法的实现及其注意事项。此外，还详细描述了驱动扩展板的门极驱动电路设计，特别是光耦隔离和驱动电阻的选择。同时，文章提供了并联仿真的具体实现方法，展示了环流抑制策略的效果。最后，分享了许多宝贵的实战经验和调试技巧，如主变压器绕制、PWM输出滤波、电流探头使用等。适合人群：从事电力电子、光伏系统设计的研发工程师和技术爱好者。使用场景及目标：①帮助工程师理解和掌握光伏并网逆变器的硬件设计和控制算法；②提供详细的实战经验和调试技巧，提升产品的可靠性和性能；③适用于希望深入了解光伏并网逆变器全栈开发的技术人员。其他说明：文中不仅提供了具体的电路设计和代码实现，还分享了许多宝贵的实际操作经验和常见问题的解决方案，有助于提高开发效率和产品质量。

机器人轨迹规划中粒子群优化与3-5-3多项式结合的时间最优路径规划: 内容概要：本文详细介绍了粒子群优化（PSO）算法与3-5-3多项式相结合的方法，在机器人轨迹规划中的应用。首先解释了粒子群算法的基本原理及其在优化轨迹参数方面的作用，随后阐述了3-5-3多项式的数学模型，特别是如何利用不同阶次的多项式确保轨迹的平滑过渡并满足边界条件。文中还提供了具体的Python代码实现，展示了如何通过粒子群算法优化时间分配，使3-5-3多项式生成的轨迹达到时间最优。此外，作者分享了一些实践经验，如加入惩罚项以避免超速，以及使用随机扰动帮助粒子跳出局部最优。适合人群：对机器人运动规划感兴趣的科研人员、工程师和技术爱好者，尤其是有一定编程基础并对优化算法有初步了解的人士。使用场景及目标：适用于需要精确控制机器人运动的应用场合，如工业自动化生产线、无人机导航等。主要目标是在保证轨迹平滑的前提下，尽可能缩短运动时间，提高工作效率。其他说明：文中不仅给出了理论讲解，还有详细的代码示例和调试技巧，便于读者理解和实践。同时强调了实际应用中需要注意的问题，如系统的建模精度和安全性考量。

【KUKA 机器人资料】：kuka机器人压铸欧洲标准.pdf: KUKA机器人相关资料

光子晶体中BIC与OAM激发的模拟及三维Q值计算: 内容概要：本文详细探讨了光子晶体中的束缚态在连续谱中（BIC）及其与轨道角动量（OAM）激发的关系。首先介绍了光子晶体的基本概念和BIC的独特性质，随后展示了如何通过Python代码模拟二维光子晶体中的BIC，并解释了BIC在光学器件中的潜在应用。接着讨论了OAM激发与BIC之间的联系，特别是BIC如何增强OAM激发效率。文中还提供了使用有限差分时域（FDTD）方法计算OAM的具体步骤，并介绍了计算本征态和三维Q值的方法。此外，作者分享了一些实验中的有趣发现，如特定条件下BIC表现出OAM特征，以及不同参数设置对Q值的影响。适合人群：对光子晶体、BIC和OAM感兴趣的科研人员和技术爱好者，尤其是从事微纳光子学研究的专业人士。使用场景及目标：适用于希望通过代码模拟深入了解光子晶体中BIC和OAM激发机制的研究人员。目标是掌握BIC和OAM的基础理论，学会使用Python和其他工具进行模拟，并理解这些现象在实际应用中的潜力。其他说明：文章不仅提供了详细的代码示例，还分享了许多实验心得和技巧，帮助读者避免常见错误，提高模拟精度。同时，强调了物理离散化方式对数值计算结果的重要影响。

C#联合Halcon 17.12构建工业视觉项目的配置与应用: 内容概要：本文详细介绍了如何使用C#和Halcon 17.12构建一个功能全面的工业视觉项目。主要内容涵盖项目配置、Halcon脚本的选择与修改、相机调试、模板匹配、生产履历管理、历史图像保存以及与三菱FX5U PLC的以太网通讯。文中不仅提供了具体的代码示例，还讨论了实际项目中常见的挑战及其解决方案，如环境配置、相机控制、模板匹配参数调整、PLC通讯细节、生产数据管理和图像存储策略等。适合人群：从事工业视觉领域的开发者和技术人员，尤其是那些希望深入了解C#与Halcon结合使用的专业人士。使用场景及目标：适用于需要开发复杂视觉检测系统的工业应用场景，旨在提高检测精度、自动化程度和数据管理效率。具体目标包括但不限于：实现高效的视觉处理流程、确保相机与PLC的无缝协作、优化模板匹配算法、有效管理生产和检测数据。其他说明：文中强调了框架整合的重要性，并提供了一些实用的技术提示，如避免不同版本之间的兼容性问题、处理实时图像流的最佳实践、确保线程安全的操作等。此外，还提到了一些常见错误及其规避方法，帮助开发者少走弯路。

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论