hadoop-集群管理（2）——内存设置 -

myhadoop

浏览: 158049 次

最近访客更多访客>>

965025150

若为子龙

xiaoweishu

leisureWong

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

hadoop-集群管理（2）——内存设置

博客分类：

Hadoop

hadoop mapreduce

1. 内存

hadoop为各个守护进程（namenode,secondarynamenode,jobtracker,datanode,tasktracker）统一分配的内存在hadoop-env.sh中设置，参数为HADOOP_HEAPSIZE，默认为1000M。

大部分情况下，这个统一设置的值可能并不适合。例如对于namenode节点，1000M的内存只能存储几百万个文件的数据块的引用。如果我想单独设置namenode的内存，可以通过HADOOP_NAMENODE_OPTS来设置。

同样的，可以通过HADOOP_SECONDARYNAMENODE_OPTS来设置secondrynamenode的内存，使得它与namenode保持一致。

当然，还有HADOOP_DATANODE_OPTS、HADOOP_BALANCER_OPTS、HADOOP_JOBTRACKER_OPTS变量供你使用。

此外，tasktracker启动独立的子JVM以运行map和reduce任务，分配给每个子JVM的内存量由mapred.child.java.opts属性（mapred-site.xml）控制，默认值为200M。

2. 最大map任务数

一个tasktracker能够同时运行最大map任务数，由mapred.tasktracker.map.tasks.maximum属性（mapred-site.xml）控制，默认为2。

3. 最大reduce任务数

一个tasktracker能够同时运行最大reduce任务数，由mapred.tasktracker.reduce.tasks.maximum属（mapred-site.xml）性控制，默认为2。

4. 小总结：计算节点的内存占用量。

默认情况下，一个同时运行了namenode，secondarynamenode和jobtracker的主节点，各自使用1000M内存，所以总计使用3000M。

默认情况下，一个从节点运行了如下守护进程：

1个datanode：默认占用1000M内存。
1个tasktracker：默认占用1000M内存。
最多2个map任务：2*200M=400M。
最多2个reduce任务：2*200M=400M。

即默认情况下，一个从节点需要使用2800M内存量。

在一个tasktracker上能够同时运行的任务数取决于这台机器上有多少个处理器。由于mapreduce作业通常是I/O-bound，因此将任务数设定为超出处理器数也有一定道理，可以获得更好的利用率。经验法则是任务总数（map任务数与reduce任务数之和）与处理器的比值在1和2之间。

例如，假设一台8个处理器的工作节点，每个处理器上运行2个进程，则可以将最大map任务数和最大reduce任务数分别设置成7（因为还有datanode和tasktracker进程，所以不能设置为8），各个JVM子任务可用内存设置为400M，则总内存开销=1000M(datanode)+1000M(tasktracker)+7*400M(map)+7*400M(reduce)=7600M

这样配置是否合理，还需要考虑是否给这台机器上的其他进程预留了足够内存，否则可能导致各进程在系统中不断切换，导致性能恶化。可以使用一些工具来监控集群的内存使用情况来进行优化，例如Ganglia工具。

hadoop也可以设置mapreduce操作所能使用的最大内存量，这是分别针对各项作业进行设置的。（详见《hadoop权威指南》117页的“shuffle和排序”小节）

分享到：

hadoop-集群管理（1）——配置文件 | hive与hbase的十大区别与联系

2014-06-12 11:52
浏览 752
评论(0)
分类:开源软件
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

hadoop-集群管理（2）——内存设置

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

hadoop-集群管理（2）——内存设置

评论

发表评论

相关推荐

hadoop-集群管理（1）——配置文件

Hadoop学习总结

Hadoop分布式文件系统：架构和设计要点

Hadoop技术一句话介绍

Hadoop分析日志实例的详细步骤及出现的问题分析和解决

hadoop集群调优

hadoop mapreduce单表关联

hadoop mapreduce多表关联

转-用Hadoop构建电影推荐系统

HDFS追本溯源：体系架构详解

Hadoop面试45个题目和参考答案

转-- Hadoop常见错误问题及解决方法（1）

hadoop参数配置优化

hadoop配置、运行错误总结二

hadoop配置、运行错误总结一

转-Hadoop虽强大，但不是万能的

单节点配置SecondaryNameNode

oop主节点（NameNode）备份策略以及恢复方法

hadoop常见错误及处理方法

Hadoop集群三种作业调度算法介绍

最近访客更多访客>>