超详细单机版搭建hadoop环境图文解析

逸情公子

浏览: 900425 次
性别:
来自: 长沙

最近访客更多访客>>

stef831018

ansygs

qq6346534

a90120411

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

hadoop

hadoop 单机版环境搭建 Ubuntu

超详细单机版搭建hadoop环境图文解析
前言：

年前，在老大的号召下，我们纠集了一帮人搞起了hadoop，并为其取了个响亮的口号“云在手，跟我走”。大家几乎从零开始，中途不知遇到多少问题，但终于在回家之前搭起了一个拥有12台服务器的集群，并用命令行在该集群上运行了一些简单的mapreduce程序。想借此总结我们的工作过程。

安装过程：

一、安装Linux操作系统
二、在Ubuntu下创建hadoop用户组和用户
三、在Ubuntu下安装JDK
四、修改机器名
五、安装ssh服务
六、建立ssh无密码登录本机
七、安装hadoop
八、在单机上运行hadoop

一、安装Linux操作系统

我们是在windows中安装linux系统的，选择的是ubuntu11.10,介于有些朋友是第一次安装双系统，下面我就介绍一种简单的安装方法：

1、下载ubuntu-11.10-desktop-i386.iso镜像文件，用虚拟光驱打开，执行里面的wubi.exe程序，如图（1）

2、选择在widows中安装，如图（2）

3、在弹出的窗口中设置一些具体的参数，自动跟新完成后需要重启。重启时，就会出现ubuntu系统的选择了，系统一般默认开机启动windows系统，所以这里要自己手动选择哦～，进入ubuntu后，系统就自动下载，跟新、安装了。

（注：安装的过程中可能会卡在一个阶段很长时间（我卡了半个小时），这时我选择了强制关机，重启时同样选择进入ubuntu。一般第二次就不会卡，具体原因我也不是很清楚，可能和wubi.exe程序有关吧。在网上看到，有些人认为用wubi.exe安装ubuntu不是很好，可能这就是它的不好之处吧。不过这是非常简单的方法，所以我们还是选择这种安装方法吧。）

二、在Ubuntu下创建hadoop用户组和用户

这里考虑的是以后涉及到hadoop应用时，专门用该用户操作。用户组名和用户名都设为：hadoop。可以理解为该hadoop用户是属于一个名为hadoop的用户组，这是linux操作系统的知识，如果不清楚可以查看linux相关的书籍。

1、创建hadoop用户组，如图（3）

2、创建hadoop用户，如图（4）

3、给hadoop用户添加权限，打开/etc/sudoers文件，如图（5）

按回车键后就会打开/etc/sudoers文件了，给hadoop用户赋予root用户同样的权限。在root ALL=(ALL:ALL) ALL下添加hadoop ALL=(ALL:ALL) ALL，如图（6）

三、在Ubuntu下安装JDK（http://weixiaolu.iteye.com/blog/1401786）

四、修改机器名

每当ubuntu安装成功时，我们的机器名都默认为：ubuntu ，但为了以后集群中能够容易分辨各台服务器，需要给每台机器取个不同的名字。机器名由 /etc/hostname文件决定。

1、打开/etc/hostname文件，如图（7）

2、回车后就打开/etc/hostname文件了，将/etc/hostname文件中的ubuntu改为你想取的机器名。这里我取“s15“。重启系统后才会生效。

五、安装ssh服务

这里的ssh和三大框架:spring,struts,hibernate没有什么关系，ssh可以实现远程登录和管理，具体可以参考其他相关资料。

1、安装openssh-server，如图（8）

（注：自动安装openssh-server时，可能会进行不下去，可以先进行如下操作：)

2、更新的快慢取决于您的网速了，如果中途因为时间过长您中断了更新（Ctrl+z），当您再次更新时，会更新不了，报错为：“Ubuntu无法锁定管理目录（/var/lib/dpkg/），是否有其他进程占用它？“需要如下操作，如图（10）

操作完成后继续执行第1步。

这时假设您已经安装好了ssh，您就可以进行第六步了哦~

六、建立ssh无密码登录本机

ssh生成密钥有rsa和dsa两种生成方式，默认情况下采用rsa方式。
1、创建ssh-key，，这里我们采用rsa方式，如图（11）

（注：回车后会在~/.ssh/下生成两个文件：id_rsa和id_rsa.pub这两个文件是成对出现的）

2、进入~/.ssh/目录下，将id_rsa.pub追加到authorized_keys授权文件中，开始是没有authorized_keys文件的，如图（12）

（完成后就可以无密码登录本机了。）

3、登录localhost，如图（13）

( 注：当ssh远程登录到其它机器后，现在你控制的是远程的机器，需要执行退出命令才能重新控制本地主机。)

4、执行退出命令，如图（14）

七、安装hadoop

我们采用的hadoop版本是：hadoop-0.20.203（http://apache.etoak.com/hadoop/common/hadoop-0.20.203.0/ ），因为该版本比较稳定。

1、假设hadoop-0.20.203.tar.gz在桌面，将它复制到安装目录 /usr/local/下，如图（15）

2、解压hadoop-0.20.203.tar.gz，如图（16）

3、将解压出的文件夹改名为hadoop，如图（17）

4、将该hadoop文件夹的属主用户设为hadoop，如图（18）

5、打开hadoop/conf/hadoop-env.sh文件，如图（19）

6、配置conf/hadoop-env.sh（找到#export JAVA_HOME=...,去掉#，然后加上本机jdk的路径）

7、打开conf/core-site.xml文件，编辑如下：

<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<!-- Put site-specific property overrides in this file. -->

<configuration>
<property>  
  <name>fs.default.name</name>  
  <value>hdfs://localhost:9000</value>   
 </property>  
</configuration>

8、打开conf/mapred-site.xml文件，编辑如下：

<?xml version="1.0"?>
<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<!-- Put site-specific property overrides in this file. -->

    <configuration>  
     <property>   
      <name>mapred.job.tracker</name>  
      <value>localhost:9001</value>   
     </property>  
    </configuration>

9、打开conf/hdfs-site.xml文件，编辑如下：

<configuration>
<property>
<name>dfs.name.dir</name>
<value>/usr/local/hadoop/datalog1,/usr/local/hadoop/datalog2</value>
</property>
<property>
<name>dfs.data.dir</name>
<value>/usr/local/hadoop/data1,/usr/local/hadoop/data2</value>
</property>
<property>
<name>dfs.replication</name>
<value>2</value>
</property>
</configuration>

10、打开conf/masters文件，添加作为secondarynamenode的主机名，作为单机版环境，这里只需填写localhost就Ok了。

11、打开conf/slaves文件，添加作为slave的主机名，一行一个。作为单机版，这里也只需填写localhost就Ok了。

八、在单机上运行hadoop

1、进入hadoop目录下，格式化hdfs文件系统，初次运行hadoop时一定要有该操作，如图（21）

当你看到下图时，就说明你的hdfs文件系统格式化成功了。

3、启动bin/start-all.sh，如图（23）

4、检测hadoop是否启动成功，如图（24）

如果有Namenode，SecondaryNameNode，TaskTracker，DataNode，JobTracker五个进程，就说明你的hadoop单机

版环境配置好了，呵呵，多么宏伟的工程呀！

九、 Linux下的快捷键：
Ctrl+Alt+t：弹出终端
Ctrl+空格：中英文输入法切换

十、Hadoop执行WordCount程序(http://weixiaolu.iteye.com/blog/1402919 )。

查看图片附件

11
顶

2
踩

分享到：

Hadoop作业提交多种方案具体流程详解 | 超详细在Ubuntu下安装JDK图文解析

2012-02-10 14:05
浏览 44211
评论(16)
分类:编程语言
查看更多

16 楼 java--hhf 2014-04-28

第六步
ssh-keygen -t rsa -p ''
或者 ssh-keygen -t rsa -p “”
或者 ssh-keygen -t rsa -p ‘ ’
都没搞下最后发现直接不要p就可以了
ssh-keygen -t rsa
然后在Enter passphrase (empty for no passphrase):
Enter same passphrase again:
直接确认就是

15 楼 lhdgriver 2013-10-17

安装成功了，
1.一定要看用户，从第四步开始用的是hadoop用户而不是root了。用su hadoop切换用户
2.测试是否安装成功，可以试 hadoop@ubuntu:/usr/local/hadoop$ bin/hadoop jar hadoop-0.20.2-examples.jar pi 10 10

要是最后算出来Pi的值，应该就配置成功了，还在摸索中。

14 楼逸情公子 2013-09-26

引用

最后安装成功了。 “跟着楼主走，云在手”

呵呵，做广告呢，777还是太大了点，755应该就够了，或者chmod +x file_name试试

13 楼 xunke515 2013-09-23

1 前些日子按着楼主文章搞了一通，出现“正在更改"/usr/local/hadoop/bin/../logs" 的所有者: 不允许的操作” 字样的错误。
明显权限问题，但是我找了很久找不到原因。
今天慢慢看楼主安装JDK的文章才发现是linux默认权限是644的问题，需要修改成777。
2 第四小节起楼主已经从adminstor用户切换到了hadoop用户。要注意。

最后安装成功了。 “跟着楼主走，云在手”

12 楼 xunke515 2013-09-22

xunke515 写道

前几天看了下ubuntu的论坛，说最好不要用gedit命令打开 sudoers ，要用另外一个命令

要用visudo，不然改错sudoers就麻烦了。

11 楼 xunke515 2013-09-22

前几天看了下ubuntu的论坛，说最好不要用gedit命令打开 sudoers ，要用另外一个命令

10 楼 xchd 2013-07-03

非常感谢，it is ok

9 楼 Carmen_hongpeng 2013-01-13

非常感谢博主的无私奉献啊，真正为菜鸟搭建单机版hadoop提供了极大的方便，不过在我用的是1.7.0版本的jdk，所以在jdk安装和环境配置时，折磨了我好久。。。。。。万分感谢

8 楼 zzge163 2013-01-05

对linux不熟，前后花了三天时间，要是能早点找到博主的这篇文章就好了。BTW：我在配置xml文件时，由于最前面多了一行空白，导致xml不能解析，bin/hadoop namenode -format命令不能执行。大家也要注意啦！

7 楼 miluzhiyu 2012-12-11

伤不起额。。。这次我不知道咋配的，只能用调用su命令之后才能start-all，明明sudoer里面也写了的啊

6 楼 zoufangyingzi 2012-12-07

感谢楼主，按着操作做，安装了两天终于成功了！

5 楼 shenzhw 2012-09-04

为什么tasktracker和jobtraker没有呢

4 楼 miluzhiyu 2012-06-01

逸情公子写道

引用

<property>
<name>dfs.name.dir</name>
<value>/home/hadoop/hdfs/name</value>
</property>

这个配置表示在namenode节点上的信息放在“/home/hadoop/hdfs/name”这个文件夹里，,文件夹是自动生成的

引用

<property>
<name>dfs.data.dir</name>
<value>/home/hadoop/hdfs/data</value>
</property>

这个配置表示在datanode节点上的信息放在“/home/hadoop/hdfs/data”这个文件夹里,文件夹是自动生成的

引用

<name>dfs.replication</name>
<value>2</value>
</property>
</configuration>

表示hdfs上文件副本的个数为2，不配置这个属性的话，默认为3

soga~~~~谢谢大神~~~嘿嘿~~~~

3 楼 liuwuping1206 2012-05-30

我是windows下cygwin安装ssh 出现如下问题

*** Info: This script plans to use 'cyg_server'.
*** Info: 'cyg_server' will only be used by registered services.
*** Query: Do you want to use a different name? (yes/no) no
*** Query: Create new privileged user account 'cyg_server'? (yes/no) no
*** ERROR: There was a serious problem creating a privileged user.
*** Query: Do you want to proceed anyway? (yes/no) yes
*** Warning: Expected privileged user 'cyg_server' does not exist.
*** Warning: Defaulting to 'SYSTEM'

*** Info: The sshd service has been installed under the LocalSystem
*** Info: account (also known as SYSTEM). To start the service now, call
*** Info: `net start sshd' or `cygrunsrv -S sshd'. Otherwise, it
*** Info: will start automatically after the next reboot.

*** Warning: Host configuration exited with 1 errors or warnings!
*** Warning: Make sure that all problems reported are fixed,
*** Warning: then re-run ssh-host-config.

最后并没有出现hava fun

大侠能否帮忙解决下

2 楼逸情公子 2012-05-21

引用

<property>
<name>dfs.name.dir</name>
<value>/home/hadoop/hdfs/name</value>
</property>

这个配置表示在namenode节点上的信息放在“/home/hadoop/hdfs/name”这个文件夹里，,文件夹是自动生成的

引用

<property>
<name>dfs.data.dir</name>
<value>/home/hadoop/hdfs/data</value>
</property>

这个配置表示在datanode节点上的信息放在“/home/hadoop/hdfs/data”这个文件夹里,文件夹是自动生成的

引用

<name>dfs.replication</name>
<value>2</value>
</property>
</configuration>

表示hdfs上文件副本的个数为2，不配置这个属性的话，默认为3

1 楼 miluzhiyu 2012-05-21

请问conf/hdfs-site.xml文件中的
<property>
<name>dfs.name.dir</name>
<value>/usr/local/hadoop/datalog1,/usr/local/hadoop/datalog2</value>
</property>
<property>
<name>dfs.data.dir</name>
<value>/usr/local/hadoop/data1,/usr/local/hadoop/data2</value>
</property>
啥作用呢，我看了一篇集群配置时候他是
<property>
    <name>dfs.name.dir</name>
    <value>/home/hadoop/hdfs/name</value>
</property>

<property>
    <name>dfs.data.dir</name>
    <value>/home/hadoop/hdfs/data</value>
</property>
这样的，不晓得这些路径有啥区别，是啥含义呢？
<name>dfs.replication</name>
<value>2</value>
</property>
</configuration>
还有这个副本个数有啥要求呢？

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论