1. 下载Cygwin(略)
2. 安装Cygwin(略)
3. 安装ssh, 这里在安装Cygwin的时候,选择cur,再在左边框内输入"ssh"搜索出选项,然后点击框内的default改为instant,这样就会安装ssh.然后安装结束.
4. 免登陆ssh设置
*. $ ssh-keygen -t dsa #生成dsa密匙.[无需用户名密码]
*. cat ~/.ssh/id_dsa.pub >> ~/.ssh/authorized_keys 把密匙加到权限中,
就可以够登陆了
5. 设置hadoop环境变量
*. conf/hadoop-env.sh文件,至少需要将JAVA_HOME设置为Java安装根路径
尝试如下命令:
$ bin/hadoop
将会显示hadoop 脚本的使用文档。
现在你可以用以下三种支持的模式中的一种启动Hadoop集群:
单机模式
伪分布式模式
完全分布式模式
6. 单机模式配置
默认情况下,Hadoop被配置成以非分布式模式运行的一个独立Java进程。这对调试非常有帮助。
下面的实例将已解压的 conf 目录拷贝作为输入,查找并显示匹配给定正则表达式的条目。输出写入到指定的output目录。
$ mkdir input
$ cp conf/*.xml input
$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+'
$ cat output/*
7. 伪分布式配置
Hadoop可以在单节点上以所谓的伪分布式模式运行,此时每一个Hadoop守护进程都作为一个独立的Java进程运行
配置
使用如下的 conf/hadoop-site.xml:
<configuration>
<property>
<name>fs.default.name</name>
<value>localhost:9000</value>
</property>
<property>
<name>mapred.job.tracker</name>
<value>localhost:9001</value>
</property>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
</configuration>
8. 格式化分布式文件系统(hdfs)
在格式化前需要设置环境变量.
在Cygwin上配置Hadoop的Java_home,首先到了${HADOOP_HOME}的conf目录下,修改hadoop-env.sh文件。主要分为如下几步:
1. 找到JAVA_HOME,修改JAVA_HOME的路径指向你本机安装的Jdk路径。注意,这里的路径不能以window的路径出现,应该用unix的形式出现,例如c:\Program Files\Java\jdk1.6.0,应该写成/cygdrive/c/Program Files/Java/jdk1.6.0.而且,还有一点要注意的是,如果路径有空格,如Program Files间的空格,则应该将路径用双引号括起("/cygdrive/c/Program Files/Java/jdk1.6.0")。
2. 修改完hadoop-env.sh文件后,如果马上启动Hadoop,仍会报错,出现“/bin/java: No such file or directoryva/jdk1.6.0_10 ”的错误。经过上网查证,发现是dos环境与Unix的字符编码的问题,可以用dos2unix来实现 DOS <=> UNIX text file 转换。所以切换到conf目录下,对hadoop-env.sh进行Unix文本转化:dos2unix hadoop-env.sh.
然后再到${Hadoop-home}执行如下语句就会格式化成功了
$ bin/hadoop namenode -format
启动Hadoop守护进程:
$ bin/start-all.sh
Hadoop守护进程的日志写入到 ${HADOOP_LOG_DIR} 目录 (默认是 ${HADOOP_HOME}/logs).
浏览NameNode和JobTracker的网络接口,它们的地址默认为:
NameNode - http://localhost:50070/
JobTracker - http://localhost:50030/
将输入文件拷贝到分布式文件系统:
$ bin/hadoop fs -put conf input
运行发行版提供的示例程序:
$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+'
查看输出文件:
将输出文件从分布式文件系统拷贝到本地文件系统查看:
$ bin/hadoop fs -get output output
$ cat output/*
或者
在分布式文件系统上查看输出文件:
$ bin/hadoop fs -cat output/*
完成全部操作后,停止守护进程:
$ bin/stop-all.sh
9.完全分布式(略)
分享到:
相关推荐
Hadoop环境搭建主要包括配置Hadoop相关的配置文件,包括但不限于hadoop-env.sh、core-site.xml、hdfs-site.xml、mapred-site.xml、masters和slaves文件。 在hadoop-env.sh文件中需要指定Java的安装路径,因为Hadoop...
### Hadoop环境搭建手册 #### 一、Hadoop简介 Hadoop是一个开源的分布式计算框架,主要用于处理大规模数据集。该框架由Apache软件基金会维护,是大数据领域内最重要的技术之一。Hadoop的核心组件包括MapReduce和...
在Windows上使用Cygwin作为类Unix支撑环境来安装Hadoop, 网上介绍的还是比较多的。...其实,Hadoop环境搭建的主要内容是Cygwin的安装,估计要占总时间的2/3, 其它工作我会手把手的教你,come on,follow me!
hadoop环境搭建和eclipse开发
Hadoop环境搭建手册 Hadoop,作为开源的分布式计算框架,是云计算领域的重要组成部分,尤其在大数据处理上表现卓越。本手册将详细讲解如何搭建一个完整的Hadoop环境,包括所有基本信息,供读者参考并实操。 **...
Hadoop环境搭建.pdf Hadoop环境搭建.pdf Hadoop环境搭建.pdf
hadoop的环境搭建过程.方便第一次使用hadoop的同学.快速搭建环境
### Hadoop环境搭建详解 #### 一、引言 随着大数据技术的发展,Hadoop作为大数据处理的核心框架之一,其重要性不言而喻。对于初学者来说,掌握Hadoop的基本安装与配置流程是非常重要的第一步。本文旨在提供一份...
hadoop 环境搭建、机器部署以及 Linux 常用命令操作指南 本指南将指导用户从头开始搭建 Hadoop 环境,包括虚拟机环境的准备、Linux 基础知识、shell 增强大数据集群环境准备、ZooKeeper 介绍及集群操作网络编程等...
4. 配置Hadoop环境是关键步骤,主要涉及以下几个文件: - `hadoop-env.sh`: 这个文件用于设置Hadoop相关的环境变量,如`JAVA_HOME`,应确保指向正确的JDK安装路径,例如`/home/tools/jdk1.8.0_221`。 - `hdfs-...
Hadoop 环境搭建 - Linux(CentOS7)- 安装配置 JDK1.8 本文档主要介绍了在 CentOS7 环境下搭建 Hadoop 环境,包括安装配置 JDK1.8 的过程。下面是相关知识点的总结: 一、删除自带的 OpenJDK 在 CentOS7 中,...
"Hadoop环境搭建" Hadoop 环境搭建是大数据处理和分析的基础,涉及到虚拟机的安装、操作系统的选择、虚拟机的配置等多个方面。下面是 Hadoop 环境搭建的详细知识点: 一、虚拟机的安装 1.1 VMware 中新建虚拟机的...
"Hadoop 环境搭建 - Linux(CentOS7)- 安装配置 Scala 2.11.8" 本文主要讲述如何在 CentOS7 环境下搭建 Hadoop 环境,并安装配置 Scala 2.11.8。下面是相关知识点的总结: 1. Hadoop 环境搭建 在 CentOS7 环境下...
大数据-Hadoop环境搭建(单机) 本文档旨在指导读者搭建大数据Hadoop环境,基于CentOS 6.8操作系统,使用JDK 1.8和Hadoop 2.8.2版本。文档涵盖了服务器选择、相关配置、Hadoop环境安装、JDK环境配置、Hadoop环境配置...
本资源包含Hadoop环境搭建所需的关键组件,主要为Hadoop 2.7.2和Java Development Kit (JDK) 8u181的Linux版本。 1. **Hadoop 2.7.2**: 这是Hadoop的一个稳定版本,它支持HDFS(Hadoop Distributed File System)和...
### Hadoop环境搭建知识点 #### 一、Hadoop的重要性与基础知识 - **Hadoop的地位**:作为大数据处理领域的核心框架之一,Hadoop被广泛应用于数据存储与处理领域,特别是对于大规模数据集的数据处理方面有着不可替代...