linux搭建hadoop

作者: 尐叄
来源: 51数据库
2020-10-05

一、安装hadoop

1 因为hadoop是基于java的，所以要保证hadoop能找到在本地系统中大路径，即正确设置java的环境变量。

详细请看：linux 安装配置jdk

2 到官网：

这里我选择hadoop1.0.4

3 解压到 /usr/local

tar -xvf hadoop-1.0.4.tar.gz

4 设置hadoop环境变量，为了使环境变量永久有效并对所有用户有效，我们将下面两句添加到/etc/profile

export HADOOP_HOME=/usr/local/hadoop-1.0.4

export PATH=$PATH:$HADOOP_HOME/bin

5 验证hadoop是否可以运行

hadoop version

ok, 安装成功！（？不算安装吧，哈哈）

二、配置伪分布式模式

根据上面步骤安装成功后，hadoop处于独立模式即本机模式，在本机模式下，没有运行守护进程，所有程序运行在单个JVM上。本机模式用于开发阶段测试调试MapReduce程序。伪分布模式用于在本机上模拟一个小规模的集群，全分布模式配置较为复杂，留作后面的文章。

1 配置hadoop

（1）修改core-site.xml，设置namenode主机及hadoop文件系统

<name>fs.default.name</name>

<value>hdfs://localhost:9001</value>

</property>

</configuration>

（2）修改hdfs-site.xml，设置数据块副本数目

<name>dfs.replication</name>

</property>

</configuration>

（3）修改mapred-site.xml，设置jobtracker主机及端口

<name>mapred.job.tracker</name>

<value>hdfs://localhost:9000</value>

</property>

</configuration>

（4）修改hadoop-env.sh，设置JAVA_HOME

在hadoop-env.sh中添加，本机中jdk路径

export JAVA_HOME=/usr/local/jdk1.7.0

2 配置SSH

（1）如果没有安装SSH，安装之：sudo apt-get install ssh

一般情况下，ubuntu默认安装openssh-client，但没有安装server,我们需要先安装server:

sudo apt-get install openssh-server

（2）基于空口令创建一个新的SSH密钥，启用无密码登录

ssh-keygen -t rsa -P '' -f ~/.ssh/id_rsa

cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys

（3）测试连接是否成功：

ssh localhost

3 格式化HDFS文件系统以创建一个空大文件系统

hadoop namenode -format

4 启动守护系统HDFS和MapReduce

start-dfs.sh

start-mapred.sh

5 查看守护进程启动情况

jps

如果显示：

10716 DataNode

11305 Jps

10938 SecondaryNameNode

10503 NameNode

11037 JobTracker

11251 TaskTracker

ok, hadoop伪分布模式配置成功！