Sign inSign up

leijiangping/hadoop

By leijiangping

Updated over 8 years ago

hadoop on ubuntu 16.04

Image
0

486

leijiangping/hadoop repository overview

【本项目是在 kiwenlau/hadoop-cluster-docker 的基础上修改产生的,本人也不太懂,哈哈!凑合用】

一. 项目介绍 将Hadoop打包到Docker镜像中,就可以快速地在单个机器上搭建Hadoop集群,这样可以方便新手测试和学习。

如下图所示,Hadoop的master和slave分别运行在不同的Docker容器中,其中hadoop-master容器中运行NameNode和ResourceManager,hadoop-slave容器中运行DataNode和NodeManager。NameNode和DataNode是Hadoop分布式文件系统HDFS的组件,负责储存输入以及输出数据,而ResourceManager和NodeManager是Hadoop集群资源管理系统YARN的组件,负责CPU和内存资源的调度。

alt_tag

项目中使用以下命令为Hadoop集群创建单独的网络:

sudo docker network create --driver=bridge hadoop 然后在运行Hadoop容器时,使用"--net=hadoop"选项,这时所有容器将运行在hadoop网络中,它们可以通过容器名称进行通信。

二. 3节点Hadoop集群搭建步骤

  1. 下载Docker镜像 sudo docker pull leijiangping/hadoop-base
  2. 下载GitHub仓库 git clone https://github.com/leijiangping/docker-image
  3. 创建Hadoop网络 sudo docker network create --driver=bridge hadoop
  4. 运行Docker容器 cd hadoop-cluster-docker ./start-container.sh

或者依次执行命令: docker run -itd --net=hadoop --name hadoop-slave1 --hostname hadoop-slave1 leijiangping/hadoop docker run -itd --net=hadoop --name hadoop-slave2 --hostname hadoop-slave2 leijiangping/hadoop docker run -itd --net=hadoop --p 50070:50070 -p 8088:8088 --name hadoop-master --hostname hadoop-master -v /home/docker/hadoop/job/mapreduce:/root/hadoop/job/mapreduce leijiangping/hadoop docker exec -it hadoop-master bash 其中:-v /home/docker/hadoop/job/mapreduce:/root/hadoop/job/mapreduce 为hadoop-master挂载了一个放置任务jar的位置。

运行结果:

start hadoop-master container... start hadoop-slave1 container... start hadoop-slave2 container... root@hadoop-master:~# 启动了3个容器,1个master, 2个slave

运行后就进入了hadoop-master容器的/root目录

  1. 启动hadoop ./start-hadoop.sh
  2. 运行wordcount ./run-wordcount.sh 运行结果

input file1.txt: Hello Hadoop input file2.txt: Hello Docker wordcount output: Docker 1 Hadoop 1 Hello 2 Hadoop网页管理地址:

NameNode: http://192.168.0.54:50070/

ResourceManager: http://192.168.0.54:8088/

HDFS访问地址: hdfs://hadoop-master:9000/

http://192.168.0.54 为运行容器的虚拟主机的IP。

三. N节点Hadoop集群搭建步骤

  1. 准备 参考第二部分1~3:下载Docker镜像,下载GitHub仓库,以及创建Hadoop网络

  2. 重新构建Docker镜像 ./resize-cluster.sh 5 可以指定任意N(N>1)

  3. 启动Docker容器 ./start-container.sh 5 与第2步中的N保持一致。

  4. 运行Hadoop 参考第二部分5~6:启动Hadoop,并运行wordcount。

补充说明:

本人在windows下vmware虚拟机中安装了ubuntu docker环境 ,docker环境中用此镜像部署了3个节点的hadoop集群,集群运行正常。 但windows下的eclipse hadoop插件以及 java程序 调用 hdfs 时,无法访问datanode。 分析:此时由于namenode返回给java客户端的是 datanode在docker环境中的内网IP, 所以在最外层宿主机windous中无法识别 hadoop-slave1,hadoop-slave2两个节点名。 同时由于所有节点共用此docker镜像,不同节点的datanode 服务采用了相同的端口,无法都映射到 虚拟主机 ubuntu的端口上。

综上所述,以上部署方式在开发阶段存在一定局限性,使用不太方便。 为了方便单台物理机搭建hadoop集群,并进行开发调试,特提出以下解决办法:

以搭建一个3节点的hadoop集群为例:

首先在物理机所在网络的一台或不同及3台物理机上搭建vmware虚拟机,并安装linux操作系统。vmware选择桥接网络模

式使得虚拟机共享物理网络。在虚拟机linux系统中搭建docker环境,以host网络模式分别在不同的vm虚拟机上启动

hadoop容器。这种方式下,docker容器和所在宿主虚拟机共享一个物理IP地址。

映射关系图如下:

网络地址 虚拟机 hadoop实例 docker容器采用的网络模式

192.168.0.54 vm1 hadoop-master host 192.168.0.55 vm2 hadoop-slave1 host 192.168.0.56 vm3 hadoop-slave2 host

hadoop集群启动脚本:

docker run -itd --net=host -p 9000:9000 -p 50070:50070 -p 8088:8088 --name hadoop-master --hostname hadoop-master -v /home/docker/hadoop/job/mapreduce:/root/hadoop/job/mapreduce leijiangping/hadoop

docker run -itd --net=host -p 50010:50010 --name hadoop-slave1 --hostname hadoop-slave1 leijiangping/hadoop

docker run -itd --net=host -p 50010:50010 --name hadoop-slave2 --hostname hadoop-slave2 leijiangping/hadoop

docker exec -it hadoop-master bash

进入容器后运行:

./start-hadoop.sh

集群环境搭建完成!

Tag summary

Content type

Image

Digest

Size

497 MB

Last updated

over 8 years ago

docker pull leijiangping/hadoop