Hadoop Yarn Spark Installation Lab
281
docker run -d -p 0.0.0.0:2222:22 -p 0.0.0.0:50070:50070 --name hadoop tanlull/hadoop_spark_lab
port: 2222 user: user01 password: password
########## Setup Apache Hadoop 2.7.2 ##########
cd tar -xvf hadoop-2.7.2.tar.gz sudo mv ./hadoop-2.7.2 /usr/local/hadoop
sudo nano ~/.bashrc export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64/ export PATH=$PATH:$JAVA_HOME/bin export HADOOP_HOME=/usr/local/hadoop export PATH=$PATH:$HADOOP_HOME/bin export PATH=$PATH:$HADOOP_HOME/sbin
source ~/.bashrc sudo mkdir /var/log/hadoop sudo chown -R user01:user01 /var/log/hadoop cd /usr/local/hadoop/etc/hadoop vi hadoop-env.sh export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
nano yarn-env.sh YARN_LOG_DIR=/var/log/hadoop
ifconfig [Suppost that we have IP = 172.17.0.3 ]
vi core-site.xml fs.defaultFS hdfs://172.17.0.3:9000
sudo mkdir -p /var/hadoop_data/namenode sudo mkdir -p /var/hadoop_data/datanode sudo chown user01:user01 -R /var/hadoop_data
vi hdfs-site.xml dfs.replication 1 dfs.namenode.name.dir file:/var/hadoop_data/namenode dfs.datanode.data.dir file:/var/hadoop_data/datanode
vi yarn-site.xml yarn.resourcemanager.hostname 172.17.0.3 yarn.resourcemanager.scheduler.address 172.17.0.3:8030 yarn.resourcemanager.resource-tracker.address 172.17.0.3:8031 yarn.resourcemanager.address 172.17.0.3:8032 yarn.resourcemanager.admin.address 172.17.0.3:8033 yarn.resourcemanager.webapp.address 172.17.0.3:8088 yarn.nodemanager.aux-services mapreduce_shuffle yarn.nodemanager.aux-services.mapreduce.shuffle.class org.apache.hadoop.mapred.ShuffleHandler
cp mapred-site.xml.template mapred-site.xml vi mapred-site.xml mapreduce.framework.name yarn
hdfs namenode -format
cd /var/hadoop_data/namenode/ ll cd current/ ls
cd /usr/local/hadoop/etc/hadoop start-dfs.sh [answer yes] jps
start-yarn.sh jps
netstat -a
[docker run -d -p 0.0.0.0:2222:22 -p 0.0.0.0:50070:50070 --name hadoop tanlull/hadoop_yarn_run]
URL: http://192.168.99.100:50070/
########## Apache Hadoop HDFS ##########
cd /usr/local/hadoop/etc/hadoop/
hdfs dfs -mkdir /inputs hdfs dfs -mkdir /outputs
hdfs dfs -copyFromLocal ~/sales_data_jan2009.csv /inputs/ hdfs dfs -ls /inputs
hdfs dfs -cat /inputs/sales_data_jan2009.csv
hdfs dfs -rm /inputs/sales_data_jan2009.csv
hdfs dfs -copyFromLocal ~/sales_data_jan2009.csv /inputs/sales_data_jan2009.csv hdfs dfs -ls /inputs/
cd /var/hadoop_data/datanode/ ls cd current/ cd BP-2114074188-127.0.1.1-1474558767749/ ls cd current/ ls cd finalized/ ls cd subdir0/ ls cd subdir0/ ls
Content type
Image
Digest
Size
650.5 MB
Last updated
almost 10 years ago
docker pull tanlull/hadoop_spark_lab