Sign inSign up

ingu627/hadoop

By ingu627

Updated over 3 years ago

hadoop, spark, scala, pyspark, sql, zeppelin, kafka

Image
2

252

ingu627/hadoop repository overview

  1. Construct Hadoop cluster
docker run -it -d -h master --privileged=true --name master -p 50070:50070 ingu627/hadoop:base2 /sbin/init
docker run -it -d -h slave1 --privileged=true --name slave1 --link master:master ingu627/hadoop:base2 /sbin/init
docker run -it -d -h slave2 --privileged=true --name slave2 --link master:master ingu627/hadoop:base2 /sbin/init
  1. modify host file
$ vi /etc/hosts

172.17.0.3 master
172.17.0.4 slave1
172.17.0.5 slave2

  1. etc
$ service ssh restart
$ vi workers
slave1
slave2
master

<br>

$ hadoop namenode -format
$ cd
$ start-all.sh
$ jps
$ hdfs dfsadmin -report

$ stop-all.sh



  1. spark
docker run -it -d -h spark -p 8080:8080 --privileged=true --name spark ingu627/hadoop:spark3.3.0 /sbin/init

  1. pyspark in jupyter notebook
docker run -it -d -h pyspark -p 8080:8080 --privileged=true --name pyspark ingu627/hadoop:pyspark /sbin/init
  • /bin/bash
  • conda activate pyspark_env
  • jupyter notebook
  • password : 202224205

  1. zeppelin
  • bin/zeppelin-daemon.sh start
  • bin/zeppelin-daemon.sh stop

Tag summary

Content type

Image

Digest

sha256:f6837d1ac

Size

2.1 GB

Last updated

over 3 years ago

docker pull ingu627/hadoop:pyspark-mac