大佬教程收集整理的这篇文章主要介绍了全国大学生大数据技能竞赛(Hadoop集群搭建),大佬教程大佬觉得挺不错的,现在分享给大家,也给大家做个参考。
本篇博客将根据往年全国大学生大数据技能竞赛的资料和今年的培训来Hadoop搭建c;每一个步骤都有相应的执行的截图。以下博客仅作为个人搭建Hadoop过程的记录~如有不足之处欢迎指出c;共同学习进步。附上资料链接。
第四届全国大学生大数据技能竞赛中关于搭建Hadoop集群的培训链接: https://www.qingjiaoclass.com/market/detail/4486 所有环境工具百度网盘链接: https://pan.baidu.com/s/1oOW7WqHK4fiqv4Xja5f7gQ 提取码:vvi7
在自己练习搭建Hadoop集群时尽量每一步都拍快照c;防止出现错误解决不了然后不得不重新搭建c;非常麻烦
1.暂时关闭防火墙和selinux
systemctl stop firewalld
setenforce 0
2.永久关闭
systemctl disable firewalld
vi /etc/sysconfig/selinux
2.配置网络桥接模式修改静态ip地址
vi /etc/sysconfig/network-scripts/ifcfg-ens33
nmcli c reload ifcfg-ens33
nmcli con up ens33
ifconfig
3.克隆两台虚拟机c;并修改IP地址
克隆虚拟机 修改克隆的两台虚拟机ip分别为 192.168.43.140c;192.168.43.150 打开SecureCRT,远程登录三台虚拟机
systemctl stop firewalld
systemctl status firewalld
本次集群搭建共有三个节点c;包括一个主节点masterc;和两个从节点slave1和slave2。需要把三个节点的主机名分别修改。
1.以主机点master为例c;首次切换到root用户:su 2.修改主机名为master:
hostnamectl set-hostname master
3.立即生效:
bash
4.若要永久修改主机名c;编辑/etc/sysconfig/network文件
vi /etc/sysconfig/network
内容如下:
NETWORKING=yes HOSTNAME=master
保存该文件c;重启计算机:reboot 查看是否生效:hostname使各个节点能使用对应的节点主机名连接对应的地址。
hosts文件主要用于确定每个结点的IP地址c;方便后续各结点能快速查到并访问。在上述3个虚机结点上均需要配置此文件。
vi /etc/hosts
1.查看自己机器时间:
date
2.选择时区:
tzSELEct
1.3台机器安装ntp:
yum install -y ntp
2.master作为ntp服务器c;修改ntp配置文件。(master上执行)
vi /etc/ntp.conf
找到第58行c;也就是最后一行 添加 server 127.127.1.0 fudge 127.127.1.0 stratum 10
3.重启ntp服务。/bin/systemctl restart ntpd.service
4.其他机器同步(slave1c;slave2) 等待大概五分钟c;再到其他机上同步该机器时间。
ntPDAte master
crontab -h
可查看命令相关操作
要求:每10min执行一次
写一个定时任务:
crontab -e
键入 i ,进入编辑模式 输入内容:
*/10 * * * * usr/sbin/ntPDAte master
查看定时任务列表:
crontab -l
为了让主结点master能通过SSH免密码登录两个子结点slave。 1.三台机器分别执行
ssh-keygen -t dsa -P '' -f ~/.ssh/id_dsa
2.只在master节点执行
cd .ssh/
ls
id_dsa.pub为公钥c;id_dsa为私钥
3.将公钥文件复制成authorized_keys文件:(仅master)cat id_dsa.pub >> authorized_keys
验证ssh内回环
ssh master
输入yes
exit
ssh master#这一次不用输入yes验证
4.在master节点执行以下命令:
scp ./authorized_keys root@slave1:~/.ssh/
scp ./authorized_keys root@slave2:~/.ssh/
5.验证ssh免密登录
ssh slave1
exit
三台虚拟机都需安装 1.建立工作路径
@H_201_108@mkdir -p /usr/java
2.把文件传输到本地根目录(我用的secureCRT) 到Windows下先复制jdk的安装包c;点击箭头所指的那个c;然后右键粘贴c;等待文件传输完成。
3.解压缩tar -zxvf jdk-8u171-linux-x64.tar.gz -C /usr/java/
4.修改环境变量
vi /etc/profile
在文件第55行添加以下内容
export JAVA_HOME=/usr/java/jdk1.8.0_171
export PATH=$PATH:$JAVA_HOME/bin
生效文件和查看jdk版本
source /etc/profile
java -version
安装的jdk版本和自己安装的一样c;安装成功!
请看这篇博文c;相信你能解决问题! 安装完jdk后jdk版本和自己安装的不一样怎么办?
注意:第1步在三台虚拟机进行c;2~10步在master虚拟机进行c;11步在 slave1,slave2虚拟机进行c;12步在三台虚拟机进行
1.修改主机名称到ip地址映射配置(三台虚拟机)
vi /etc/hosts
192.168.43.130 master master.root 192.168.43.140 slave1 slave1.root 192.168.43.150 slave2 slave2.root
2.上传zookeeper安装包到虚拟机根目录 3.新建目录@H_201_108@mkdir -p /usr/zookeeper4.解压缩
tar -zxvf zookeeper-3.4.10.tar.gz -C /usr/zookeeper/
5.修改/etc/profile文件c;配置zookeeper环境变量。
vi /etc/profile
在第58行添加
export ZOOKEEPER_HOME=/usr/zookeeper/zookeeper-3.4.10
PATH=$PATH:$ZOOKEEPER_HOME/bin
6.进入zookeeper配置文件夹confc;将zoo_sample.cfg文件拷贝一份命名为zoo.cfg
cd /usr/zookeeper/zookeeper-3.4.10/conf/
cp -p zoo_sample.cfg zoo.cfg
7. 配置文件zoo.cfg
vi zoo.cfg
修改第12行为 dataDir=/usr/zookeeper/zookeeper-3.4.10/zkdata
在第29行c;也就是文件末尾c;添加以下内容 dataLogDir=/usr/zookeeper/zookeeper-3.4.10/zkdatalog
server.1=master:2888:3888 server.2=slave1:2888:3888 server.3=slave2:2888:3888
8.在zookeeper的目录中c;创建配置中所需的zkdata和zkdatalog两个文件夹。
@H_201_108@mkdir zkdata mkdir zkdatalog9.进入zkdata文件夹c;创建文件myidc;用于表示是几号服务器。master主机中c;设置服务器id为1。
cd zkdata
vi myid
10.以上已经在主节点master上配置完成ZooKeeperc;现在可以将该配置好的安装文件远程拷贝到集群 中的各个结点对应的目录下(这时候子节点):
scp -r /usr/zookeeper root@slave1:/usr/
scp -r /usr/zookeeper root@slave2:/usr/
11.配置文件myid文件c;slave1为2c;slave2为3
cd /usr/zookeeper/zookeeper-3.4.10/zkdata
vi myid
12.启动zookeeper集群 每台虚拟机要先进入zookeeper目录下
cd /usr/zookeeper/zookeeper-3.4.10/
再分别执行
bin/zkServer.sh start
bin/zkServer.sh status
一个节点是leader,其余节点是followerc;就安装成功啦~
1.把Hadoop安装包拷贝到根目录c;创建工作目录c;解压Hadoop安装包
@H_201_108@mkdir –p /usr/hadoop tar -zxvf hadoop-2.7.3.tar.gz -C /usr/hadoop/
2.配置环境变量c;修改/etc/profile文件
vi /etc/profile
在第60行添加
#HADOOP
export HADOOP_HOME=/usr/hadoop/hadoop-2.7.3
export CLASSPATH=$CLASSPATH:$HADOOP_HOME/lib
export PATH=$PATH:$HADOOP_HOME/bin
3.生效配置文件
source /etc/profile
1.进入Hadoop的/etc/hadoop目录
cd /usr/hadoop/hadoop-2.7.3/etc/hadoop
2.编辑hadoop-env.sh文件
vi /hadoop-env.sh
在第28行添加以下内容
export JAVA_HOME=/usr/java/jdk1.8.0_171
3.编辑core-site.xml
vi core-site.xml
添加以下内容
<configuration>
<property>
<name>fs.default.name</name>
<value>hdfs://@H_899_116@master:9000</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/usr/hadoop/hadoop-2.7.3/hdfs/tmp</value>
<description>A base for other temporary directories.</description>
</property>
<property>
<name>io.file.buffer.size</name>
<value>131072</value>
</property>
<property>
<name>fs.checkpoint.period</name>
<value>60</value>
</property>
<property>
<name>fs.checkpoint.size</name>
<value>67108864</value>
</property>
</configuration>
4.编辑yarn -site.xml
vi yarn-site.xml
<property>
<name>yarn.resourcemanager.address</name>
<value>master:18040</value>
</property>
<property>
<name>yarn.resourcemanager.scheduler.address</name> <value>master:18030</value>
</property>
<property>
<name>yarn.resourcemanager.webapp.address</name>
<value>master:18088</value>
</property>
<property>
<name>yarn.resourcemanager.resource-tracker.address</name>
<value>master:18025</value>
</property>
<property>
<name>yarn.resourcemanager.admin.address</name>
<value>master:18141</value>
</property>
<property>
<name>yarn.resourcemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
<property>
<name>yarn.nodemanager.auxservices.@H_899_116@mapreduce.shuffle.class</name>
<value>org.apache.hadoop.@H_899_116@mapred.shuffleHandler</value>
</property>
5.编辑hdfs-site.xml
vi hdfs-site.xml
添加以下内容
<configuration>
<property>
<name>dfs.Replication</name>
<value>2</value>
</property>
<property>
<name>dfs.namenode.name.dir</name>
<value>file:/usr/hadoop/hadoop-2.7.3.hdfs/name</value>
<final>true</final>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>file:/usr/hadoop/hadoop-2.7.3/hdfs/data</value>
<final>true</final>
</property>
<property>
<name>dfs.namenode.secondary.http-address</name>
<value>master:9001</value>
</property>
<property>
<name>dfs.webhdfs.enabled</name>
<value>true</value>
</property>
<property>
<name>dfs.permissions</name>
<value>false</value>
</property>
</configuration>
6.编辑mapred-site.xml hadoop是没有这个文件的c;需要将mapred-site.xml.template复制为mapredsite.xml。
cp mapred-site.xml.template mapred-site.xml
vi mapred-site.xml
添加以下内容
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
7.设置节点文件
vi slaves
vi master
8.分发hadoop
scp -r /usr/hadoop root@slave1:/usr/
scp -r /usr/hadoop root@slave2:/usr/
9.hdfs格式化(master虚拟机执行)
hadoop namenode -format
出现下面这句话时c;恭喜你~格式化成功!
10.开启集群 仅在master主机上开启操作命令。它会带起从节点的启动。 开启集群: 进入到Hadoop目录下执行:sbin/start-all.sh
或者
start-all.sh start
查看进程:
jsp
11.浏览器访问:masterIP:50070 出现以下页面表面搭建成功~~
以上是大佬教程为你收集整理的全国大学生大数据技能竞赛(Hadoop集群搭建)全部内容,希望文章能够帮你解决全国大学生大数据技能竞赛(Hadoop集群搭建)所遇到的程序开发问题。
如果觉得大佬教程网站内容还不错,欢迎将大佬教程推荐给程序员好友。
本图文内容来源于网友网络收集整理提供,作为学习参考使用,版权属于原作者。
如您有任何意见或建议可联系处理。小编QQ:384754419,请注明来意。