目录
一.Hadoop
1.1简单介绍
1.2单点部署hadoop
1.2.1下载hadoop软件包
1.2.2解压软件包
1.2.3配置hadoop用户
1.2.4完成相关文件配置
1.2.5完成免密配置
1.2.6启动节点
1.2.7测试
1.2.8关闭服务
1.3部署伪分布式hadoop集群
1.3.1准备工作
1.3.2完成nfs共享目录的配对
1.3.3启动节点
1.3.4扩展集群节点
一.Hadoop
官方文档:
Hadoop – Apache Hadoop 3.3.6https://hadoop.apache.org/docs/r3.3.6/
1.1简单介绍
1.说明:Hadoop可以看作一个“数据仓库管理系统”,但针对的是超大规模数据。它将数据拆分到多台电脑上(HDFS),并分发任务并行处理(MapReduce)。优点是便宜且容错,缺点是速度较慢,主要用于历史数据分析。
1.2单点部署hadoop
1.2.1下载hadoop软件包
官方网站:
Apache Archive Distribution Directoryhttps://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/
1.2.2解压软件包
tar -zxy hadoop-3.3.6.tar.gz jdk-8u181-linux-x64.tar.gz ln -s hadoop-3.3.6 hadoop #创建软链接说明:软链接,便于访问
1.2.3配置hadoop用户
useradd hadoop passwd hadoop su - hadoop vim .bash_profile source .bash_profile1.2.4完成相关文件配置
cd hadoop vim etc/hadoop/hadoop-env.sh1.2.5完成免密配置
说明:配置hadoop用户与localhost本机的免密配对
ssh-keygen hadoop ssh-copy-id localhost测试:
1.2.6启动节点
1.节点初始化
cd hadoop bin/hdfs namenode -format2.编辑etc/hadoop/core-site.xml文件
cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件3.编辑etc/hadoop/hdfs-site.xml文件
cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件说明:本机部署的话,只有一个机子,只能复制一份
4.启动脚本,启动hadoop
sbin/start-dfs.shnamenodes:管理元数据,负责指出文件的存储位置
datanodes:真正存储数据的节点
secondary namenodes:协助处理日志,防止namenodes崩溃
说明:我们现在是单机部署,所以:所有节点都在server1上
1.2.7测试
说明:进入hdfs管理系统,对数据进行管理
1.浏览器访问hdfs的管理界面
192.168.7.191:9870 #主机IP:98702.创建用户
bin/hdfs dfs -makdir /user bin/hdfs dfs -makdir /user/hadoop3.创建数据输入目录
bin/hdfs dfs -makdir /input bin/hdfs dfs -put etc/hadoop/*.xml /input #复制文件到input目录下4.执行文件,并将结果输入到output目录下
bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar grep input output 'dfs[a-z.]+'5.进入管理界面,查看文件
input:
output:
1.2.8关闭服务
cd hadoop sbin/stop-dfs.sh1.3部署分布式hadoop集群
1.3.1准备工作
1.准备三台机子,三台机子都是CentOS 7
2.完成域名间的解析
| 192.168.7.191 | server1 | namenode |
| 192.168.7.192 | server2 | datanode |
| 192.168.7.193 | server3 | datanode |
3.配置hadoop用户
useradd hadoop passwd hadoop4.三台机子之间相互完成免密配对
ssh-copy-id server1 ssh-copy-id server2 ssh-copy-id server3说明:记得在hadoop用户下完成免密配对,在hadoop用户下,配对的是对方的hadoop用户间的免密
1.3.2完成nfs共享目录的配对
说明:将server1的hadoop软件共享给server2和server3
1.安装nfs软件,并启动服务
yum install -y nfs-utils systemctl start nfs2.编辑server1的exports文件
vim /etc/exports exportfs -rv #刷新说明:允许所有外机访问server1的/home/hadoop
3.server2,server3远程挂载server1的/home/hadoop用户
mount 192.168.7.191:/home/hadoop /home/hadoop1.3.3启动节点
1.节点初始化
cd hadoop bin/hdfs namenode -format2.编辑etc/hadoop/core-site.xml文件
cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件3.编辑etc/hadoop/hdfs-site.xml文件
cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件说明:现在集群中存在两个数据节点,可以备两份。当然,并不是说,所有节点都必须备一份,只是你的备份数要小于等于集群中的数据节点的数量
4.编辑 etc/hadoop/workers 文件
cd hadoop vim etc/hadoop/workers #编辑配置文件说明:该节点定义,存储数据的节点
5.启动节点集群
sbin/start-dfs.sh6.查看集群节点
1.3.4扩展集群节点
1.新准备一台CentOS 7虚拟机
2.完成域名解析
| 192.168.7.191 | server1 | namenode |
| 192.168.7.192 | server2 | datanode |
| 192.168.7.193 | server3 | datanode |
3.完成nfs配置
yum install -y nfs-utils mount server1:/home/hadoop /home/hadoop说明:nfs是热启动,挂载时会自动启动
4.编辑 etc/hadoop/workers 文件
cd hadoop vim etc/hadoop/workers #编辑配置文件5.在server4中启动nodemanager和datanode节点
bin/hdfs --daemon start nodemanager bin/hdfs --daemon start datanode jps #查看集群节点