一篇文章!搞懂如何部署Hadoop
2026/8/27 11:19:55 网站建设 项目流程

目录

一.Hadoop

1.1简单介绍

1.2单点部署hadoop

1.2.1下载hadoop软件包

1.2.2解压软件包

1.2.3配置hadoop用户

1.2.4完成相关文件配置

1.2.5完成免密配置

1.2.6启动节点

1.2.7测试

1.2.8关闭服务

1.3部署伪分布式hadoop集群

1.3.1准备工作

1.3.2完成nfs共享目录的配对

1.3.3启动节点

1.3.4扩展集群节点


一.Hadoop

官方文档:

Hadoop – Apache Hadoop 3.3.6https://hadoop.apache.org/docs/r3.3.6/

1.1简单介绍

1.说明:Hadoop可以看作一个“数据仓库管理系统”,但针对的是超大规模数据。它将数据拆分到多台电脑上(HDFS),并分发任务并行处理(MapReduce)。优点是便宜且容错,缺点是速度较慢,主要用于历史数据分析。

1.2单点部署hadoop

1.2.1下载hadoop软件包

官方网站:

Apache Archive Distribution Directoryhttps://archive.apache.org/dist/hadoop/common/hadoop-3.3.6/

1.2.2解压软件包

tar -zxy hadoop-3.3.6.tar.gz jdk-8u181-linux-x64.tar.gz ln -s hadoop-3.3.6 hadoop #创建软链接

说明:软链接,便于访问

1.2.3配置hadoop用户

useradd hadoop passwd hadoop su - hadoop vim .bash_profile source .bash_profile

1.2.4完成相关文件配置

cd hadoop vim etc/hadoop/hadoop-env.sh

1.2.5完成免密配置

说明:配置hadoop用户与localhost本机的免密配对

ssh-keygen hadoop ssh-copy-id localhost

测试:

1.2.6启动节点

1.节点初始化

cd hadoop bin/hdfs namenode -format

2.编辑etc/hadoop/core-site.xml文件

cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件

3.编辑etc/hadoop/hdfs-site.xml文件

cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件

说明:本机部署的话,只有一个机子,只能复制一份

4.启动脚本,启动hadoop

sbin/start-dfs.sh

namenodes:管理元数据,负责指出文件的存储位置

datanodes:真正存储数据的节点

secondary namenodes:协助处理日志,防止namenodes崩溃

说明:我们现在是单机部署,所以:所有节点都在server1上

1.2.7测试

说明:进入hdfs管理系统,对数据进行管理

1.浏览器访问hdfs的管理界面

192.168.7.191:9870 #主机IP:9870

2.创建用户

bin/hdfs dfs -makdir /user bin/hdfs dfs -makdir /user/hadoop

3.创建数据输入目录

bin/hdfs dfs -makdir /input bin/hdfs dfs -put etc/hadoop/*.xml /input #复制文件到input目录下

4.执行文件,并将结果输入到output目录下

bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar grep input output 'dfs[a-z.]+'

5.进入管理界面,查看文件

input:

output:

1.2.8关闭服务

cd hadoop sbin/stop-dfs.sh

1.3部署分布式hadoop集群

1.3.1准备工作

1.准备三台机子,三台机子都是CentOS 7

2.完成域名间的解析

192.168.7.191server1namenode
192.168.7.192server2datanode
192.168.7.193server3datanode

3.配置hadoop用户

useradd hadoop passwd hadoop

4.三台机子之间相互完成免密配对

ssh-copy-id server1 ssh-copy-id server2 ssh-copy-id server3

说明:记得在hadoop用户下完成免密配对,在hadoop用户下,配对的是对方的hadoop用户间的免密

1.3.2完成nfs共享目录的配对

说明:将server1的hadoop软件共享给server2和server3

1.安装nfs软件,并启动服务

yum install -y nfs-utils systemctl start nfs

2.编辑server1的exports文件

vim /etc/exports exportfs -rv #刷新

说明:允许所有外机访问server1的/home/hadoop

3.server2,server3远程挂载server1的/home/hadoop用户

mount 192.168.7.191:/home/hadoop /home/hadoop

1.3.3启动节点

1.节点初始化

cd hadoop bin/hdfs namenode -format

2.编辑etc/hadoop/core-site.xml文件

cd hadoop vim etc/hadoop/core-site.xml #编辑配置文件

3.编辑etc/hadoop/hdfs-site.xml文件

cd hadoop vim etc/hadoop/hdfs-site.xml #编辑配置文件

说明:现在集群中存在两个数据节点,可以备两份。当然,并不是说,所有节点都必须备一份,只是你的备份数要小于等于集群中的数据节点的数量

4.编辑 etc/hadoop/workers 文件

cd hadoop vim etc/hadoop/workers #编辑配置文件

说明:该节点定义,存储数据的节点

5.启动节点集群

sbin/start-dfs.sh

6.查看集群节点

1.3.4扩展集群节点

1.新准备一台CentOS 7虚拟机

2.完成域名解析

192.168.7.191server1namenode
192.168.7.192server2datanode
192.168.7.193server3datanode

3.完成nfs配置

yum install -y nfs-utils mount server1:/home/hadoop /home/hadoop

说明:nfs是热启动,挂载时会自动启动

4.编辑 etc/hadoop/workers 文件

cd hadoop vim etc/hadoop/workers #编辑配置文件

5.在server4中启动nodemanager和datanode节点

bin/hdfs --daemon start nodemanager bin/hdfs --daemon start datanode jps #查看集群节点

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询