发布时间:2026/8/19 16:39:26
大数据三大组件 (Hadoop, Hive, Spark) 之 Spark Local 模式安装配置 前言本文是大数据三大组件安装系列的第三篇最终篇将介绍如何在已搭建好 Hadoop Hive 的基础上安装Spark 2.4.0并与 Hive 数仓集成。安装完成后可以通过 Spark SQL 直接查询 Hive 中的数据并支持通过 JDBC 远程连接。本系列所需安装包百度网盘下载提取码me15前置条件请确保已完成 Hadoop 伪分布式 和 Hive 远程模式 的安装。⚠️关于 Spark 版本本次使用的 Spark 是经过编译的版本已内置 Hive 支持可以直接操作 Hive 数仓。官方默认下载的 Spark 可能不包含 Hive 依赖需要自行编译或下载对应版本。环境与版本信息组件版本说明Spark2.4.0含 Hive 支持本次安装Hadoop3.1.3已安装第一篇Hive3.1.2已安装第二篇JDK1.8已安装第一篇一、验证 Spark 是否支持 Hive在安装之前先确认你使用的 Spark 版本是否已内置 Hive 支持。进入spark-shell命令窗口执行以下导入语句import org.apache.spark.sql.hive.HiveContext如果出现错误如下图说明当前 Spark 版本未编译 Hive 支持需要更换为包含 Hive 的编译版本如果导入成功如下图说明可以正常使用二、安装 Spark2.1 解压并配置目录将 Spark 安装包解压到/usr/local目录并重命名、设置权限# 进入下载目录 cd /home/hadoop/下载/ # 解压到 /usr/local需要输入当前用户的登录密码 sudo tar -zxf ~/下载/spark-2.1.0-bin-h27hive.tgz -C /usr/local # 重命名为 sparkwithhive cd /usr/local sudo mv ./spark-2.1.0-bin-h27hive ./sparkwithhive # 修改目录权限 sudo chown -R hadoop:hadoop ./sparkwithhive2.2 配置 spark-env.sh从模板文件创建配置文件并编辑cd /usr/local/sparkwithhive/ cp ./conf/spark-env.sh.template ./conf/spark-env.sh vim ./conf/spark-env.sh在文件中添加 JDK 和 Hadoop 的路径配置根据你的实际安装路径调整export JAVA_HOME/usr/lib/jvm/jdk1.8.0_162 export HADOOP_HOME/usr/local/hadoop export HADOOP_CONF_DIR/usr/local/hadoop/etc/hadoop2.3 验证 Spark 安装运行 Spark 内置的 Pi 计算示例验证安装是否成功cd /usr/local/sparkwithhive bin/run-example SparkPi 21 | grep Pi is如果输出类似Pi is roughly 3.14...的结果说明 Spark 安装成功三、Spark 与 Hive 集成验证进入spark-shell测试是否能正确访问 Hive 中的数据库cd /usr/local/sparkwithhive bin/spark-shell在 Spark Shell 中执行spark.sql(show databases).show()如果能正确列出 Hive 中的数据库说明 Spark 与 Hive 集成成功四、配置 Spark SQL 远程连接如果希望通过 JDBC 客户端如 DataGrip、DBeaver、Navicat 等远程连接 Spark SQL需要启动 Spark Thrift Server。4.1 启动服务需要按照以下顺序依次启动# 第一步启动 Hadoop HDFS cd /usr/local/hadoop ./sbin/start-dfs.sh # 第二步启动 Hive Metastore 服务 hive --service metastore # 第三步启动 Spark Thrift Server替代 HiveServer2 cd /usr/local/sparkwithhive sbin/start-thriftserver.sh4.2 验证端口确认 Thrift Server 已在 10000 端口监听netstat -ntulp | grep 100004.3 Beeline 测试连接使用 Spark 自带的 Beeline 客户端测试连接用户名和密码可留空直接回车cd /usr/local/sparkwithhive/bin ./beeline !connect jdbc:hive2://localhost:100004.4 配置 Hive 允许 Spark Thrift Server 连接如果遇到连接权限问题需要在 Hadoop 的core-site.xml中添加代理用户配置然后重启 Hadoop 服务4.5 使用 JDBC 工具连接在 DataGrip 等工具中创建 Hive 类型的数据源连接信息如下配置项值JDBC URLjdbc:hive2://localhost:10000用户名留空或填写系统用户名密码留空驱动Hive JDBC Driver总结至此大数据三大组件 (Hadoop, Hive, Spark) 之 Spark Local 模式配置安装全部完成整个系列的核心要点回顾篇目组件核心内容链接第一篇Hadoop 3.1.3JDK 安装、HDFS 伪分布式配置查看第二篇Hive 3.1.2MySQL 元数据库、HiveServer2 远程连接查看第三篇Spark 2.4.0Spark 与 Hive 集成、Thrift Server 远程连接本文提示如果希望让他人通过外网访问你搭建的大数据平台可以通过内网穿透将相关端口如 9870、10000 等映射出去具体方法可参考 利用阿里云搭建内网穿透服务。如果在搭建过程中遇到任何问题欢迎在评论区留言交流

相关新闻

2026/8/19 16:39:26

python --PDF转Word

在当今信息时代,PDF和Word文档是工作中常用的文档格式。转换PDF为Word可以帮助我们更灵活地编辑和分享文档内容。在本文中,我们将探讨使用Python实现将PDF文件转换为Word文档的四种方法,介绍每种方法的代码示例、易错点以及解决方法,旨在帮助读者顺利完成这一转换任务。 1…

2026/8/19 19:16:06

代码与传统思维结合前的核对清单

代码与传统思维结合前的核对清单 在古老哲学哲学视角中,凡事发生大变动前,必先观其边界、验其动静、理其秩序。古人视盲目变动为大忌;映射到软件工程与算法系统大版本升级上,道理完全一致。 无论是更换底层大模型基座、升级深度学…

2026/8/19 19:16:06

深度学习并发增加后先守住哪些边界

深度学习并发增加后先守住哪些边界 在很多高并发生产场景(如推荐系统 CTR 预估、实时风控模型、广告 CTR 计算)中,虽然 PyTorch 在训练端大红大紫,但 TensorFlow(特别是 C API 嵌入或 TF-Serving 部署模式)…

2026/8/19 19:11:05

智能命令行工具灰度发布,先验证什么

智能命令行工具灰度发布,先验证什么 灰度不是把请求悄悄交给 Agent。我的小实验只允许它读取一份脱敏的 Markdown,输出候选标签;写文件和联网都关掉。先用十条固定样例比较人工标签与建议结果,重点看它会不会把“待确认”误判成“…

2026/8/19 4:14:28

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/19 15:09:57

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/19 0:00:35

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/8/19 0:00:35

AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

1. 项目概述:当AI开始“猜”数学定理 最近在AI研究圈里,一个名为“Moonshine”的项目引起了不小的讨论。这名字本身就挺有意思,直译是“月光”,但在数学史上,它特指一个神秘而美丽的联系——魔群月光猜想,连…

2026/8/19 0:00:36

Agentic Web:构建智能体原生网络的基础设施挑战与四大支柱

1. 从“被动网络”到“能动网络”:一个正在发生的范式转移 如果你最近关注AI和Web技术的前沿动态,可能会频繁听到“Agentic Web”这个词。它不像“Web3”那样带着浓厚的金融色彩,也不像“元宇宙”那样充满科幻感,但它所描绘的未来…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/19 4:14:38

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/19 16:39:34

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…