Data Engineering Zoomcamp:Windows 上安装 Spark 4.x 与 PySpark 完整指南

发布时间:2026/9/12 0:59:23

Data Engineering Zoomcamp:Windows 上安装 Spark 4.x 与 PySpark 完整指南 Data Engineering ZoomcampWindows 上安装 Spark 4.x 与 PySpark 完整指南【免费下载链接】data-engineering-zoomcampData Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. Join the course here 项目地址: https://gitcode.com/GitHub_Trending/da/data-engineering-zoomcamp本指南以 Data Engineering Zoomcamp 第 6 模块Batch Processing的官方 Windows 安装文档为骨架完整讲解在 Windows 10/11 上从零搭建 Spark 4.x 与 PySpark 开发环境的每一步安装 Java 17、配置JAVA_HOME、用uv或pip安装 PySpark、清理旧版SPARK_HOME环境变量并通过一个小型测试脚本验证 SparkSession 能否正常启动。读完本文你将获得一个可运行的本地 Spark 环境并了解如何在此基础上跟进模块 6 的批量处理实战出租车数据分析、Spark SQL、连接 GCS 等。适用范围与前提本文面向 Windows 用户官方在 Windows 10 和 Windows 11 上完成过验证其他 Windows 版本理论上也可用。核心前提与约定如下命令行环境使用MINGW / Git Bash而非 CMD 或 PowerShell。文档中的所有命令wget、unzip、export等都基于 Git Bash 的 POSIX 风格路径如/c/tools/编写。如果你使用的是WSLWindows Subsystem for Linux请直接跳转到 Linux 安装指南在 WSL 内部按 Linux 方式安装即可无需在 Windows 侧重复配置。本文面向的是Spark 4.x与 Data Engineering Zoomcamp 2026 期第 6 模块06-batch/README.md所要求的环境一致。第一步安装 Java 17Spark 4.x 要求Java 17。官方推荐使用 AdoptiumEclipse Temurin的 JDK 17 发行版通过wget直接下载 zip 包并用unzip解压wget https://github.com/adoptium/temurin17-binaries/releases/download/jdk-17.0.18%2B8/OpenJDK17U-jdk_x64_windows_hotspot_17.0.18_8.zip unzip OpenJDK17U-jdk_x64_windows_hotspot_17.0.18_8.zip -d /c/tools/解压完成后JDK 的完整路径为/c/tools/jdk-17.0.188。注意下载文件名中%2B是 URL 编码的解压后的目录名带真实的号配置环境变量时必须写为/c/tools/jdk-17.0.188。配置 JAVA_HOME 与 PATH在 Git Bash 中把 Java 配置到环境变量里。为了让每次打开终端都生效请将下面两行追加到你的~/.bashrcexport JAVA_HOME/c/tools/jdk-17.0.188 export PATH${JAVA_HOME}/bin:${PATH}JAVA_HOME指向 JDK 根目录PySpark 及后续可能的 Hadoop/YARN 集成都会读取它将${JAVA_HOME}/bin前置到PATH确保java、javac命令优先使用新装的 JDK 17。保存后执行source ~/.bashrc或重开终端然后验证 Java 是否工作java --version预期输出类似openjdk 17.0.18 2026-01-20 LTS OpenJDK Runtime Environment Temurin-17.0.188 (build 17.0.188-LTS) OpenJDK 64-Bit Server VM Temurin-17.0.188 (build 17.0.188-LTS, mixed mode, sharing)只要java --version能输出17.x版本信息Java 环境即就绪。如果系统里同时装有多个 JDK请确认which java指向的确实是刚配置的路径。第二步安装 PySpark官方推荐使用 uv 管理 Python 包uv 同时也是本仓库其他模块如scripts/、07-streaming/workshop/中的pyproject.toml与uv.lock采用的依赖管理工具与项目生态保持一致。在项目目录内初始化并添加pysparkuv init uv add pyspark之后统一用uv run执行脚本由 uv 自动保证依赖环境就绪uv run python your_script.py如果你更习惯传统方式也可以直接用pippip install pyspark关键点PySpark 自带完整 Spark 发行版无论采用uv还是pip安装的都是PySpark 4.x 官方 wheel 包其中已捆绑完整的 Spark 运行时——安装完成后无需再单独下载 Spark 或 Hadoop 发行版这是与旧版 Spark 3.x 时代最大的差异。必须清理旧的 SPARK_HOME如果你之前装过 Spark 3.x并在~/.bashrc中设置了SPARK_HOME例如指向C:/tools/spark-3.3.2-bin-hadoop3必须删除该行原因PySpark 4.x 捆绑了自己的 Spark不再需要SPARK_HOME。如果旧变量仍然生效PySpark 4.x 会去加载旧版本 Spark 的 JAR 包导致启动失败或行为异常。清理方法编辑~/.bashrc删除或注释掉export SPARK_HOME...那一行重新source ~/.bashrc后确认echo ${SPARK_HOME}该命令应输出空行变量未设置。同理如果旧环境里还设置了指向旧 Spark 的PATH条目也一并清理。第三步验证安装创建一个测试脚本test_spark.py内容如下import pyspark from pyspark.sql import SparkSession spark SparkSession.builder \ .master(local[*]) \ .appName(test) \ .getOrCreate() print(fSpark version: {spark.version}) df spark.range(10) df.show() spark.stop()脚本要点.master(local[*])以本地模式启动 Spark*表示使用本机全部可用 CPU 核心——这是单机学习、验证 API 的常用方式.appName(test)为应用命名便于在 Spark UI默认http://localhost:4040中识别spark.range(10)生成一个包含 0~9 的分布式 DataFrameshow()用于打印结果是最快的冒烟测试手段spark.stop()显式关闭 SparkSession释放资源。运行测试uv run python test_spark.py如果输出中包含Spark version: 4.x.y以及0到9的数字表格说明环境搭建成功。两个常见的无害提示Windows 防火墙弹窗首次运行时 Spark 会在本机启动 JVM 网络服务Windows 防火墙可能弹出允许访问的提示选择允许即可这是本地回环通信不是外联。WARNING: Using incubator modules: jdk.incubator.vector这是 Java 17 加载 Spark 依赖的孵化模块时打印的提示可以安全忽略不影响功能。在仓库中的后续实践从验证到真正的批量处理环境就绪后可以立即进入 Data Engineering Zoomcamp 第 6 模块的实战内容06-batch/README.md。README 中建议在本地设置不顺利时可考虑 Google Colab 作为备选但仍建议优先花时间把本地环境跑通——本地环境是后续 Spark SQL、DataFrame 练习的基础。第 6 模块的核心实践路径包括准备出租车数据集使用 download_data.sh 下载纽约出租车yellow/green按月划分的 CSV 压缩数据脚本按TAXI_TYPE、YEAR、MONTH组织目录结构例如./download_data.sh yellow 2021会下载 2021 年 1~12 月的数据到data/raw/yellow/2021/下Spark SQL 与 DataFrame仓库 code/ 目录下提供了04_pyspark.ipynb、06_spark_sql.ipynb及对应的 06_spark_sql.py、07_groupby_join.ipynb、08_rdds.ipynb等随堂 notebook覆盖 DataFrame 基础、Spark SQL、groupBy/join、RDD 等主题连接云存储09_spark_gcs.ipynb与 cloud.md 演示 Spark 连接 Google Cloud StorageGCS的方法进阶YARN 与 Hadoop如需体验集群模式hadoop-yarn.md 讲解了伪分布式 YARN 的搭建、通过--master yarn提交作业以及用 GCS 连接器core-site.xml、spark-defaults.conf打通 SparkYARN 与 GCS 的完整链路。跨平台对照同一套流程在不同系统上的差异本文的 Windows 流程并非孤例仓库中为每个主流平台都准备了对应的安装指南三者在整体步骤上完全同构装 Java → 配JAVA_HOME→ 装 PySpark → 测试差异仅在 Java 的获取方式与 Shell 配置文件步骤Windows本文Linux / WSLmacOS安装指南windows.mdlinux.mdmacos.mdJava 版本1717 或 2117Java 来源Adoptium Temurin JDK 17zip 手动解压包管理器sudo apt install default-jdkHomebrewbrew install openjdk17环境变量写入~/.bashrc~/.bashrc或~/.zshrc~/.zshrc或~/.bash_profileJAVA_HOME示例/c/tools/jdk-17.0.188由readlink -f $(which java)推导$(brew --prefix openjdk17)PySpark 安装uv add pyspark/pip install pyspark相同相同三份文档对 PySpark 的结论一致PySpark 4.x 捆绑完整 Spark 发行版无需单独下载 SparkmacOS 与 Windows 文档都特别提醒清理旧版SPARK_HOME以免 PySpark 4.x 加载旧 JAR 而失败。这套流程的设计意图是让学员把精力集中在 Spark 本身DataFrame、SQL、集群与云集成而不是被繁琐的二进制安装细节消耗。小结在 Windows 上搭建 Spark 4.x 的核心可以浓缩为四步用 Adoptium JDK 17 配好JAVA_HOME→ 用uv或pip安装捆绑了完整 Spark 的pyspark包 → 清掉旧版SPARK_HOME→ 用spark.range(10).show()冒烟测试。完成这四步后你的 Windows 机器就拥有了一个可立即用于 Data Engineering Zoomcamp 第 6 模块全部练习的本地 Spark 环境可以放心进入出租车数据的批量处理实战。【免费下载链接】data-engineering-zoomcampData Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. Join the course here 项目地址: https://gitcode.com/GitHub_Trending/da/data-engineering-zoomcamp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/12 0:54:22

西门子S7-1200 PLC智能停车场系统开发实践

1. 项目概述作为一名工业自动化领域的工程师,我最近完成了一个基于西门子S7-1200 PLC的智能停车场车位控制系统项目。这个系统通过PLC控制实现了车位状态的实时监测、空位引导和收费管理等功能,大幅提升了停车场的运营效率。在传统停车场中,车…

2026/9/12 0:54:22

变步长LMS算法在信号去噪中的Matlab实现与参数调试

简介:面向信号处理相关课程学生与算法入门者的变步长LMS信号去噪Matlab仿真代码,用于改善经典LMS算法中固定步长带来的收敛速度与稳态误差冲突。包内共3个文件,包含1个m源文件与2张运行结果图片,压缩包整体仅63KB,轻量…

2026/9/12 1:59:29

Spring框架进阶:核心原理与生产实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 1:59:29

PyTorch语音情感识别实战:MFCC特征对齐与Bi-LSTM建模

简介:本资源是一份面向高校计算机、人工智能方向学生的课程设计实践项目,聚焦语音情感识别这一典型多模态AI任务,提供基于PyTorch的完整端到端实现方案。项目覆盖音频预处理(MFCC特征提取)、Bi-LSTM模型构建、训练/评估…

2026/9/12 1:59:29

贝叶斯优化加速LSTM超参调优:时序预测实战指南

简介:本资源是一份面向MATLAB初学者与时间序列建模进阶学习者的完整实践方案,聚焦贝叶斯优化与LSTM协同建模这一前沿技术组合,解决金融、电力、气象等场景中高精度时序预测难题。压缩包共5个文件(2个txt说明文档、2个核心m脚本、1…

2026/9/12 1:54:29

上海区县乡镇村SHP点位数据处理:坐标系校验与批量转换实战

简介:上海市县区乡镇村各级点位Shapefile数据包,专注于提供全市范围内区县、乡镇、村三级行政单位位置点信息,适用于GIS空间分析、区域对比、专题制图及智慧城市相关研究。面向地理信息开发人员、数据分析师及城市规划研究者,可快…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码