【免费下载链接】ai-infra-engineer-learning
AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)
ai-infra-engineer-learning 开源课程中的 mod-105 数据管道模块,系统讲解如何用Apache Airflow 编排工作流、Apache Spark 做批处理、Apache Kafka 做流式处理,手把手带你搭建一套可复用的生产级 ML 数据管道。无论你是刚入门的数据工程师,还是想补齐 ML 基础设施短板的算法工程师,这份实战指南都能在约 45 小时内帮你打通"数据入湖 → 质量校验 → 特征加工 → 模型训练触发"的完整链路。
为什么 ML 数据管道需要这三件套?
数据是 ML 模型的地基,而手动准备数据根本无法规模化。业界头部公司(Uber、Airbnb、Spotify 等)都在大量使用 Airflow + Spark 的组合来支撑推荐、定价、反欺诈等模型。🏭
| 组件 | 角色定位 | 解决的核心问题 |
|---|---|---|
| Apache Airflow | 工作流编排引擎 | 任务调度、依赖管理、失败重试、可视化监控 |
| Apache Spark | 分布式批处理引擎 | 单机内存装不下的 TB 级数据清洗与特征工程 |
| Apache Kafka | 分布式流式平台 | 毫秒级实时事件摄入与实时特征计算 |
三者的分工非常清晰:**Airflow 是"大脑"**负责编排,**Spark 是"肌肉"**负责重体力活,**Kafka 是"神经"**负责实时信号传输。
快速开始:克隆课程仓库并定位数据管道模块
git clone https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning克隆完成后,直接打开模块总览:mod-105 数据管道模块 README。该模块预估总投入约 45 小时(12 小时课程 + 20 小时实战项目 + 13 小时阅读练习),技术栈版本为 Airflow 2.7+、Spark 3.4+(PySpark)、Kafka 3.5+。
学习路线图:8节课 + 6个实验 + 12个练习
先建立全局认知,再分步深入,这是本模块的学习节奏:🗺️
- 架构设计:01-data-pipeline-architecture.md —— 理解 ML 管道的六个阶段(数据源 → 摄入 → 校验 → 转换 → 特征工程 → 训练),区分批处理与流式两种架构
- Airflow 基础:02-apache-airflow-fundamentals.md —— 掌握 Web Server、Scheduler、元数据库、Executor 四大组件,写出第一个 DAG
- Airflow 进阶:03-advanced-airflow-ml.md —— TaskFlow API、XCom 传递、条件分支、ML 专用 Operator
- 数据版本化:04-data-versioning-dvc.md —— 用 DVC 像管理代码一样管理数据集
- Spark 批处理:05-data-processing-spark.md —— Driver/Executor 架构、DataFrame API、K8s 上运行 Spark
- Kafka 流式:06-streaming-data-kafka.md —— Topic、分区、生产者/消费者、实时特征工程
- 数据质量:07-data-quality-validation.md —— Great Expectations 校验、Schema 漂移检测
- 监控与容错:08-pipeline-monitoring-errors.md —— 告警、重试、死信队列、SLA 监控
配套动手资源:
- 🧪实验:labs/ 目录下 6 个 lab,从本地 Airflow 到 Spark 作业、Kafka 流式事件
- 🏋️练习:exercises/ 目录下 12 个循序渐进的练习,含进阶挑战
- ✏️自测:quizzes/module-quiz.md 共 25 题,80% 及格
第一步:用 Airflow 编排你的第一条 ML 管道
Airflow 是 ML 基础设施中使用最广泛的工作流引擎——Airbnb 运营 1000+ DAG,Spotify 超过 5000 个。🚀
本地 30 分钟跑起来:跟随 lab-01-airflow-local.md,用 docker-compose 一键拉起 scheduler + webserver + worker + Postgres,打开http://localhost:8080即可看到调度界面。
写出生产级 DAG:exercise-02-airflow-fundamentals/README.md 要求你用 TaskFlow API 构建一个完整的模型训练 DAG,覆盖 6 个关键生产要素:
- ✅ 数据质量驱动的条件分支(达标才部署)
- ✅ 指数退避重试与 4 小时SLA告警
- ✅动态任务映射实现特征工程并行
- ✅ **传感器(Sensor)**等待上游 S3 数据落盘
掌握这些惯用法后,你写出的管道才经得起团队协作和长期维护。
第二步:用 Spark 处理单机装不下的训练数据
当数据量超过单机内存,pandas 就会"罢工",这时 Spark 的分布式能力就是最优解:内存处理比 MapReduce 快约 100 倍,且能从笔记本平滑扩展到千节点集群。⚡
跟着 lab 走一遍完整流程:lab-03-spark-job.md 以纽约出租车数据集为例,体验"读 Parquet → 按日期聚合 → 写出分区 Parquet"的标准批处理模式。
性能调优实战:exercise-05-spark-batch-processing/README.md 要求处理 1-10 GB 的真实数据集,并重点掌握两个"省钱省时"的关键技巧:
- 广播 Join vs Shuffle Join:小维度表用广播,避免昂贵的数据 shuffle
- 分区与桶化写出:按日期分区 + 按用户分桶,让下游查询飞快
第三步:用 Kafka 打通实时数据链路
批处理管道跑在 6 小时一个周期?反欺诈场景根本等不起。Kafka 正是为此而生:百万级消息/秒吞吐、亚毫秒延迟、持久化副本保障故障恢复。🌊
最小可用环境:lab-04-kafka-streaming.md 用 KRaft 模式(无需 ZooKeeper)在本地跑起 Kafka,创建 3 分区 Topic,并用 Python 生产/消费消息,亲眼观察分区行为。
进阶到生产级实时特征管道:exercise-03-streaming-pipeline-kafka/README.md 是一个完整的电商反欺诈场景——构建 <100ms 延迟的实时特征工程管道,实现 exactly-once 语义、乱序事件水位线处理,以及在线推理的毫秒级特征服务,彻底解决"训练-服务特征不一致"(train/serve skew)这一经典痛点。
第四步:质量校验 + 监控告警 + 端到端项目
生产管道 = 编排 + 计算 + 流式 +质量门禁+可观测性,缺一不可。🛡️
- 数据质量:学习用 Great Expectations 定义列存在性、空值、取值范围等断言,把质量检查做成管道的"守门员"
- 监控容错:为管道配置指标、日志、告警三支柱,学会用死信队列和熔断器优雅处理失败
最后,把全部技能合龙到 project-102-mlops-pipeline:一个覆盖"数据摄入 → DVC 版本化 → 自动训练 → MLflow 实验跟踪 → 模型注册 → 持续部署"的端到端 MLOps 项目。其中 training_pipeline.py 展示了训练 DAG 如何根据评估指标自动把模型晋升到 Staging/Production,并触发下游部署管道——这正是"数据管道"与"模型运维"的交汇点。
学习建议:如何高效完成本模块
| 阶段 | 建议路径 | 预计耗时 |
|---|---|---|
| 入门 | lab-01(Airflow 本地)→ lab-03(Spark 作业)→ lab-04(Kafka 流式) | 3-4 小时 |
| 进阶 | exercise-02(Airflow DAG)→ exercise-05(Spark 调优) | 6-8 小时 |
| 精通 | exercise-03(Kafka 实时特征)+ project-102(端到端 MLOps) | 30+ 小时 |
💡三条实操建议:
- 每个 lab 都完整敲一遍命令,不要只读文档——管道的感觉是"跑"出来的
- 用 module-quiz 的 25 题自测,80 分以下建议回看对应课时
- 需要更多学习资源时查阅 resources.md,内含 Airflow、Spark、Kafka、DVC 的官方文档索引
完成 mod-105 后,你的技能画像将直接对标 Data Engineer 与 ML Infrastructure Engineer 岗位需求,也能为后续 MLOps(mod-106)和 GPU 计算(mod-107)模块打下坚实基础。🎯
【免费下载链接】ai-infra-engineer-learning
AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)
相关推荐
ML应用的Docker镜像瘦身术:ai-infra-engineer-learning中的多阶段构建、BuildKit与GPU容器实战
ML应用的Docker镜像瘦身术:ai infra engineer learning中的多阶段构建、BuildKit与GPU容器实战 如果你正在学习 AI 基
从零开始构建LLM数据管道:data-engineer-handbook的完整实践指南
从零开始构建LLM数据管道:data engineer handbook的完整实践指南 data engineer handbook是一个全面的开源资源库,旨在
数据工程文档教程dlt REST API Source:用 dltHub AI Harness 构建生产级 REST API 数据管道
dlt REST API Source:用 dltHub AI Harness 构建生产级 REST API 数据管道 本篇指南聚焦于 rest api pip
数据工程数据集成批处理
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考