【免费下载链接】ai-infra-engineer-learning
AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)
ai-infra-engineer-learning是一套面向生产环境的 AI 基础设施工程师学习课程,其中第 10 模块专门讲解LLM 基础设施:如何用vLLM 生产部署开源大模型、如何构建RAG 检索增强生成系统、如何把整套平台跑在 Kubernetes GPU 集群上。对于 2-4 年经验的工程师来说,这是整套课程里离"高薪岗位"最近的一个模块。
一、为什么 vLLM+RAG 是 LLM 基础设施的"刚需组合" 💡
企业落地大模型时,几乎都会遇到三个问题:
| 痛点 | vLLM 怎么解决 | RAG 怎么解决 |
|---|---|---|
| 调用 API 太贵、数据出不了内网 | 自托管推理,吞吐量比传统方式高 10-20 倍 | 企业私有知识直接入库,无需微调 |
| 答案"一本正经地胡说" | — | 回答基于检索到的真实文档,可溯源 |
| GPU 资源利用率低、成本高 | PagedAttention 显存管理 + 连续批处理 | 向量库检索只花几毫秒,成本可控 |
简单来说:vLLM 管"算得快",RAG 管"答得准",两者组合就是生产级 LLM 服务的标准形态。
二、模块学习地图:8 课 + 8 实验 + 14 练习 🗺️
模块入口在 mod-110 模块总览,建议按 4-5 周节奏学习:
| 周次 | 主题 | 核心内容 |
|---|---|---|
| 第 1 周 | 基础与部署 | vLLM 部署教程:PagedAttention、OpenAI 兼容 API |
| 第 2 周 | RAG 与向量库 | RAG 系统教程、向量数据库(Qdrant/Weaviate/Chroma) |
| 第 3 周 | 微调与优化 | 微调基础设施(LoRA/QLoRA)、推理优化(量化、Flash Attention) |
| 第 4 周 | 平台与生产 | 平台架构、生产最佳实践(高可用、灰度、安全) |
前置要求:Docker、Kubernetes、Prometheus/Grafana 三块基础(对应课程模块 103、104、108),以及一块 ≥12GB 显存的 GPU 做实验。
三、vLLM 生产部署:最快上手路径 🚀
模块里最实用的 hands-on 材料是实验 Lab 01: 用 vLLM 部署 LLM(75 分钟),流程只有四步:
- 拉镜像起容器:一条 Docker 命令启动 vLLM 的 OpenAI 兼容服务(
vllm/vllm-openai镜像 +--gpus all); - 验证服务:请求
/v1/models确认模型上线; - 发一条对话:用 OpenAI 客户端指向
localhost:8000/v1即可,业务代码几乎零改动; - 跑吞吐基准:对比 HuggingFace 原生推理,同并发下 vLLM 通常快 5-10 倍,差异直观可见。
想深入原理的同学可以看 02-vllm-deployment.md,里面用图示解释了两大核心机制:
- PagedAttention:像操作系统分页一样管理 KV 缓存显存,几乎零浪费,能塞下更大批处理;
- 连续批处理:请求完成即腾出位置、新请求随时加入,GPU 利用率可达 60-90%。
再往上走,是 36-44 小时的综合练习 Exercise 01: 生产级 LLM 服务平台——业务背景很真实:把每月 15 万美元的 API 账单降到 5 万美元以下,同时满足数据不出内网的合规要求。
四、RAG 系统:让大模型的回答"有据可查" 🔍
RAG 的完整链路在 03-rag-systems.md 中拆解得很清楚,本质是两条流水线:
- 离线索引:文档 → 解析 → 分块 → 生成向量 → 写入向量库;
- 在线查询:用户提问 → 向量化 → 相似度检索 Top-K → (可选重排)→ 拼装进 Prompt → vLLM 生成"有出处"的回答。
配套实验可以按顺序做:
| 实验 | 学到什么 |
|---|---|
| Lab 02: RAG 管道 | 端到端搭一条可问答的 RAG 链路 |
| Lab 03: Qdrant 向量库 | 向量数据库部署、索引与查询调优 |
| Lab 07: Prompt 注入防护 | RAG 场景下常见的安全坑 |
完整的实战题目是 Exercise 02: 生产 RAG 系统,包含文档摄取、检索质量评估等生产细节;如果检索精度不够,模块还提供了混合检索与重排的进阶练习。
五、Kubernetes + GPU:生产部署的地基 🏗️
课程配套的完整项目模板在 project-103-llm-deployment(约 50 小时,高难度),架构是:FastAPI 网关 → RAG 系统 / 直连生成 → vLLM 引擎(GPU)→ Prometheus 监控。
其中 Kubernetes 相关配置最值得直接抄作业:
- gpu-node-pool.yaml:GPU 节点池规划;
- hpa.yaml:基于自定义指标的 LLM Pod 自动扩缩;
- llm-deployment.yaml:显存资源请求与 GPU 调度。
项目文档(架构、RAG 设计、部署指南)帮你理解每个组件"为什么这么配"。
六、成本与监控:LLM 基础设施的"隐藏价值" 💰
很多人忽略的一点:LLM 服务是烧钱的,会看账单才算真的会运维。课程把这一点做成了显性内容:
- 成本结构拆解见 COST.md:GPU 算力 $0.5-4/小时,推理按 token 计费,给出三档规模的月度估算;
- 省钱三板斧:模型量化(显存省 30%+)、批量推理(吞吐 3-5 倍)、Spot 实例 + 闲时缩到零;
- 监控直接给了现成配置:Prometheus 告警规则 + Grafana LLM 面板,覆盖延迟、token 用量、GPU 利用率和每千次请求成本;
- 还有一个专门的实验 Lab 06: 成本监控,教你给推理服务接上"计价器"。
七、学习建议与成功标准 ✅
学习顺序建议:
- 先读 模块 README 确认前置知识;
- 按 Lab 01 → Lab 02/03 的顺序把 vLLM 和 RAG 各跑通一遍;
- 再挑战 Exercise 01/02 两个综合练习;
- 最后对照 project-103 的项目清单,把 K8s 部署和监控补齐。
学完你应该能做到(即课程定义的验收标准):
- 部署一个带监控和自动扩缩的生产 LLM API;
- 搭建能准确检索、回答"有据可查"的 RAG 系统;
- 用量化 + 批处理把推理成本降低 50% 以上;
- 设计多模型 LLM 平台架构,并做出"自建 vs 买 API"的成本决策。
对应岗位:AI 基础设施工程师(LLM 方向)、生成式 AI MLOps 工程师、AI 平台工程师——正是当下市场上溢价最高的一类角色。💪
【免费下载链接】ai-infra-engineer-learning
AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience)
相关推荐
AI基础设施工程师第一课:用ai-infra-engineer-learning打好ML基础设施的地基(新手友好)
AI基础设施工程师第一课:用ai infra engineer learning打好ML基础设施的地基(新手友好) 📖 本文带你走进开源课程 ai infra
什么是 ai-infra-engineer-learning:成为年薪 $120K+ AI 基础设施工程师的完整开源学习路线
什么是 ai infra engineer learning:成为年薪 $120K+ AI 基础设施工程师的完整开源学习路线 ai infra engineer
ai-infra-engineer-learning学习规划:12周攻克500+小时AI基础设施课程的时间表与路线图
ai infra engineer learning学习规划:12周攻克500+小时AI基础设施课程的时间表与路线图 ai infra engineer lea
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考