一句话点题:不是每个人都要造轮子。先学会"用"别人的模型,再学会"改"别人的模型,最后才考虑自己"训"模型。别一上来就想从头训练大模型,那是亿万富翁的游戏。
写在前面
前面三章我们聊了AI的历史、概念和边界,都是"认知层面"的东西。从这章开始,我们要往"实践层面"过渡了。
但动手之前,有一个最关键的问题没解决:作为开发者,你到底该走哪条路?
同样是"做AI开发",不同路线的门槛、成本、能力要求天差地别。选错路线,要么白白烧钱,要么事倍功半。
这章帮你把三条路彻底讲清楚,看完你就知道该走哪条。
一、三条路分别是啥
先上一张全景对比,心里有个数:
| 路线A:调用API | 路线B:微调/部署开源模型 | 路线C:从头训练模型 | |
|---|---|---|---|
| 干什么 | 调别人现成的模型API | 拿开源模型改一改自己部署 | 从零开始训练一个模型 |
| 比方 | 去饭店点菜 | 买半成品回来自己加工 | 自己种菜养牛从头做 |
| 门槛 | 低 | 中 | 极高 |
| 成本 | 按量付费,几厘到几毛一次 | 一次性买显卡/租云GPU | 几十万到几千万 |
| 需要什么能力 | 会写代码调接口 | 懂模型部署、Linux运维 | 懂算法、有算力集群、有大量数据 |
| 适合谁 | 90%的开发者 | 有特定需求的中高级团队 | 大厂/AI公司/研究院 |
| 典型代表 | 调OpenAI/通义/文心API | 部署LLaMA/Qwen+LoRA微调 | 从头预训练GPT/Qwen |
下面逐条展开。
二、路线A:调用API——“去饭店点菜”
1. 这条路在干什么
你不需要关心模型怎么训练的、跑在什么显卡上、用了什么架构。你只需要:
- 注册一个账号,拿到API Key
- 看文档,按格式发HTTP请求
- 拿到返回结果,集成到你的系统里
就这样。跟你调任何第三方接口(比如微信支付、地图API)没有任何本质区别。
2. 主流API提供商
| 提供商 | 代表模型 | 特点 | 价格水平 |
|---|---|---|---|
| OpenAI | GPT-4o / GPT-4o mini | 能力天花板,生态最全 | 贵(但mini版便宜) |
| Anthropic | Claude 3.5 Sonnet | 长文本、代码能力强 | 中等偏贵 |
| Gemini 1.5 Pro | 多模态、超长上下文 | 中等 | |
| 阿里通义 | Qwen-Max / Qwen-Plus | 中文能力强,国内首选 | 便宜 |
| 百度文心 | ERNIE 4.0 / Speed | 国内生态完善 | 便宜 |
| 深度求索 | DeepSeek-V3 | 性价比极高,能力接近GPT-4 | 极便宜 |
| 月之暗面 | Kimi | 超长上下文(200万字) | 便宜 |
| 智谱 | GLM-4 | 开源+API双线,企业友好 | 便宜 |
选型建议:
- 海外项目/对能力要求最高 → GPT-4o 或 Claude
- 国内项目/对成本敏感 → DeepSeek-V3 或 Qwen
- 需要超长文档处理 → Kimi(200万字上下文)
- 需要极高性价比 → DeepSeek-V3(几乎是目前最便宜的第一梯队模型)
3. 这条路的优点
| 优点 | 说明 |
|---|---|
| 上手快 | 会写代码就行,半小时跑通第一个Demo |
| 零运维 | 不用管服务器、显卡、部署、扩容 |
| 随时用最新模型 | 厂商升级了模型,你自动享受 |
| 效果有保障 | 顶级模型的能力已经非常强 |
| 成本可控 | 按调用量付费,不用的时候不花钱 |
4. 这条路的缺点
| 缺点 | 说明 | 应对策略 |
|---|---|---|
| 数据隐私 | 数据要发给厂商 | 选私有化部署方案/国内合规厂商/签数据处理协议 |
| 依赖第三方 | API挂了你的系统也挂 | 多模型备用+降级策略 |
| 定制性差 | 模型是黑盒,你改不了内部 | 用Prompt工程+RAG弥补 |
| 长期成本 | 量大了一月几万到几十万 | 缓存+模型路由(简单问题用便宜模型) |
| 网络限制 | 国内调海外API有合规和延迟问题 | 用国内厂商API或Azure代理 |
5. 什么时候选这条路
绝大多数场景都应该先走这条路。理由很简单:
- 试错成本最低
- 上线速度最快
- 能快速验证"AI到底能不能解决我的业务问题"
先跑通,再优化。别一上来就想着自己部署模型,等你把环境搭好、模型调通,人家的API方案已经上线三个月了。
6. 一个最小可运行示例
用Python调通义千问API,就这么几行:
importrequests url="https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions"headers={"Authorization":"Bearer sk-your-api-key-here","Content-Type":"application/json"}data={"model":"qwen-plus","messages":[{"role":"user","content":"用一句话解释什么是机器学习"}]}response=requests.post(url,headers=headers,json=data)result=response.json()print(result["choices"][0]["message"]["content"])就这么简单。你不需要懂Transformer、不需要懂反向传播、不需要有GPU。会调API就能开始做AI应用。
三、路线B:微调+部署开源模型——“买半成品回来加工”
1. 这条路在干什么
你从Hugging Face或ModelScope下载一个开源模型(比如Qwen-7B),然后:
- 直接部署:模型够用,不改,直接部署到自己服务器上用
- 微调(Fine-tuning):用你的业务数据"再训练"一下,让模型在特定任务上表现更好
- 量化压缩:把模型缩小,让普通显卡也能跑
2. 为什么不直接用API,要自己部署?
这个问题是核心。以下场景才值得考虑自己部署:
| 场景 | 为什么API搞不定 | 自己部署的价值 |
|---|---|---|
| 数据合规 | 金融/医疗/政务数据不能出内网 | 数据留在自己的服务器上 |
| 延迟敏感 | API网络延迟不稳定 | 内网部署延迟<100ms |
| 成本极限 | 调用量极大,API费用扛不住 | 一次性投入,边际成本趋近于零 |
| 定制需求 | API模型不懂你的专业领域 | 微调后效果更好 |
| 离线场景 | 没有网络的环境 | 本地部署不依赖网络 |
关键判断:如果你的场景以上五条都不沾,那就老老实实用API,别折腾。
3. 主流开源模型一览
| 模型 | 参数量 | 特点 | 适合场景 |
|---|---|---|---|
| Qwen2.5 | 0.5B~72B | 中文最强开源模型,全尺寸覆盖 | 国内项目首选 |
| LLaMA 3 | 8B/70B | Meta出品,英文生态最好 | 海外项目/研究 |
| DeepSeek-V3 | 671B(MoE) | 性价比之王,推理能力极强 | 通用任务/推理场景 |
| ChatGLM | 6B/9B | 清华系,中文友好,部署轻量 | 中小团队/资源有限 |
| Mistral | 7B/8x7B | 欧洲团队,效率高 | 英文场景/边缘部署 |
| Yi | 6B/34B | 李开复团队,综合能力强 | 通用任务 |
新手建议:从Qwen2.5-7B开始。中文好、社区活跃、文档全、LoRA微调方案成熟,是最稳妥的入门选择。
4. 部署方案怎么选
| 方案 | 工具 | 特点 | 适合场景 |
|---|---|---|---|
| 快速体验 | Ollama | 一行命令装好,傻瓜式 | 本地开发/测试 |
| 生产部署 | vLLM | 高吞吐、支持并发、PagedAttention | 生产环境首选 |
| 轻量部署 | llama.cpp | CPU也能跑,极致量化 | 没有GPU的机器 |
| 容器化 | Docker + vLLM | 标准化部署,方便运维 | 企业级部署 |
| 云端托管 | ModelScope/SiliconFlow | 不想自己管服务器 | 快速上线/中小项目 |
生产环境推荐组合:vLLM + Docker + GPU服务器。vLLM是目前开源大模型推理引擎的事实标准,吞吐量远超原生Transformers。
5. 微调方案怎么选
微调不是"重新训练",而是在已有模型基础上"小幅调整"。
| 方案 | 原理 | 显存需求 | 效果 | 适合场景 |
|---|---|---|---|---|
| LoRA | 冻结原模型,只训练一个小的"补丁" | 低(7B模型约8GB) | 好 | 最主流的微调方案 |
| QLoRA | LoRA + 4bit量化 | 极低(7B模型约4GB) | 略降 | 显卡不够用时的选择 |
| 全量微调 | 所有参数都训练 | 极高(7B模型约60GB) | 最好 | 有A100/H100的土豪团队 |
| 不微调 | 只用Prompt+RAG | 不需要 | 大部分场景够用 | 优先尝试这个 |
重要认知:90%的情况下,你不微调也能解决问题。先试Prompt工程,再试RAG,最后才考虑微调。这个顺序后面章节会反复强调。
6. 硬件需求参考
| 模型大小 | 推理显存(量化后) | 微调显存(LoRA) | 推荐显卡 |
|---|---|---|---|
| 1.5B | ~2GB | ~6GB | 任意显卡/Mac M芯片 |
| 7B | ~5GB(INT4) | ~8GB | RTX 3090/4090/A10 |
| 14B | ~10GB(INT4) | ~16GB | A10/A30/双3090 |
| 32B | ~20GB(INT4) | ~40GB | A100 40G |
| 72B | ~40GB(INT4) | ~120GB | 多卡A100/H100 |
Mac用户好消息:M1/M2/M3/M4芯片的统一内存架构天然适合跑大模型。一台32GB的MacBook Pro就能流畅跑7B模型,64GB的Mac Studio能跑32B。Ollama对Apple Silicon优化很好。
四、路线C:从头训练模型——“自己种菜养牛”
1. 这条路在干什么
不是微调,是从零开始训练一个模型。包括:
- 预训练(Pre-training):用海量文本让模型学语言基础——这一步最贵
- 指令微调(SFT):教模型按指令回答问题
- 人类反馈强化学习(RLHF):让模型回答更符合人类偏好
2. 你大概率不需要走这条路
直接给数据:
| 阶段 | 数据量 | 算力 | 成本估算 |
|---|---|---|---|
| 预训练一个7B模型 | ~1万亿Token | 几百张A100跑几周 | 约50万-200万人民币 |
| 预训练一个70B模型 | ~10万亿Token | 上千张H100跑几个月 | 约5000万-2亿人民币 |
| GPT-4级别训练 | 不公开 | 不公开 | 估计>1亿美元 |
这不是普通公司能干的事。全球有能力从头预训练大模型的组织不超过50家。
3. 什么人该走这条路
| 角色 | 是否该走 | 原因 |
|---|---|---|
| 应用开发者 | 不该 | 用API或开源模型就够了 |
| 企业AI团队 | 不该 | 微调开源模型性价比远超从头训 |
| AI创业公司 | 极少该 | 除非你的核心壁垒就是模型本身 |
| 大厂AI实验室 | 可以 | 有钱有卡有数据有人才 |
| 学术研究者 | 看情况 | 研究算法本身可以,做应用不需要 |
4. 如果真要训练,需要什么
| 维度 | 要求 |
|---|---|
| 数据 | 万亿Token级别的高质量文本 |
| 算力 | 至少几百张A100/H100 |
| 团队 | 分布式训练工程师 + 数据工程团队 + 算法研究员 |
| 时间 | 几周到几个月 |
| 资金 | 几百万到几亿人民币 |
| 运维 | 训练中途GPU挂了怎么办?检查点恢复机制 |
| 评估 | 训练完怎么知道好不好?需要完善的评测体系 |
说实话,99.9%的读者不需要走这条路。我把它列出来是为了让你知道这条路存在,并且理解为什么不该走——知道边界在哪,才能做出正确决策。
五、三条路对比总结
| 维度 | 路线A:API调用 | 路线B:微调+部署 | 路线C:从头训练 |
|---|---|---|---|
| 上手难度 | ★☆☆☆☆ | ★★★☆☆ | ★★★★★ |
| 初期成本 | 几乎为零 | 买/租GPU几千到几万 | 几百万起步 |
| 长期成本 | 按量付费,量大则贵 | 一次性投入,边际成本低 | 天文数字 |
| 上线速度 | 几天到几周 | 几周到几个月 | 半年到几年 |
| 定制能力 | 低(Prompt+RAG弥补) | 中高(可微调) | 最高(完全自主) |
| 数据安全 | 数据要出系统 | 数据在自己服务器 | 数据在自己服务器 |
| 运维负担 | 零 | 中等(要管服务器) | 极高(训练+部署+监控) |
| 适合团队规模 | 1-5人 | 3-15人 | 50人+ |
| 适合阶段 | 验证期/MVP | 成长期/规模化 | 基础研究/平台级 |
六、我的推荐路线图
对大多数开发者,我推荐这个渐进式路线:
第一步:先走路线A(1-4周)
选一个API → 跑通Demo → 集成到业务 → 上线MVP目标:用最低成本验证"AI能不能解决你的业务问题"。能解决,继续往下走;不能解决,止损退出,损失最小。
第二步:在路线A上做深度优化(1-3个月)
优化Prompt → 加RAG知识库 → 加缓存降低成本 → 加多模型路由目标:在API方案上把效果和成本优化到极致。很多人在这一步就解决了问题,不需要往下走。
第三步:评估是否需要路线B(1-2周评估)
问自己三个问题:
- API方案的效果是否已经无法满足业务需求?
- 调用量是否大到API费用已经成为负担?
- 是否有数据合规要求必须私有化部署?
三个都"是"→ 进入路线B
有任何一个"否"→ 留在路线A,继续优化
第四步:走路线B(1-3个月)
选开源模型 → 本地部署跑通 → 评估效果 → 需要微调则微调 → 上线目标:在保证效果的前提下,实现私有化部署或成本优化。
第五步:路线C?
别想了。除非你拿了几个亿融资,否则这条路不是给你走的。
七、不同角色的路线建议
| 你的角色 | 推荐路线 | 学习重点 |
|---|---|---|
| 后端开发者 | A → B | API集成、RAG架构、Spring AI |
| 前端开发者 | A | API调用、流式输出、AI交互设计 |
| 数据工程师 | A → B | 数据Pipeline、向量化、RAG数据处理 |
| 算法工程师 | B → C | 模型微调、训练优化、评估方法 |
| 产品经理 | A | AI能力边界、Prompt设计、产品架构 |
| 创业者/技术负责人 | A → B | 技术选型、成本估算、团队搭建 |
八、一个成本估算的真实案例
假设你要做一个"企业内部知识库问答系统",有10万条内部文档,日均5000次问答:
方案A:纯API
| 项目 | 月成本 |
|---|---|
| API调用(5000次/天 × 30天 × ~2000 Token/次 × 0.001元/千Token) | ~300元 |
| 向量数据库(云托管) | ~200元 |
| 服务器(API中转+业务逻辑) | ~500元 |
| 合计 | ~1000元/月 |
方案B:自部署开源模型
| 项目 | 一次性成本 | 月成本 |
|---|---|---|
| GPU服务器(A10 × 1) | 0(租赁) | ~2000元 |
| 向量数据库(自建) | 0 | ~300元 |
| 微调数据标注 | ~5000元 | 0 |
| 运维人力 | 0 | ~5000元(分摊) |
| 合计 | ~5000元 | ~7300元/月 |
分析
- 日均5000次问答的量,API方案每月只要1000元,远低于自部署
- 自部署的月成本是API的7倍,还有一次性投入和运维负担
- 只有当日均调用量达到5万次以上,或者有数据合规硬性要求时,自部署才在经济上划算
这就是为什么我反复说:先走API路线,量大再考虑自部署。
第1阶段总结
这四章构成了"认知启蒙"阶段的完整闭环:
| 章节 | 核心认知 |
|---|---|
| 第1章 AI发展简史 | AI不是新东西,70年沉淀,条件成熟才爆发 |
| 第2章 AI/ML/DL的关系 | 三者是包含关系,大模型是DL的一个应用 |
| 第3章 AI能力边界 | 知道AI不能干什么比能干什么更重要 |
| 第4章 三条路线选择 | 先API → 再自部署 → 最后才考虑从头训练 |
如果你认真读完了这四章,你已经比80%的"AI焦虑者"清醒了。你知道了AI是什么、能干什么不能干什么、作为开发者该从哪里入手。
接下来,第2阶段我们进入"机器学习基础",开始真正理解AI背后的原理。别担心,还是大白话,不会有让你头疼的数学公式——该讲的地方讲,不该深挖的地方绝不装学术。
下一章预告:第5章(第2阶段第1章)「监督学习:给标准答案让机器学」—— 从一个"判断垃圾邮件"的小例子开始,带你理解什么是特征、什么是模型、什么是训练。10行代码跑通你的第一个机器学习程序。