目录
大模型训练过程
第一阶段:SFT监督微调(填鸭式学习,快速从0~60分)
第二阶段:RLHF基于人类反馈的强化学习(人做裁判,教会大模型什么是好的回答)
第三阶段:GRPO组相对策略优化(大模型自我进化)
总结:
扩展:同样格式的数据优先做RAG还是SFT监督微调?
大模型训练过程
现在,我们使用的大模型都具备了各种各样的能力,可以帮我们做各种事情,其实大模型的诞生和进化并非一蹴而就,而是一个循序渐进的过程。整个过程可以类比公司培养一名新员工:1)先手把手教标准答案 2)再让员工自主产出多个版本,领导做偏好打分排序 3)员工慢慢读懂领导喜好,面对全新任务也能产出高契合度结果。对应在大模型的训练中,也可以拆解成以下三个步骤监督微调(SFT,Supervised Fine-Tuning)、基于人类反馈的强化学习(RLHF,Reinforcement Learning from Human Feedback)、以及组相对策略优化(GRPO,Group Relative Policy Optimization)。
第一阶段:SFT监督微调(填鸭式学习,快速从0~60分)
简单理解:老师把标准答案写好,让模型模仿记忆,相当于填鸭式、死记硬背的学习模式。
一个刚出生的宝宝对世界一无所知。你问他"香蕉是什么?"他当然答不上来。于是你直接告诉他:"香蕉是芭蕉科芭蕉属的一种植物。"宝宝把这个答案背下来。下次你再问,他就能准确复述了。模型通过模仿这些标准答案,快速掌握行业知识和回答格式。这就像我们小学时每天背课文、记单词——虽然枯燥,但能让你在短时间内从0分提升到60分。
不过,SFT有一个明显的短板:它教给AI的是"标准答案",而不是"思考方法"。如果用户问了一个训练数据里没有的问题,AI就会手足无措。就像那个只会背"香蕉是什么"的宝宝,你突然问他"苹果是什么",他只能茫然地看着你。更关键的是,互联网上充斥着大量错误甚至有害的信息,如果AI只是机械地背诵,它可能会把谣言和偏见也一并学进去。
因此,在SFT阶段,数据的选择至关重要。我们倾向于让模型学习"通用型知识"(比如退货的整体流程),而不是"个性化细节"(比如今年双十一的具体活动规则)。因为个性化信息变化快、容易过时,还会让模型在面对不同用户时"答案打架"。
SFT 的优势是落地简单、成本可控,所以对于个人开发者、中小企业做垂直领域模型,监督微调是最常用的手段。但仅仅依靠 SFT,模型只能复刻已有答案,无法真正学会思考,想要模型具备创造力,就需要进入强化学习阶段。
第二阶段:RLHF基于人类反馈的强化学习(人做裁判,教会大模型什么是好的回答)
简单理解:模型自己生成多个候选答案,人类标注员只做打分、排序,告诉模型哪一个回答更好,而不是告诉它标准答案是什么。
想象一个职场场景:领导要教新员工做一件事。方法一,领导亲自把活干完,让员工照着抄——这很累,而且员工遇到新问题还是不会。方法二,领导说:"你先做,给我A、B、C、D四个版本,我来挑哪个最好。"
显然,方法二更轻松,也更能培养员工的创新能力。因为做"选择题"比做"简答题"容易得多——领导不需要知道完美答案是什么,只需要判断"哪个版本更符合我的口味"。
我们回到"香蕉是什么"的例子。这次不直接给答案,而是让AI自己生成四个选项:
A. 香蕉是一种酸水果
B. 香蕉是一种装饰品
C. 香蕉是一种猴子爱吃的水果
D. 香蕉是一种黄色的食物,猴子很爱吃
然后,人类标注员(早期OpenAI雇佣了大量肯尼亚员工来做这件事)对这些答案进行排序:D最好,C次之,A和B最差。这些排序数据被用来训练一个"奖励模型"(Reward Model)——它就像一个懂领导心思的老员工,能自动判断哪个答案更符合人类偏好。
接下来,AI每生成一个新答案,奖励模型就会给它打分。分数高的答案会被鼓励,分数低的则被抑制。通过成千上万轮这样的"试错-反馈"循环,AI逐渐学会了:人类喜欢详细、准确、有用的回答,而不是简短、跑题或错误的回答。
RLHF的妙处在于,它让AI拥有了"创新能力"。因为人类只告诉它"什么好、什么不好",而不是"标准答案是什么"。AI可以在探索中不断尝试新的表达方式,甚至创造出比训练数据更好的答案E——而人类发现后,会把E排到最前面,进一步鼓励它突破自我。
同时,奖励模型也是一道安全阀。如果AI在互联网上学到了有害信息,生成了一个危险的答案F,人类会把它排在最后。这样,AI就知道"这个方向是错的",从而避免输出有害内容。
不过,RLHF的代价也不小。它需要大量的人工标注数据,成本高昂。OpenAI早期为此雇佣了上万名肯尼亚标注员,每小时支付几美元。而且,人类标注员的主观偏好会不可避免地影响模型的价值观——这也是为什么不同公司的AI,回答风格会有所不同。
第三阶段:GRPO组相对策略优化(大模型自我进化)
简单理解:同一个问题,让模型一次性生成一组多个回答,让模型组内互相 PK,依靠规则或者模型自身能力自动判断好坏,自动计算奖励,不再需要单独训练一个独立奖励模型。
RLHF虽然强大,但它始终离不开"人类老师"。GRPO的核心思想可以用一句话概括:"三人行,必有我师。"让模型针对同一道题生成多组不同的答案,然后自己组内PK,看谁的答案更好。
这与RLHF最大的区别在于:RLHF需要额外训练一个"奖励老师"(Reward Model),而GRPO让模型自己当裁判。虽然机器裁判不一定像人类那么精准,但它已经达到了"有方向、能迭代"的水平。更重要的是,它大幅降低了训练成本,让中小团队也能玩转强化学习。
总结:
如果把AI训练比作培养一个学生,三种方法恰好对应了三个成长阶段:
对于个人开发者或中小企业来说,SFT仍然是最务实的选择——准备几百条高质量QA数据,就能让模型快速掌握特定领域的知识。而RLHF和GRPO则更适合有充足算力的大厂,用于打磨模型的"情商"和"智商"。
值得一提的是,这三种方法并非互斥,而是层层递进的关系。ChatGPT和DeepSeek-R1的成功,正是建立在"SFT打底 + RLHF/GRPO拔高"的组合拳之上。先有知识,再有偏好,最后实现自我进化——这才是AI从"背书机器"蜕变为"创新天才"的完整路径。
下一次当你向ChatGPT提问时,不妨想想:这个看似轻松的回答背后,其实经历了无数次的"背诵、打分、自我PK"。AI的聪明,从来不是天生的,而是被"训练"出来的。
训练方法 | 核心思想 | 类比场景 | 优点 | 缺点 | 适用场景 |
SFT | 背标准答案 | 老师手把手教 | 快速上手 | 缺乏创新 | 行业知识灌输 |
RLHF | 人类打分排序 | 领导选最佳方案 | 偏好对齐 | 标注成本高 | 通用对话模型 |
GRPO | 组内自我PK | 学生组队刷题 | 无需人工奖励模型 | 探索随机 | 数学推理 |
扩展:同样格式的数据优先做RAG还是SFT监督微调?
当你手里有一份问答对数据,是该直接做 RAG,还是先做 SFT 模型微调?我的建议是:优先 RAG,RAG 搞不定再考虑微调。
原因很简单:RAG 是白盒。用户提问后,你可以一步步拆解——query 改写是否准确、检索到的知识切片对不对、相关度系数是否合理。哪里不对修哪里,可以针对单条 bad case 精准优化,是一个可科学迭代的工程化流程。
而 SFT 是黑盒。你把数据灌进去训练出一个新模型,内部全是数学公式。一旦回答跑偏,你根本没法扒开看问题出在哪,不可观测、不可调优,只能干瞪眼。
所以实践路径很清晰:先用 RAG 搭建知识库,每天分析数据、持续调优;只有当 RAG 的天花板确实摸到了,再上 SFT 作为兜底。白盒先行,黑盒兜底,才是落地 AI 应用的理性选择。