☰
浙大阿里提出RetireOPD:让AI学生自己决定何时毕业
2026/9/28 19:51:08 网站建设 项目流程

RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

作者:Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen
核心发表机构:Zhejiang University、Alibaba Group
论文链接:arXiv:2609.20784v1
发布于:arXiv 预印本(cs.CL)

|—😐—😐
| RetireOPD (Ours) | 60 | 92.2 |
| w/o Alignment Stagnation | 50 | 89.0 |
| w/o Relative Competence | 100 | 89.0 |
| w/o Retirement | – | 82.8 |
| w/o OPD (GRPO-only) | 0 | 75.0 |

结论清晰:全程保留 OPD 只有 82.8%,而完整方法达 92.2%,说明及时移除教师监督对后续优化至关重要;单独使用 alignment progress(第 50 步退休)或单独使用 relative competence(第 100 步退休)都只达到 89.0%,两者结合达到最佳,说明“差异停滞”与“能力达标”两个判据互补——前者缺位会导致较早切换,后者缺位会导致过晚切换,而两种偏差都带来约 3 个百分点的损失。此外,从退休点继续训练的对照实验进一步佐证了机制:比较“继续联合优化”“切换回 OPD”“移除 OPD 仅用 GRPO”三种策略后,只有第三种能让成功率从退休点的 76.6% 稳步提升至 93.8%;继续联合优化会进入平台并伴随师生差异持续扩大,而切回更强教师对齐则会压缩甚至损害任务性能。

自适应退休 vs 线性退火。与 ATOD 的对照显示,线性退火在训练早期提升迅速,但后期趋于平台;自适应准则则持续改进。这一结果支持论文的核心论点:教师效用并不按预定义时间表衰减,用训练动态确定过渡阶段,既能保留早期指导,又能避免后期约束。

退休阈值敏感性。论文在 3B 设置下扫描了能力阈值γ \gammaγ与有符号相对停滞阈值δ \deltaδ。完整方法(γ = 0.9 , δ = 0 \gamma=0.9,\delta=0γ=0.9,δ=0)在第 60 步退休、成功率 92.2;γ = 0.8 \gamma=0.8γ=0.8在第 55 步退休、90.6;γ = 1.0 \gamma=1.0γ=1.0在第 95 步退休、91.4;δ = 0.03 \delta=0.03δ=0.03在第 65 步退休、89.1;δ = 0.05 \delta=0.05δ=0.05在第 95 步退休、91.4。更宽范围的扫描表明,对于γ ∈ [ 0.80 , 0.96 ] \gamma\in[0.80,0.96]γ∈[0.80,0.96]与δ ∈ [ − 0.10 , 0.04 ] \delta\in[-0.10,0.04]δ∈[−0.10,0.04],退休步数保持在默认设置± 5 \pm 5±5步以内,只有在相对极端的阈值下才会出现明显延迟。综合来看,阈值变化把过渡点从第 55 步推到第 95 步,而成功率始终落在 89.1%–92.2% 区间,且性能并不随过渡步数单调变化——这说明方法不依赖精细调参或某一个精确的切换点。需要说明:“Adaptive Retirement vs. Linear Annealing”一节的正文结论在所提供的源码片段中未完整给出,此处仅基于图中可确证的“线性退火后期平台、自适应持续改进”这一趋势进行描述。

)

五、相关工作 / Related Work

RLVR 与稀疏监督。以 GRPO 为代表的 RLVR 范式依托可验证结果奖励训练智能体,但每条轨迹只有一个标量奖励,信用分配粗粒度。RetireOPD 保留了 RLVR 的奖励信号作为主驱动,只是在其之上叠加一层可控的密集监督,并在适当时机撤回这层监督。

On-Policy Distillation 与 OPSD。OPD 让学生在自身采样分布上接受更强教师的 token 级反馈;OPSD 在没有更强外部教师时,把同一模型条件于特权信息后作为教师,蒸馏到无条件分支。智能体任务中的特权信息通常是检索或事后(hindsight)技能。已有方法让教师与学生共享同一策略、仅在上下文上分叉,并通过 gating、同步或 advantage shaping 在 token 粒度上控制教师信号。RetireOPD 的关键差异在于:蒸馏之前用环境奖励单独训练教师,使教师与学生解耦,避免“技能分支从未被训练去使用技能”的失效模式。

蒸馏与 RL 的混合方法。已有混合方案包括退火蒸馏权重、在预定步数从蒸馏切换到 RL、扩展暴露给学生的轨迹视野、在衰减预算下撤回 in-context 技能、以及顺序执行蒸馏与 RL 等。它们的共同点是 transition 在训练前就被固定。更细粒度的在线决策只存在于局部层面,例如仅对整条 rollout 失败的 prompt 施加蒸馏,或按 token 门控教师信号,但没有任何方法真正移除教师。RetireOPD 的差异是:从师生差异与学生相对能力出发在线决定全局 transition,并最终彻底移除教师,此后仅用 GRPO 训练。

与教师退火调度的区别。ATOD 一类方法用预定义线性退火表控制蒸馏权重,其隐含假设是教师效用随时间线性衰减。RetireOPD 的代之以数据驱动的判据,实验显示这一区别在后期性能上有可观差距。

六、局限性与展望 / Limitations & Future Work

需要明确说明的是,所提供的源码片段中并未出现独立的 Limitations 章节,也未给出作者对局限性的正式声明,因此以下内容是基于片段可确证信息的整理,以及片段未覆盖项的标注,不构成对作者观点的推测。

其一,理论分析的适用条件较窄。附录的一阶分析忽略有限样本噪声、假设 GRPO clipping 在局部不激活,并且“退出优于联合”的结论需要步长η \etaη足够小。这意味着该分析刻画的是局部行为,不能保证在训练早期的强随机性与大更新下仍然成立——这也正是方法需要额外引入能力门槛γ \gammaγ来防止过早退出的原因。

其二,方法的成本结构未被充分讨论。RetireOPD 需要一个完整的 Phase 1 教师训练阶段,教师与学生同规模,且教师监督期间每次更新都需要一次额外的教师前向传播;片段未给出教师训练步数、总体计算开销相对基线的倍数,也未讨论技能检索质量(SkillBank 与 Keyword Matching)对结果的敏感性。这些属于片段未覆盖项。

其三,超参与实现细节存在未明确之处。方法定义中出现了监控窗口W WW,实验实现只说明每H = 5 H=5H=5个 evaluation steps 评估一次退休准则,片段未清晰给出W WW的实际取值与两者的关系;δ \deltaδ的具体取值在不同片段中也有“未给出”与“默认δ = 0 \delta=0δ=0”的不同表述,需要以论文正文为准。

其四,对照实验存在信息缺口。“Adaptive Retirement vs. Linear Annealing”一节的正文与结论在片段中缺失,无法提取该对比的完整数值结论;训练动力学四类曲线(成功率、差异、熵、奖励)的具体数值同样未在片段中给出。

其五,可扩展性与泛化性有待检验。所有实验均在 Qwen2.5 系列 1.5B–7B 与 ALFWorld、WebShop 两个文本环境上完成,未涉及更大规模模型、多模态环境或需要更长交互视野的任务;“外部大教师 OPD 效果极差”这一现象虽被报告,但其成因(分布不匹配、能力差距过大抑或教师本身未适配任务格式)在片段中未做进一步分析,是有价值的后续研究方向。

七、总结 / Conclusion

RetireOPD 处理的是自蒸馏式智能体强化学习中两个被长期默认、却并不成立的假设。它先说清“哪个教师”的问题:特权信息本身不会自动产生可靠教师,只有用环境奖励显式训练 skill-conditioned 教师,才能把上下文中的信息优势转化为一致的行为优势,这一点在未优化分支 7B 模型仅 23.4% 成功率的反例中体现得尤为鲜明。它再说清“学多久”的问题:教师监督是阶段相关的临时脚手架,早期能消除 GRPO 的慢启动并突破纯 OPD 的低上限,后期却会与奖励驱动优化冲突,把学生封顶在教师水平附近。

对应的解法是解耦的教师构建加自适应退休。学生先在 GRPO 与 OPD 的联合目标下吸收技能,同时以窗口级统计量监控师生差异的相对变化ρ m ( K ) \rho_m^{(K)}ρm(K)​与相对能力η m \eta_mηm​;一旦差异停止缩小且学生成功率接近教师成功率的 90%,就永久移除教师,此后仅用 GRPO 继续训练。论文的局部一阶分析为这一判据提供了形式化依据:差异停滞意味着⟨ g , h ⟩ > 0 \langle g,h\rangle>0⟨g,h⟩>0的局部冲突或 OPD 信号枯竭,而在冲突成立时退出教师能获得更大的一阶回报提升。

实验上,RetireOPD 在 Qwen2.5-1.5B/3B/7B 与 ALFWorld、WebShop 上一致超过纯 RL、蒸馏、混合基线乃至其自身的 skill-conditioned teacher,ALFWorld 成功率相对 RL 基线提升 14.1%–18.8%,WebShop 准确率提升 11.8%–19.0%;消融则显示两个退休判据互补、阈值在较宽范围内稳定、且自适应退休优于预定义线性退火。一句话概括其洞察:教师的价值不在于被赋予了多少特权信息,而在于是否能被训练去使用它,以及是否知道何时该退场。

原文摘要:Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher’s success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.

PDF链接:https://arxiv.org/pdf/2609.20784v1

部分平台可能图片显示异常,请以我的博客内容为准

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询