《f-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control》主要研究如何在大语言模型(LLM)的同策略蒸馏(OPD)中,同时兼顾异步执行的高吞吐与同策略优化的高保真度。以下是对其研究内容的全面总结概括:
一、研究背景与核心问题
同策略蒸馏(OPD)已成为 LLM 后训练的重要技术,它结合了同策略学习的探索能力与教师监督的稠密信号。标准 OPD 包含三个紧密耦合的过程:学生策略 rollout、教师监督评分、学生策略优化。
核心矛盾:
同步执行(理想同策略):训练保真度高,但系统利用率低,长时程任务中 rollout 与监督成本高昂。
异步执行(实际采用):通过流水线重叠提高吞吐,但引入陈旧性(staleness)——缓冲轨迹及其监督可能不再匹配当前学生策略,导致目标扭曲、优化不稳定、性能下降。
这构成了 OPD 中根本性的性能—效率权衡:异步提吞吐但损保真,同步保保真但牺牲吞吐。
二、理论分析:目标差异的双重分解
三、方法:f-OPD 框架
基于上述分解,作者提出f-OPD,包含三个互补的新鲜度感知控制机制:
1. 细粒度样本新鲜度评分
四、实验验证
任务设置
覆盖三个交互时程递增的任务族:
短时程推理:MATH500,Qwen2.5-Math-7B 学生 + 72B 教师
中时程工具使用:ReTool 风格代码解释器 harness,Qwen3-8B 学生 + Qwen3-Coder-30B 教师
长时程编码智能体:mini-SWE-agent + SWE-bench Verified,同上学生/教师
主要发现
1. 原始 OPD 失败分析
策略滞后增加(0→8)导致所有任务性能单调下降,编码任务在 lag=8 时下降约 40%。
Rollout 漂移与监督漂移均随 lag 和 horizon 增长,监督漂移增长更陡。
异步 OPD 熵动态随 lag 增大而变得不稳定,高 lag 下出现部分崩溃。
2. f-OPD 主要结果
在三个任务上,f-OPD 同时继承同步 OPD 的任务质量与异步 OPD 的大部分吞吐优势。
编码智能体任务(表 1):
同步 OPD:1.00× 吞吐,41.8 resolve
原始异步 OPD:1.61× 吞吐,但 resolve 崩溃至 26.8,崩溃率 3/5
f-OPD:1.46× 吞吐,39.4 resolve(94% 同步水平),补丁后回归仅 2.6 点,无崩溃
相比 SFT(高吞吐但依赖昂贵离线轨迹)、RL(同策略但低吞吐)、其他异步变体(硬刷新、仅 lag 加权),f-OPD 综合表现最优。
3. 消融研究
新鲜度加权:恢复大部分质量(+9.2 avg@4,+9.7 resolve),崩溃率降至 1/5。
Rollout 锚定正则化:进一步稳定(+2.4 avg@4,+1.6 resolve)。
自适应刷新:最终增益,完全消除崩溃。
三者针对互补轴,非冗余。
4. 补充分析
f-OPD 保持与同步训练相当的熵动态。
不同新鲜度设计下,f-OPD 在无效工具、重复循环、过早停止、修复后回归等失败率上均最低。
五、主要贡献
理论贡献:首次将异步 OPD 形式化为新鲜度失配下的优化,并证明目标差异可分解为 rollout 漂移与监督漂移。
方法贡献:提出样本级新鲜度分数与 f-OPD 框架,通过加权、正则化、自适应刷新三种机制实现新鲜度感知控制。
实验贡献:在推理、工具使用、编码智能体三类任务上验证,f-OPD 在保持同步级任务质量的同时获得接近异步的吞吐,首次实现 OPD 的性能—效率权衡。
实践意义:为大规模长时程智能体后训练提供了可行方案,并有望降低资源门槛,促进研究民主化。
六、局限与未来方向
实验覆盖的模型族与任务有限,结论的普适性需进一步验证。
监督漂移的贡献依赖于设置:在静态标注、固定教师、上下文不变的场景中可能接近零。
理论分析是正则性假设下的差异上界,而非收敛理论;新鲜度分数是校准代理而非精确估计。
未来方向:扩展到更大基础模型、更广泛的通用智能体任务、收紧理论边界、关联校准系数与队列统计。
这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
摘要
将同策略蒸馏(OPD)扩展至大语言模型(LLM)时面临一个根本性张力:异步执行对于系统效率是必要的,但它在结构上偏离了理想的同策略目标。为应对这一挑战,我们从理论上将目标差异分解为 rollout 漂移与监督漂移,分别刻画学生 rollout 与教师上下文中的陈旧性。在此基础上,我们引入样本级新鲜度分数,用于量化缓冲样本相对于同策略目标的可靠性。在该信号的引导下,我们进一步提出 f-OPD,一种新颖框架,能够自适应地调节陈旧样本的影响,并约束异步训练下累积的策略漂移。在交互时程不断增长的推理、工具使用与编码智能体任务中,f-OPD 始终能够取得与同步优化相当的任务性能,同时基本保留异步执行的吞吐优势。我们的结果建立了首个在 OPD 中实现性能—效率权衡的方案,为大规模长时程智能体后训练铺平了道路。
1 引言
近年来大语言模型(LLM)的飞跃不仅由预训练驱动,也日益受到后训练进展的推动。在过去几年中,监督微调(SFT)与强化学习(RL)等范式从根本上重塑了预训练模型的对齐、专业化与部署方式 [1-3]。最近,同策略蒸馏(OPD)通过将同策略学习与稠密监督统一起来,已成为一种强大技术,推动了前沿 LLM 的显著提升 [4-7]。
标准 OPD 流程由三个紧密耦合的过程组成:学生策略 rollout、对生成 token 进行评分的教师监督,以及学生策略优化。如图 1(a) 所示,原则上这些过程应同步执行,以便每个训练步骤都保持完全同策略。然而从经验上看,严格同步会导致系统利用率显著不足,尤其是在 rollout 与监督变得日益昂贵的长时程场景中。因此,现代 OPD 系统 [8-10] 广泛采用异步模式(图 1(b)),通过重叠流水线不同阶段并并行执行来提高吞吐。然而,这种效率收益以陈旧性为代价:缓冲轨迹及其相关监督在用于优化时可能不再匹配当前学生策略。这种新鲜度不匹配会扭曲有效的同策略目标,使优化不稳定,并最终降低任务性能。这在 OPD 中造成了一个根本性的性能—效率权衡:通过异步提高系统利用率往往会损害优化保真度,而保持同策略一致性则需要牺牲吞吐。
图 1:(a) 同步(上)与异步(下)执行下 OPD 的系统实现。异步 OPD 通过跨多个资源组(RG)流水线化计算提高了训练吞吐,但由此产生的新鲜度不匹配损害了训练保真度。(b) 推理、工具使用与编码智能体任务中的性能—效率权衡。点表示五个种子的均值与标准差。原始 OPD 执行难以同时平衡性能与效率,而 ff-OPD 通过新鲜度感知控制有效弥合了这一差距。
遗憾的是,异步执行在 OPD 中引入的这种新鲜度不匹配仍然鲜为人知,且在很大程度上未得到解决。一种直观的缓解方式是定期刷新回放缓冲区,防止陈旧 rollout 持续破坏策略更新。然而这种硬刷新带来了自身困境:刷新过于激进会丢弃潜在有用的学习信号,而刷新过于保守则会让陈旧优化累积。这种张力表明,陈旧性不应被视为缓冲区级别的二元(选取或丢弃)刷新触发器,而应在单个训练样本层面进行量化。陈旧性的一个自然在线代理是策略更新滞后,即样本生成以来经过的优化步数。然而仅靠滞后在 OPD 中并不充分:相同年龄的样本可能由于学生 rollout 策略与教师监督的异质漂移而表现出截然不同的失配。
在本文中,我们将 OPD 中的新鲜度失配表述为异步执行与其理想同策略对应物之间的目标差异。通过理论分析,我们表明这种差异由两个结构上不同的来源驱动:rollout 漂移,源于陈旧的策略占用;以及监督漂移,源于过时的教师条件。在此基础上,我们推导出样本级陈旧性的细粒度刻画,并引入新鲜度分数来量化每个样本对同策略目标的保真度。我们进一步提出 f-OPD,一种新鲜度感知框架,用于补偿目标差异,同时主动纠正由陈旧性引起的策略漂移。我们的主要贡献总结如下:
我们将异步 OPD 形式化为新鲜度失配下的优化,并从理论上刻画了由此产生的目标差异,其同时源于学生模型与教师模型。基于该分解,我们引入一种细粒度指标,用于跟踪样本级对同策略蒸馏目标的保真度。我们提出 f-OPD,一种新鲜度感知 OPD 框架,弥合了高效异步执行与理想同策略优化之间的差距。我们在包括推理、工具使用与编码智能体任务在内的多种任务上进行了全面实验,这些任务的交互时程逐渐增长,并证明 f-OPD 始终能够在任务质量与系统吞吐之间取得有利平衡。
2 相关工作
LLM 后训练与同策略蒸馏。后训练已成为激发 LLM 任务能力与交互推理的主要机制。现有范式表现出互补的权衡。SFT [11] 在固定数据集上优化前向 KL 目标,提供高度稳定的 token 级监督,但探索能力受限于训练分布之外。相比之下,RL [2, 3] 从自生成轨迹中学习,采用奖励驱动目标,能够实现更强的探索 [12-14],但代价是优化不稳定与潜在策略崩溃。OPD [15-18] 介于这两种范式之间,将同策略学习与分布级教师监督相结合,继承了 RL 的探索能力,同时保留了蒸馏的稠密、稳定学习信号。近期同策略自蒸馏 [19-22] 与在线教师监督变体 [23-29] 进一步展示了该范式在 LLM 后训练中的前景。尽管取得了这些更广泛的进展,一个核心挑战仍未解决:在保持同策略优化统计保真度的同时,实现大规模 OPD 训练所需的系统效率。
异步系统与新鲜度失配。异步学习系统被广泛采用,通过解耦数据收集与优化来提高利用率。异步强化学习系统 [30, 31] 已成为通过解耦经验收集与策略优化来扩展训练的标准范式,能够实现更高吞吐、更好资源利用率与大规模分布式执行。然而这种解耦也会在行动与学习在不一致策略状态下演化时导致陈旧轨迹。类似的陈旧性效应也出现在分布式优化与并行训练中 [32, 33]。在策略梯度方法中,这种失配已经可以通过 REINFORCE [34] 所依据的经典同策略/离策略张力来理解,并且它在现代 LLM-RL 中尤为明显,近期分析将训练崩溃直接归因于训练—推理失配 [35]。先前工作进一步表明,这种失配会在顺序 rollout 中累积,促使人们提出数据集聚合与信赖域优化等漂移控制原则 [36, 37, 2]。更近期的长时程 RL 工作通过研究显式信赖域掩码 [38],以及表明解耦 PPO 可以将用于控制更新幅度的近端策略与用于离策略校正的行为策略分离,从而更好地利用陈旧数据 [39],强化了这种联系。我们的设定将这一研究方向扩展到教师监督的 OPD,其中新鲜度失配同时源于陈旧的学生 rollout 与过时的教师监督。
3 理论分析
尽管新鲜度失配主要源于系统级异步性,但它可以作为目标级差异来分析。在本节中,我们形式化理想同策略蒸馏目标与异步流水线下优化目标之间的差距,并表明这种差异同时源于学生与教师。
3.1 不同 OPD 训练模式下的目标差异
3.2 异步目标差异的双重分解
3.3 跟踪陈旧性的诊断指标
尽管上述分解识别了陈旧性的来源,并形式化刻画了它们的贡献,但由此产生的漂移项在优化过程中无法直接观测。因此,我们引入样本级诊断指标,通过学生与教师模型的分布来经验性地跟踪它们。具体而言,对于 rollout 漂移,我们在缓冲前缀上使用 on-support 散度:
图 2:f-OPD 的系统概览。上:用于刻画陈旧性的三种样本级诊断指标。下:整体 f-OPD 流水线,其中样本新鲜度由这些诊断指标估计,并通过三种互补机制集成到 OPD 优化中。
4 长时程 OPD 的新鲜度感知控制
4.1 细粒度样本新鲜度评分
4.2 f-OPD
接下来,我们逐步推导带有新鲜度感知控制的 f-OPD,从原始样本级蒸馏损失开始:
图 3:策略更新滞后增加下原始 OPD 的失败模式。(a) 随滞后增加的任务性能相对退化。(b) 漂移诊断:左轴为 rollout 漂移,右轴为监督漂移,二者均随滞后增加而增大。(c) token 级熵动态,在三个任务上均匀平均,滞后为 0、2 和 8 时的训练过程。标记与曲线显示五个种子均值;误差棒与阴影带表示一个标准差。
5 实验
我们的实验突出了在长时程 OPD 训练中平衡性能与效率的挑战,并展示了所提出的 f-OPD 如何通过新鲜度感知控制有效应对这一权衡。
5.1 设置
我们从以下三个角度总结关键实验设置。
协议。我们遵循 Thinking Machines Lab [40] 引入的学生—教师蒸馏设置。对于跨任务模型选择,我们使用 Qwen 系列模型作为学生模型,在更大的 Qwen 教师模型的冻结监督下训练。训练在同步与异步流水线下进行。
任务分类。我们考虑三个交互时程递增的任务族:(i) 短时程推理,其中监督实际上是单次的;(ii) 中时程工具使用,其中中间动作影响后续观察与监督;(iii) 长时程编码智能体,其中错误会在迭代编辑与执行中累积。DAPO-Math-17K [41](约 17K 样本)被用作短时程推理与中时程工具使用的基础提示分布。在工具使用设置中,这些问题被包装在确定性 ReTool 风格代码解释器 harness [42] 中。对于长时程编码智能体任务,我们在真实仓库级软件工程任务上使用 mini-SWE-agent [43] 作为编码智能体 scaffold。
评估。我们在 MATH500 [44] 上评估短时程推理,在相同 harness 中执行的 1,000 道 held-out 奥林匹克风格问题集上评估工具使用,并在 SWE-bench
图 4:(a-c) 同步 OPD、异步 OPD 与 f-OPD 在各任务上的训练动态。(d) 跨任务相对训练吞吐。
表 1:在编码智能体任务 [45] 上 f-OPD 与代表性后训练方法的比较。相对吞吐归一化到同步 OPD。
Verified [45] 上评估编码智能体。对于短时程推理,我们报告 Avg@I 准确率。对于工具使用,我们报告 ReTool 风格 harness 下的 Avg@4 准确率,以及无效工具率(至少包含一次无效代码解释器调用的回合比例)与峰值—最终下降(从峰值到最终训练的性能下降)。对于编码智能体,我们报告单次运行、单补丁评估协议下的 SWE-bench Verified 解决率,以及重复循环、过早停止与补丁后回归率(补丁性能从峰值到最终训练的下降)。所有报告指标均为五个随机种子的平均值。
详细实验设置与额外实现细节见附录 B.1。
5.2 原始 OPD 的失败分析
在评估 f-OPD 的有效性之前,我们首先对原始 OPD 进行系统性失败分析。具体而言,我们研究两个问题:(i) 在 OPD 训练下,增加策略滞后如何影响任务性能?(ii) 在策略滞后增加下,哪些因素导致了这种退化?为回答这些问题,我们在三个任务上评估四种 OPD 变体,手动控制策略更新滞后为 0、2、4 和 8,涵盖从完全同策略优化到日益异步的条件。
如图 3(a) 所示,所有三个任务都随着策略滞后增加表现出明显且单调的性能退化,证实策略陈旧性本质上损害异步 OPD 保真度。此外,这种退化随着交互时程增长而显著加剧。特别是对于编码智能体任务,在滞后为 8 时性能下降约 40%。图 3(b) 进一步报告了基于 KL 的 rollout 与监督漂移诊断。两种漂移都随策略滞后与交互时程系统性增长,并且监督漂移随滞后的增长比 rollout 漂移更陡峭,突显了在长时程 OPD 中控制教师上下文陈旧性的重要性。有趣的是,图 3(c) 显示,与同步训练不同,异步 OPD 随着滞后增加表现出逐渐不稳定的任务平均熵动态。最高滞后设置(滞后 =8,红色)形成最宽的后期训练不确定性带,表明一些运行保持高熵探索,而另一些则走向部分崩溃。这表明异步执行下的策略漂移不仅放大了目标失配,还破坏了生成动态的稳定性,使熵成为训练不稳定的实用早期预警信号。
5.3 f-OPD 的主要结果
我们的主要结果分为两部分。我们首先在三个任务上将 f-OPD 与同步和异步 OPD 基线进行基准比较,衡量任务质量(评估准确率)
表 2:f-OPD 中三种新鲜度感知控制机制在工具使用与编码智能体任务上的消融结果。
以及相对系统吞吐(每小时完成的训练样本数,归一化到同步 OPD)。图 4 显示,f-OPD 同时继承了同步 OPD 的任务质量与异步 OPD 的大部分吞吐优势,在不付出同步执行全部吞吐成本的情况下恢复了原始异步模式牺牲的同策略保真度。此外,如附录图 5 所示,f-OPD 保持与同步训练相当的熵动态,展示了新鲜度感知控制带来的稳定性。
为在最严苛设置上评估 ff-OPD,我们在长时程编码智能体任务上将其与广泛的后训练方法进行比较:SFT、RL,以及两个采用简化新鲜度感知控制的异步 OPD 基线——一个对缓冲样本应用硬刷新,另一个仅通过策略更新滞后对样本新鲜度评分(详见附录 B.1)。我们复现的方法共享相同基础模型(Qwen3-8B)。结果报告在表 1 中。SFT 实现了最高吞吐,但受限于对高质量离线轨迹的依赖,而这些轨迹在长时程智能体设置中扩展成本高昂。RL 设计上是同策略的,但由于长尾 rollout 延迟而吞吐较低。同步 OPD 在同策略方法中取得了最强任务质量(41.8 解决率),但继承了同步执行的吞吐惩罚。原始异步 OPD 相比同步 OPD 带来 1.61× 吞吐增益,但任务质量崩溃至 26.8 解决率,跨运行崩溃率为 60%60%。简化新鲜度感知变体(硬刷新与仅滞后加权)仅部分缓解这种退化,仍远低于同步上限。相比之下,f-OPD 在保持 94% 同步解决率的同时获得 1.46× 吞吐增益,仅带来 2.6 个点的补丁后回归,且未观察到崩溃。这些结果使 f-OPD 成为一种弥合通用后训练范式与原始异步 OPD 变体所留下的性能—效率差距的方法。
5.4 消融研究
f-OPD 的有效性源于三种原则性机制的协同作用:新鲜度加权、rollout 锚定正则化与自适应刷新。为分离它们的个体贡献,我们在工具使用与编码智能体任务上,在原始异步 OPD 之上逐步添加每个组件(表 2)。具体而言,新鲜度加权恢复了大部分丢失的任务质量(+9.2 avg@4 准确率,+9.7 编码解决率),并将崩溃率降至 1/5,证实降低陈旧样本权重直接对抗 rollout 漂移。Rollout 锚定正则化通过稳定每次更新的漂移进一步缩小差距(+2.4 avg@4 准确率,+1.6 编码解决率),而自适应刷新带来最终增益并完全消除崩溃。这些结果表明,这三种机制针对的是新鲜度的互补轴,而非冗余轴。
6 结论
在本文中,我们系统分析了原始 OPD 在同步与异步执行下的性能—效率权衡。我们从学生 rollout 与教师上下文两方面识别了 OPD 中新鲜度失配的主要来源,并提出 f-OPD,通过新鲜度感知控制引导异步优化。其有效性在交互时程不同的任务上得到验证,在长时程编码智能体上增益最为显著。展望未来,我们旨在将 f-OPD 扩展到更大基础模型,以及更广泛的通用智能体任务。