摘要
本文解读 ACL 2026 长文《End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning》。该论文提出MHGPO(Multi-Agent Heterogeneous Group Policy Optimization),一个无 critic(critic-free)的多智能体强化学习算法,通过融合参数共享(parameter sharing)、反向奖励传播(backward reward propagation)与异构组优势估计(heterogeneous-group advantage estimation),让多智能体搜索系统里的每一个 LLM 智能体都朝着全局系统成功而不是各自的局部表现去优化,其特别之处在于把"组"的定义从 GRPO 的"同一 prompt 下的多条响应"扩展成"同一根问题下、中间决策不同的多条轨迹"。实验表明,在 HotpotQA 上端到端 MHGPO 把未优化三智能体系统的 F1 从21.45提升到50.86(2.4 倍),EM 达到37.62%,并在 2WikiMultihopQA 与 MuSiQue 两个域外数据集上给出最一致的增益,而显存占用与单步训练时间都低于 MAPPO。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning |
| 标题(中文) | 异构组策略优化:LLM 多智能体搜索系统的端到端强化学习 |
| 作者 | Guanzhong Chen, Shaoxiong Yang, Chao Li, Wei Liu, Jian Luan, Zenglin Xu |
| 机构 | 小米 MiLM Plus · 复旦大学 · 上海科学智能研究院 |
| 会议 | ACL 2026(Long Papers,pp. 30319–30338) |
| arXiv | arXiv:2506.02718 |
| 项目网站 | ACL Anthology 2026.acl-long.1399 |
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 三种 rollout 采样策略
- 分类全景
- 方法细节
- 实验设计与结果
- 消融实验
- 定性案例
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- MHGPO 和 GRPO 到底差在哪?
- 为什么去掉 critic 反而更稳?
- 组的规模应该取多大?
- 异构组带来的额外奖励方差是缺陷吗?
- 这套方法能直接搬到别的多智能体系统上吗?
- 训练过程中组内差异会不会消失?
- 参考链接
背景与动机
MHGPO 要解决的问题可以一句话概括:多智能体搜索系统很有效,但用强化学习训练它的代价太高——高在一个必须额外维护的 critic 上。
大语言模型有两个绕不过去的短板:知识有截止时间,单次推理也难以产出稳定可控的结果。工业界的常见解法是把检索增强生成(RAG)与多智能体系统(MAS)结合起来——让若干个角色化的 LLM 智能体各自持有搜索工具,通过结构化通信把高层目标拆成模块化的多上下文(multi-context)子任务,既降低单个模型的负担,也提升整个系统的可解释性。这条路线已经在多跳问答上反复验证过有效性。
问题出在"怎么让这些智能体真正学会配合"。提示工程和逐智能体的监督微调(SFT)能缓解一部分问题,但工程开销大、难以跟随需求演化,因此研究重心转向端到端的强化学习(RL)。在 LLM 智能体构成的多智能体系统里,这自然被表述成多智能体强化学习(MARL),可用的是 MAPPO 这一套:LLM 当 actor,再配一个同等规模的大 critic去估计联合动作价值。
MAPPO 的代价在论文里被点得很明白。第一,在多个异构智能体上近似联合动作价值本身就不稳定;第二,维护与更新一个完整 critic 会带来显著的显存与计算开销,让规模化变得困难。另一条路线是去掉 critic 的组相对优化(GOA),例如 GRPO——它用同一 prompt 下多条响应之间的相对奖励来估计优势,在单上下文场景里既省资源又稳定。但 GRPO 的假设很关键:组内所有响应共享同一个 prompt,比较发生在匹配的局部上下文里。多智能体系统打破的恰恰是这个前提——每个下游智能体的输入都由上游输出决定,组内成员根本不在同一个局部上下文里。
这正是 MHGPO 的切入点:保留 GRPO"不要 critic"的好处,同时重新定义"组"。
研究主线:从问题到结论
Mermaid 图 1:MHGPO 的研究主线——从"MAPPO 必须维护大 critic"这一痛点到"把比较组从同一 prompt 扩到同一根问题"的设计决策。
基准/方法设计
论文先用一个三智能体、极简但有效的多智能体搜索系统(MASS)作为研究对象,因为这样最容易把算法本身的差异隔离出来。
三个角色的分工是标准的检索问答流水线:Rewriter负责根据原始问题生成面向搜索引擎的检索查询;Reranker从召回的大量检索结果中筛选出真正相关的条目;Answerer把原始问题和筛选后的证据整合起来给出最终答案。这条链条的关键特征是:三个智能体不共享上下文——Reranker 只看到 Rewriter 输出的查询与检索结果,Answerer 只看到 Reranker 筛出的文档。
图 1:三智能体 MASS 的示意——Rewriter 把问题拆成子查询,Reranker 从检索文档中筛选相关片段,Answerer 融合原始问题与筛选结果生成最终答案
MHGPO 由四个部件拼成,可以用一组记号把它写清楚。设系统的 $n$ 个智能体共享同一个 LLM backbone,问题 $q$ 采样自数据集 $\mathcal{D}$。
参数共享是第一个简化:$n$ 个智能体($k\in{1,\ldots,n}$)由同一个LLM backbone 实例化并联合优化,于是多智能体学习被重铸为一个多任务学习问题,同时省掉了 $n$ 份参数与显存。
多智能体组 rollout 采样负责造出待比较的样本。对问题 $q$,让 MASS 协同生成 $G$ 条最终响应 ${o_i}{i=1}^{G}$;从输入 $q$ 到每条最终响应的中间步骤序列构成一条轨迹(trajectory)。采样过程中第 $k$ 个智能体共产生 $G_k$ 个输入-输出对 $(q{k,i},o_{k,i},m_{k,i})$,其中 $m_{k,i}$ 是组标识(group identifier),由具体的采样策略决定,后续用来决定这条 rollout 在哪个组里被归一化。
反向奖励传播负责把全局信号分给上游。MASS 生成最终响应后,奖励模型或预设规则给出共享奖励集合 ${R^{\text{shared}}i}{i=1}^{G}$;这些奖励从轨迹末端反向传播回上游智能体,并按直接后继聚合:
$$R^{\text{shared}}{k,i}=\mathrm{Aggr}\left({R{j,r}}_{j>k}\right)$$
其中 $(k,j)$ 称为间接依赖对:$j$ 是 $k$ 的下游消费者,$o_{j,r}$ 是 $j$ 在输入中包含 $o_{k,i}$ 的前提下生成的响应。默认的聚合算符 $\mathrm{Aggr}(\cdot)$ 是简单平均。三条智能体的链里,Answerer 相对金答案的 F1 就是终端共享奖励,它回传平均给 Reranker,再传给 Rewriter——即便智能体之间不共享上下文,上下游依赖也被显式暴露出来。
在传播之后,每条输出的最终奖励还要叠加角色专属奖励$R^{\text{spe}}_k(\cdot)$,也就是格式惩罚:
$$R_{k,i}=R^{\text{shared}}{k,i}+R^{\text{spe}}_k(q{k,i},o_{k,i})$$
异构组优势估计是核心。对第 $k$ 个智能体的第 $i$ 条 rollout,优势定义为在同一组标识 $m$ 内做归一化:
$$\hat{A}{k,i}=\frac{R{k,i}-\mathrm{mean}\left({R_{l,j}\mid m_{l,j}=m_{k,i}}\right)}{\mathrm{std}\left({R_{l,j}\mid m_{l,j}=m_{k,i}}\right)}$$
得到的标量优势会广播到该输出的全部 token,即 $A^t_{k,i}=A_{k,i}$。与单智能体 GRPO 的关键差异在于:一个组可以包含来自不同 prompt 的 rollout,这样的组被称为异构组。举个具体例子——同一个多跳问题下,Rewriter 可以问"出生地"也可以问"国籍",两条不同改写路径产生的下游 rollout 会落在同一个组里被比较。这种跨轨迹归一化正是论文所说的隐式跨轨迹相关(implicit cross-trajectory relations):优势信号不再只是"在固定上游前提下挑最好的局部动作",而是携带了全局协调信息。
最后是多任务聚合目标。参数共享下,MAS 的 RL 目标与 GRPO 形式一致,但需要把 $n$ 个智能体的损失聚合起来以支持协同优化:
$$\mathcal{J}{\text{MHGPO}}(\theta)=\mathbb{E}\Big[\frac{1}{n}\sum{k=1}^{n}\frac{1}{G_k}\sum_{i=1}^{G_k}\frac{1}{|o_{k,i}|}\sum_{t=1}^{|o_{k,i}|}\min\big(r^t_{k,i}\hat{A}^t_{k,i},\ \text{clip}(r^t_{k,i},1-\epsilon,1+\epsilon)\hat{A}^t_{k,i}\big)-\beta D_{\mathrm{KL}}(\pi_\theta|\pi_{\text{ref}})\Big]$$
其中重要性采样比为 $r^t_{k,i}=\pi_\theta(o^t_{k,i}\mid q_{k,i},o^{<t}{k,i})/\pi{\theta_{\text{old}}}(o^t_{k,i}\mid q_{k,i},o^{<t}_{k,i})$。有了这个目标,系统 rollout 阶段产生的全部内部输入-输出对都能被用来协同优化。
三种 rollout 采样策略
"怎么造组"是框架落地的关键,论文给出三个策略,并额外研究一个过采样变体。
IS(Independent Sampling,全同质)是最直白的基线:对每个问题,依次对每个智能体采 $1$–$G$ 的 rollout 组,沿用 GRPO 的相对优势形式。它只产生同质组,总共 $n\times G$ 个样本,组织成 $n$ 个独立的同质组。它的缺陷是效率低且目光短浅:冗余 rollout 很多,而且各智能体被独立优化,抓不到智能体之间的交互。
FoF(Fork-on-first,入口分叉)去掉冗余:每个问题只在入口智能体处采 $G$ 条 rollout,后续智能体一律一对一。于是入口智能体产生同质组,而每个下游智能体收到 $G$ 个由上游 rollout 诱导出的不同输入,天然形成异构组。整个 MASS 只需要 $nG$ 次 rollout,却能得到 $G$ 个系统级奖励信号。
RR(Round-robin,轮转分叉)是两者之间的桥。FoF 总是在第一个智能体处分叉,导致只有入口智能体有同质组,下游智能体几乎拿不到相同输入,可能拖慢收敛。RR 于是在批次层面随机选分叉点:对每个样本按概率分布 ${p_i}$ 选择智能体 $i$ 作为分叉点;若样本在 $i$ 处分叉,则 $j\ge i$ 的智能体走 FoF 流程,$j<i$ 的智能体只执行一次 rollout。处理完整个批次后,落在单元素组里的 rollout 会被重新打散分组再训练。论文实验里用的概率是 $(0.7,0.1,0.2)$。
FoF(os)(过采样)则从相反方向挖掘样本利用率:对每条采样轨迹,让终端智能体生成 $G$ 条 rollout(而不是一条),从而得到更稠密的最终奖励估计,再传播聚合给更早的智能体。
图 3:两种异构组 rollout 采样策略——FoF 只在入口智能体分叉(下游全部形成异构组),RR 按概率随机选择 fork 点,在全局协调压力与局部学习稳定性之间取平衡
三种策略的取舍可以并列看:
| 策略 | 每样本 rollout 成本 | 同质组 | 异质组 | HotpotQA F1(%) |
|---|---|---|---|---|
| IS | $n\times G$ | 全部 | 无 | 45.582 |
| FoF | $nG$ | 仅入口智能体 | 下游全部 | 49.429 |
| RR | $nG$ | 概率混合 | 概率混合 | 49.724 |
| FoF(os) | $nG+(G-1)$ | 仅入口智能体 | 下游全部 | 50.858 |
数据集来自多跳问答的标准配置:HotpotQA 的训练集共90,447条样本,训练时只把问题作为模型输入,答案用于按 F1 计算奖励;2WikiMultihopQA 与 MuSiQue 作为域外(OOD)评测。检索语料用 Wikipedia dump,检索后端是 contriever——这与既有工作的设定一致,便于对比。
分类全景
理解 MHGPO 的定位,最快的方式是看它和两条既有路线的坐标系关系。
Mermaid 图 2:方法空间——MHGPO 落在"无 critic"与"多智能体、多上下文"的交叉位置。
论文在相关工作中把已有研究归成三条线。第一条是LLM 多智能体系统:AutoGen、OWL 这类框架把角色化协作推进到工程可用,在检索问答里,把 RAG 表述为顺序 MAS、动态路由到专家智能体、引入回溯支持可逆多跳推理等工作都报告了协作收益。第二条是面向多智能体的端到端 RL:主流范式是"中心化训练 + 去中心化执行",代表是 MAPPO 与 HAPPO,普遍使用参数共享来降低训练成本;在 LLM 场景里,已有工作把 MAPPO 用到多智能体 RAG 上,或用共享 LLM backbone 做组件级优化。第三条是无 critic 的组相对策略优化:GRPO、DAPO 这类方法在单上下文推理里把训练开销压得很低。
MHGPO 与第三条线的关系最需要说清楚。论文用一节专门讨论这个联系:在参数共享与奖励传播下,MHGPO 与单上下文 GRPO 之间可以建立一条形式化桥梁——在理想化的上下文充分性(context sufficiency)假设 A3下,MHGPO 的 token 级学习信号与在一条工具增强的单上下文转录上跑 GRPO完全对齐(Proposition,见下文"方法细节")。但在真实系统里,摘要压缩、结果过滤与不对称的工具输出会让 A3 失效,局部上下文被打散——MHGPO 恰恰是为这个"松弛区间"设计的:它转而通过异构分组去利用被 A3 抹掉的跨上下文依赖。
方法细节
除了算法本体,论文最值得单独读的是单上下文转录等价定理,它解释了"为什么去掉 critic 之后训练依然稳"。
设定是这样的:固定输入问题 $q$ 与轨迹索引 $i$,MASS 依次产生 $(q_{1,i},o_{1,i})\to(q_{2,i},o_{2,i})\to\cdots\to(q_{n,i},o_{n,i})$,其中每个 $q_{k,i}$ 由系统模板、工具输出与上游文本拼装而成。与此对照,可以构造一条单上下文转录:把固定的 workflow 文本与生成的 token 交替排列,$x_{k,i}$ 表示采样 $o_{k,i}$ 之前的完整前缀,$\mathrm{Build}{k+1}$ 确定性地追加角色模板、工具调用标记、工具输出与分隔符。构造上 $q{k,i}$ 是 $x_{k,i}$ 的一个后缀。
三条假设支撑整个推导:(A1) 参数共享——所有智能体共享同一自回归策略 $\pi_\theta$;(A2) 确定性 prompt 构造——所有影响下游生成的工具/检索结果都被物化成 token写进 $x_{k+1,i}$,因此 $q_{k+1,i}=\Phi_k(o_{k,i})$ 是确定映射;(A3) 上下文充分性(智能体间 Markov 性)——对每个 $k,i$,构造出的 prompt 对本次生成本身是充分的:
$$\pi_\theta(o_{k,i}\mid x_{k,i})=\pi_\theta(o_{k,i}\mid q_{k,i})$$
在这三条假设下可以证明,MASS 的 rollout 分布与单自回归 LLM 生成同一条转录的分布完全相同,且两边都因子分解为 $\prod_{k=1}^{n}\prod_{t=1}^{T_{k,i}}\pi_\theta(o_{k,i,t}\mid x_{k,i},o_{k,i,<t})$。进一步地,奖励传播把终端奖励 $R_i$ 回传并广播到每个生成 token,于是重要性采样比与优势在两个视角下逐一相等:
$$r^{\text{MAS}}{k,i,t}(\theta)=r^{\text{tr}}{k,i,t}(\theta),\qquad A^{\text{MAS}}{k,i,t}=A^{\text{tr}}{k,i,t}=A_{k,i}$$
因为裁剪操作只依赖 $(r,A)$ 这对量,裁剪后的 GRPO 代理目标逐 token 一致。
论文对这条定理的定位说得非常克制,值得引用它的原话意思:这主要是一条概念性桥梁,而不是实现声明——MHGPO 实际做的仍然是多任务、多上下文优化,并且在实践中比把单上下文 GRPO 生硬地套到长转录上收敛更快、更稳。A3 是理想化的理论锚点,用于形式化"理想单转录视角"与"实际多上下文执行"之间的差距;当 A3 被打破时,MHGPO 靠异构分组利用隐式的智能体间相关性来实现全局协调。
值得注意的是论文对随之而来的额外奖励方差的立场。下游智能体如果被一个糟糕的上游前缀拖累,无论自身动作好坏都只能拿到低奖励。作者认为这不是缺陷,而是"优化系统级协调、而非前缀条件下的局部最优"的直接结果:机制上它会隐式地给协调已经失败的轨迹降权,从而把学习导向全局成功的交互模式。RR 策略在这里起到桥梁作用——它随机混合异构更新与同质比较,让每个智能体同时获得全局协调信号与更干净的、以输入为条件的监督。
另一个补充因素是渐进同质化(progressive homogenization):随着共享 backbone 在训练中收敛,组内多样性自然下降,异构组逐渐近似同质组——这条观察在实验部分有直接的曲线证据。
图 2:MHGPO 框架——对每个 MASS 输入采样多智能体 rollout,每条轨迹拿到终端奖励后反向传播并聚合,得到逐 rollout 的奖励标签,再据此用组相对目标优化共享 backbone
实验设计与结果
实现细节:实验跑在一台配备8 张 NVIDIA H100(每张 80 GB HBM3)与 Intel Xeon Platinum 8468 的机器上。骨干模型统一用Llama3.1-8B-Instruct,三个智能体的 prompt 在既有工作基础上做了小幅修改以简化实现。MAPPO 基线的 critic 采用与 actor完全相同的 backbone 架构,以保证建模能力可比。R1-Searcher 与 Search-o1 使用官方默认实现,只替换 backbone LLM 与检索引擎。
训练配置:只做强化学习,不做任务相关的 SFT 热身;训练一个 epoch,batch size 为512,共176步。默认组大小 $G=4$,RR 的分叉概率为 $(0.7,0.1,0.2)$。Actor 学习率从 ${1\text{e-}6, 5\text{e-}7}$ 中选取,实测5e-7更优;MAPPO 的 critic 学习率固定为 1e-6。
评测指标:三个答案级指标——Accuracy(预测与金答案的 token 级命中率)、EM(Exact Match,要求归一化后精确匹配)与 F1(token 级重叠)。结果取三个随机种子的平均。
主结果(HotpotQA 域内测试集):
| HotpotQA(域内) | Acc(%) | EM(%) | F1(%) | AVG(%) |
|---|---|---|---|---|
| Llama3.1-8B MASS(未优化) | 20.800 | 14.000 | 21.452 | 18.751 |
| R1-Searcher (GRPO) | 36.920 | 32.673 | 45.392 | 38.328 |
| MAPPO | 38.217 | 34.450 | 46.400 | 39.689 |
| MHGPO-IS | 37.677 | 33.707 | 45.582 | 38.989 |
| MHGPO-FoF | 40.459 | 36.570 | 49.429 | 42.153 |
| MHGPO-RR | 40.864 | 37.043 | 49.724 | 42.544 |
最直接的一组对照是未优化系统与端到端训练之间的差距:Llama3.1-8B backbone 下,MHGPO-FoF(os) 把 HotpotQA 的 F1 从21.45 提到 50.86,超过一倍。论文对这个差距的解读是:单纯的提示工程抓不到智能体之间的协同适配(co-adaptation),也抓不到智能体对特定检索环境的适配。
域外(OOD)结果同样被完整报告:
| 方法(OOD) | 2Wiki Acc(%) | 2Wiki F1(%) | MuSiQue Acc(%) | MuSiQue F1(%) |
|---|---|---|---|---|
| MAPPO | 35.790 | 38.722 | 11.626 | 19.738 |
| R1-Searcher (GRPO) | 35.012 | 37.620 | 10.231 | 19.200 |
| MHGPO-IS | 34.796 | 38.050 | 9.888 | 18.421 |
| MHGPO-FoF | 36.299 | 39.089 | 12.702 | 21.633 |
| MHGPO-RR | 36.840 | 39.388 | 11.378 | 21.144 |
| MHGPO-FoF(os) | 37.222 | 40.368 | 12.660 | 22.677 |
可以看到,在 2WikiMultihopQA 与 MuSiQue 上,所有 MARL 方法都优于未优化基线,而MHGPO 家族的增益最为一致。论文也特别指出 MHGPO 没有出现 R1-Searcher 报告的那种 GRPO 不稳定现象,作者的归因是每条上下文的轨迹更短、跨阶段耦合是隐式而非显式的,因而基于组的收敛更快也更可靠。
图 4:不同 RL 算法在一个 epoch 内的训练奖励与固定 500 题 HotpotQA 子集上的验证 F1(每 5 步评测一次)
训练动力学:MAPPO 表现出更明显的抖动与更低的上限,同时因为维护与更新完整 critic,带来显著更高的显存与墙钟开销。IS 变体表现较差,因为同质组内彼此独立的优化无法捕捉智能体间依赖,限制了系统级提升。相反,FoF 与 RR 通过在异构组上估计优势、并用全局奖励驱动,得到更强也更稳的收敛。FoF(os) 的验证 F1 轨迹最好:它在训练奖励上略低于 FoF,但不增加显存的前提下训练更久,泛化因此更好。
逐智能体的行为变化也被跟踪下来:MAPPO 的三个角色都不稳定,一个合理推测是单个 critic 必须同时拟合三类不同的目标;MHGPO 家族则收敛平滑——Rewriter 稳定产出两条改写查询,Reranker 稳定选 2–3 篇文档,最终答案变短(长度降到 10 以下)。
效率:论文单独量化了前 50 步的平均 GPU 显存占用与单步训练时间。因为去掉了 critic,MHGPO 家族在这两个指标上都低于 MAPPO——去掉 critic 的收益直接兑现为显存与时间。
图 5:不同 MARL 算法的 GPU 显存占用(%)与平均训练步时(秒),取前 50 步均值
消融实验
论文的消融集中在三个问题上:优化谁、怎么聚合、组多大。
第一组:优化哪些智能体。为了直接探测智能体间的交互,论文消融了"训练哪个角色"。结果非常干净——只训单个角色会造成断崖式下跌,冻结任意一个角色也会带来不同程度的退化:
| HotpotQA · MHGPO-FoF | Acc(%) | EM(%) | F1(%) | AVG(%) |
|---|---|---|---|---|
| 三角色协同优化 | 40.421 | 36.120 | 49.534 | 42.025 |
| 仅训 Rewriter | 36.798 | 30.481 | 46.151 | 37.810 |
| 仅训 Reranker | 24.240 | 19.082 | 30.760 | 24.694 |
| 仅训 Answerer | 21.180 | 18.667 | 29.027 | 22.958 |
| 冻结 Rewriter | 31.127 | 23.983 | 33.689 | 29.599 |
| 冻结 Reranker | 38.242 | 34.180 | 46.792 | 39.738 |
论文的结论是:MHGPO 的增益来自在共享奖励下"联合"塑造三个策略,而不是来自单独改进某个智能体。一个很有说服力的对照是——如果把三个智能体各自独立优化,方法会精确退化成MHGPO-IS,而 IS 恰好是主表里最弱的变体。
第二组:奖励聚合算符与奖励形式。论文先消融反向传播里的 $\mathrm{Aggr}(\cdot)$:
| Aggr(·) | RR EM(%) | RR F1(%) | FoF(os) EM(%) | FoF(os) F1(%) |
|---|---|---|---|---|
| AVG | 37.043 | 49.724 | 37.623 | 50.858 |
| MAX | 34.129 | 46.343 | 36.704 | 49.020 |
| MIN | 35.840 | 47.930 | 36.920 | 49.842 |
| Rand | 35.643 | 46.824 | 36.602 | 49.013 |
平均聚合在两个分支变体上都最强;MAX 与 MIN 会引入有偏信号,Rand 则抬高方差,因此默认取 AVG。
随后论文做了压力测试:剥掉全部智能体专属的格式惩罚,只保留终端 F1。这个更稀疏的奖励区间伤害了所有方法,但把差异放大了:MHGPO-RR 仍略优于 FoF(非法选择率2.8%vs3.8%,F145.1%vs44.0%),与它"混合异构与同质比较"的设计一致;而MAPPO 急剧退化——F1 掉到 35.0%,Rewriter 幻觉出超过 10 条子查询,非法选择率 5.3%。这与"critic 在稀疏、延迟奖励下信用分配困难,而组相对优势估计更鲁棒"的判断一致。
第三组:组大小。从 3 增到 4 时所有指标都有明显跃升,说明更大的比较集合提供了更强的相对奖励信号;随后基本饱和——4 到 6 的 F1 稳定在 49.38 到 49.53 之间,跨种子方差很小。平均分最高的是组大小 6(AVG 42.284),F1 最高的是组大小 4(49.534)。论文最终选$G=4$作为默认值,理由是它处在这个接近饱和的区间里,能以更低的 rollout 成本拿到几乎相同的最终性能——这是算力与性能的折中,而不是逐指标最优。
| FoF 组大小 $G$ | Acc(%) | EM(%) | F1(%) | AVG(%) |
|---|---|---|---|---|
| 3 | 36.421 | 34.120 | 43.534 | 38.025 |
| 4 | 40.421 | 36.120 | 49.534 | 42.025 |
| 5 | 39.989 | 36.021 | 49.379 | 41.796 |
| 6 | 41.030 | 36.400 | 49.422 | 42.284 |
定性案例
为了看清 MARL 到底给多跳问答带来了什么,论文分析了一道代表性的样例,对比强化学习第 5 步与第 160 步的行为。
第 5 步时系统给出错误答案(unknown):Rewriter 生成的子查询看起来合理,但筛选出的片段并不包含有用信息。到第 160 步,MASS 答对了——Reranker 正确锁定了两篇相关文档(Scott Derrickson 与 Ed Wood 的传记条目)。有意思的细节是,Rewriter 此时只生成两条子查询;这在人看来不如之前的改写直观,但更贴合 contriever 检索器的实际行为,从而检索到了目标文档。
这个例子说明端到端强化学习能让 Rewriter 学会适配它所在的环境(即检索引擎),从而绕过性能瓶颈——而这正是手工提示工程难以覆盖的部分。
图 7:案例研究——同一道多跳问题在第 5 步(答错 unknown)与第 160 步(答对)的输出对比
结果对比总结
Mermaid 图 3:性能与效率的权衡链路——从"未优化系统",经"带 critic 的 MAPPO",到"无 critic 的异构组家族"。
关键发现
- 端到端训练带来的增益是量级性的,而不是边际的。在 Llama3.1-8B 上,HotpotQA 的 F1 从21.45提升到50.86,EM 从 14.00 提升到37.62——论文明确指出,把 LLM 简单地包装成 MAS 而不做优化,反而可能因为指令遵循失败而损害性能。
- 去掉 critic 不是"省一点",而是结构性收益。MAPPO 需要维护一个与 actor 同等规模的 critic;MHGPO 在前50步的平均 GPU 显存占用与单步训练时间上都更低,同时四个变体的 F1 全部超过 MAPPO 的 46.40。
- "组的定义"比"优势怎么算"更关键。GRPO 的组要求共享同一 prompt;MHGPO 把组扩成"同根问题、不同中间决策",于是优势携带跨轨迹耦合。最弱的IS(同质组,45.58)与最强的FoF(os)(50.86)之间的差距,几乎全部来自组的构造方式。
- 增益来自联合塑造三个策略。只训 Answerer 会让 F1 掉到29.03,冻结 Rewriter 掉到29.60;而三个智能体各自独立优化会精确退化成 IS。
- 平均聚合是正确选择。AVG 在两个分支变体上都优于 MAX / MIN / Rand(RR 上 F149.72vs 46.34 / 47.93 / 46.82)。
- 组大小 4 已接近饱和。从 3 到 4 有明确跃升(F1 43.53 → 49.53),4 到 6 基本饱和(49.38–49.53),因此默认 $G=4$ 是算力–性能折中。
- 异构组会自然退化为同质组。组内相似度随训练持续上升,Rewriter 在第 25–30 步左右达到约0.7,且与验证 F1同步上升。
图 8:各智能体 rollout 的组内相似度(归一化到 $[0,1]$)——渐进同质化假设的直接经验证据
局限性
论文自己列出了四条边界,都非常具体:
- 任务范围仅限 QA。评测局限于多跳问答与静态迭代检索,没有覆盖开放式智能体搜索、长程规划或重工具使用场景。MHGPO 在 QA 之外的通用性,尤其是在动态、非平稳环境下的表现,仍待探索。
- 理论刻画不完整。论文只在理想化的"上下文充分性"假设下给出了与单上下文组相对优化的形式化桥梁,但异构分组在局部上下文不完整时的完整方差与稳定性分析留作未来工作——这也解释了为什么作者反复强调等价定理是"概念桥梁"而非实现声明。
- 模型规模上限 8B。受算力约束,所有实验的 backbone 都不超过 8B 参数,更大规模下的扩展行为与涌现协调效应未被测试。
- 智能体数量固定为三。所有实验都用 Rewriter → Reranker → Answerer 这条三智能体链以对齐标准 RAG-QA 基线。MHGPO 虽然对任意 $n$ 有形式化定义,但不同团队规模与非线性拓扑(分支或图结构协调)没有被系统评估。
作者给出的未来方向是:在更多样的任务与更大的智能体团队上测试可扩展性——论文认为框架本身对更广义的 MAS 是"可直接扩展"的。
另一个值得记录的自我限定出现在渐进同质化的讨论里。作者本可以把这个现象包装成"我们证明了训练收敛",但他们选择了更诚实的表述:当前证据本身不足以排除熵坍缩(entropy collapse),只能说现象与"任务特定收敛"一致。原因是 MAS 里的智能体是窄目标的子任务求解器,而不是需要广泛探索的通用模型——通用 LLM RL 里"必须保持高熵"的直觉在这里并不直接适用。这个区分本身就是一个有价值的方法论提醒。
常见问题(FAQ)
MHGPO 和 GRPO 到底差在哪?
差在"组"的定义。GRPO 的组由同一个 prompt 下的多条响应构成,组内比较发生在匹配的局部上下文里;MHGPO 的组由同一根问题、但中间决策不同的多条轨迹构成,组内成员不共享局部上下文。论文进一步证明:在参数共享 + 奖励传播 + 上下文充分性假设 A3 下,MHGPO 的 token 级学习信号与在单上下文转录上跑 GRPO完全对齐;而当 A3 被真实系统的摘要与过滤打破时,异构分组才真正发挥作用。
为什么去掉 critic 反而更稳?
两个层面。工程上,去掉 critic 省掉了一整个价值网络的前向与反向,显存与步时同时下降。算法上,MAPPO 的单个 critic 必须同时拟合三个异构智能体的目标,这是训练抖动的主要来源——论文在剥掉格式惩罚的稀疏奖励实验里给了最直接的证据:MAPPO 的 F1 掉到 35.0%,Rewriter 幻觉出超过 10 条子查询、非法选择率 5.3%。
组的规模应该取多大?
从论文的数据看,$G=4$ 已经进入饱和区间:$G=3$ 时 F1 只有 43.53,$G=4$ 跃升到 49.53,$G=5$ 与 $G=6$ 分别是 49.38 与 49.42——差异在噪声范围内。论文选 $G=4$ 是因为它在这个近饱和区间里rollout 成本更低,属于算力与性能的折中。
异构组带来的额外奖励方差是缺陷吗?
论文把它明确表述为设计后果而非缺陷。下游智能体若被糟糕的上游前缀拖累,无论自身动作好坏都只能拿到低奖励——这相当于隐式地给"协调已经失败"的轨迹降权,把学习导向全局成功的交互模式。RR 策略则通过随机混合异构更新与同质比较,进一步为每个智能体保留干净的、以输入为条件的监督。
这套方法能直接搬到别的多智能体系统上吗?
论文的设计意图是可以。异构组的定义只依赖"同根输入 + 组标识",对任意智能体数量 $n$ 与任意拓扑都成立,框架本身不绑定具体的检索流水线;论文也明确说评估虽聚焦于 MASS,但框架可扩展到更广的 MAS。不过论文同时承认,固定为三个智能体、规模不超过 8B是当前尚未验证的两条边界。
训练过程中组内差异会不会消失?
会,而且论文有曲线证据。随着共享 backbone 收敛,组内相似度持续上升,Rewriter 在第 25–30 步左右达到约 0.7,异构组逐渐近似同质组。关键是这条曲线与验证 F1 是同步上升的,说明同质化至少没有立即伴随系统性能退化;但论文坦承当前证据不足以排除熵坍缩。
参考链接
- 论文(arXiv 预印本):arXiv:2506.02718
- 论文(ACL 2026 正式版,Long Papers, pp. 30319–30338):aclanthology.org/2026.acl-long.1399
- PPO(本文目标的裁剪形式来源):Proximal Policy Optimization Algorithms, arXiv:1707.06347
- MAPPO(本文的主要对比基线):The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games, NeurIPS 2022
- GRPO(本文的优势估计形式来源):DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, arXiv:2402.03300
- MARFT(多智能体强化微调的最新系统化工作):MARFT: Multi-Agent Reinforcement Fine-Tuning, arXiv:2504.16129
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)