☰
【ICML 2025】General Agents 论文解读:通用智能体必然包含世界模型|从强化学习理论视角
2026/10/4 19:08:09 网站建设 项目流程

摘要

本文解读 ICML 2025 论文《General agents need world models》,也就是「通用智能体必然包含世界模型」这一结论的来源。该论文提出智能体即世界模型这一必要性定理,通过融合有界目标条件智能体的形式化定义、复合目标查询构造与信息论意义上的识别性分析,回答「世界模型究竟是灵活目标导向行为的必需品,还是仅仅能提升样本效率的一种手段」,其特别之处在于把一场长期停留于经验的哲学争论改写成一个可证明的识别性问题——只要能从策略反推出环境转移概率,就说明世界模型已经被编码在策略之中。实验表明即使最坏情况 regret 达到 1、定理前提在每一次实验中都不成立,恢复误差仍按 $\mathcal O(n^{-1/2})$ 衰减(20 状态 5 动作稀疏 cMP 上平均误差从 0.171 降到 0.031),这为世界模型研究、机制可解释性与 AI 安全审计提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 论文写作与叙事视角
  • 局限性
  • 常见问题(FAQ)
    • 这篇论文证明了什么?
    • 「世界模型」在这篇论文里指什么?
    • 为什么这项结论对无模型方法是个坏消息?
    • 实验是在什么规模上做的,能外推到真实系统吗?
    • 有没有反方立场?
    • 这篇论文为什么值得关注?
  • 参考链接

论文基本信息

项目内容
标题(英文)General agents need world models
标题(中文)通用智能体必然包含世界模型:目标导向泛化蕴含环境动力学
作者Jonathan Richens, Tom Everitt, David Abel
机构Google DeepMind
会议ICML 2025(PMLR 267:51659–51687)
arXiv2506.01622(预印本题为General agents contain world models,作者四人)
项目网站PMLR 正式版页面(本文无独立项目主页)

背景与动机

争论的一端是「不要表示」。Brooks 在 1991 年的Intelligence without representation中提出「世界本身就是最好的模型」,主张智能体可以完全依靠动作—感知回路,不必学习显式的环境表示。这条路线后来在实践上被大量通用策略印证,也确实让研究者绕开了建模真实世界这件极难的事。

另一端是显式模型。MuZero 用学到的隐空间模型配合 MCTS,在围棋、国际象棋、将棋与 Atari 上都达到当时最好水平;DreamerV3 用单套超参数覆盖上百个任务,证明隐空间动力学加「想象中训练」是可以规模化的。显式模型还带来规划、样本效率、可解释与安全审计上的好处。

问题在于,双方都没有回答一个更根本的疑问:一个能泛化到各种任务的智能体,是不是其实早就学到了世界模型,只是没有被显式地写出来?

现有工作各有短板,这也是本文想补的位置。逆强化学习(Ng 与 Russell 的工作)是从策略和世界模型反推奖励,而且必须知道智能体在多个环境下的最优策略才能唯一确定奖励;机制可解释性(Li 等人 2022 年的涌现世界表示、Bricken 等人 2023 年的稀疏自编码器)确实在模型内部找到了状态表示,但探针与自编码器都是针对特定智能体—环境系统拟合的,至少部分是监督式的,而且恢复的是「状态空间」而不是转移概率;Savage 式表示定理可以为任意策略拟合出一个世界模型,连均匀随机策略也不例外,因此它无法说明智能体学到了真实动力学;1970 年的好调节器定理只证明「最小化环境熵的智能体必须有确定性策略」,而这个策略完全可能是把同一个动作分配给所有状态的常函数。作者自己的前作Robust agents learn causal world models(ICLR 2024)证明了域泛化需要因果世界模型,但任务泛化是否需要世界模型,仍然悬而未决——这正是本文要回答的问题。

把问题放回历史脉络会更清楚。世界模型这条线并非始于深度学习:1990 年前后,Sutton 的 Dyna 架构与 Schmidhuber 的可微世界模型就提出「先学模型,再在模型里规划与学习」;2018 年 Ha 与 Schmidhuber 的World Models把 world model 固定为深度强化学习的术语,并确立了 RSSM 这一隐空间动力学血统;2019 到 2023 年,PlaNet、Dreamer、MuZero 与 TD-MPC2 让「隐空间模型 + 想象中训练」成为主流,DreamerV3 更以单套超参数覆盖上百个任务;2024 年之后,生成式视频模型与学习型模拟器开始直接进入机器人策略训练与数据合成。本文的意义在于把「世界模型有用」这一工程直觉,升级成「没有世界模型就没有一般智能体」的信息论陈述。反方立场同样需要记住:在有限时域的表格 MDP 上,Zhang、Zhou 与 Ji(NeurIPS 2020)证明无模型算法也能达到统计最优,Jin 等人(2018)也证明了 Q-learning 的样本效率,Silver 等人(2021)的Reward is Enough则从假设层面主张奖励最大化足以催生智能——本文的反驳点因此不在单步最优性,而在多步复合目标。

研究主线:从问题到结论

图 5:本文的研究主线(Mermaid 流程图)。问题引出模型与无模型的路线之争,动机转化为有界智能体上的可测参数,方法用复合目标查询加识别性分析落地,实验在 20 状态稀疏 cMP 上验证,最终得到无模型路线不存在的结论。

基准/方法设计

本文的框架只依赖三个对象,它们构成一个「已知两个求第三个」的三角关系。

对象含义谁来给定
环境受控马尔可夫过程 cMP,由状态集、动作集与转移函数 $P_{ss'}(a)$ 组成假设它有限、通信、平稳且动作数不少于 2
目标LTL 表达的复合目标,由若干子目标按顺序组成深度 $n$ 即子目标个数
策略目标条件策略 $\pi$,把历史与目标映射为动作由智能体给出

图 1:本文补齐了环境—目标—策略三角的第三条边。规划是从世界模型和目标推出策略,逆强化学习与逆规划是从策略和世界模型推出目标,而本文是从策略和目标反推出世界模型。

关键在于本文对「智能体」的定义刻意写得极弱:有界目标条件智能体只需要满足一个相对最优策略的 regret 保证,即在所有深度不超过 $n$ 的目标 $\psi$ 上,达成概率不低于最优策略的 $1-\delta$ 倍。这里 $\delta$ 是失败率,$n$ 是它能稳定处理的最大目标深度。全文不假设任何理性公理,不要求智能体拥有完整的偏好序,也不要求它理性——只要求它在某类任务上「够好」。世界模型则被定义为转移函数的任意近似 $\hat P_{ss'}(a)$,其误差 $|\hat P_{ss'}(a)-P_{ss'}(a)|$ 不超过 $\epsilon$。

分类全景

把本文与它的前作放在一起看,可以画出一张「智能体需要多少环境知识」的阶梯图。

图 6:智能体所需环境知识的阶梯(Mermaid 分类图)。只优化即时后果的 myopic 智能体边界平凡且紧;任务泛化要求预测型世界模型,由本文 ICML 2025 证明;域泛化要求因果世界模型,由前作 ICLR 2024 证明。

这里有一个反直觉推论值得单独点出:把本文与 ICLR 2024 的前作并列,会得到「域泛化要求比任务泛化严格更多的环境知识」。原因是,只要求泛化到新目标时,智能体可以完全不掌握环境变量之间的因果关系;而要求适应新的分布时,因果关系就变成了不可回避的知识。作者据此提出,这里可能存在一个智能体版本的 Pearl 因果阶梯。

方法细节

方法的核心思想非常朴素:不去假设智能体拥有模型,而是构造一类特殊的复合目标去提问,让智能体在第一个动作上就把转移概率之间的大小关系暴露出来。

图 2:智能体把状态 $s_t$ 或历史与目标 $\psi$ 映射为动作 $a_t$;图中虚线箭头就是本文的恢复算法,它不需要读取智能体的内部结构,只依赖这条映射就能重建环境的转移概率。

具体做法如下。构造由 $n$ 次独立尝试组成的复合目标,每次尝试要么走向目标结果 $s'$、要么走向其余状态集合 $\neg s'$,于是「至少成功 $r$ 次」的概率恰好是二项分布 $\frac{n!}{(n-r)!\,r!}P^r(1-P)^{n-r}$。接着把两个备选动作分别绑在「成功次数不超过阈值」与「成功次数超过阈值」两个分支上,随着阈值 $k$ 递增,智能体的最优动作会在两个动作之间翻转一次,翻转点 $k^$ 就是转移概率的函数,于是有 $\hat P_{ss'}(a) \leftarrow (k^-1/2)/n$。把 Berry–Esseen 型不等式代进去,把二项尾概率换成转移概率的区间,再按目标深度与尝试次数的二倍关系代换,就得到主定理的闭式界:$\left|\hat P_{ss'}(a) - P_{ss'}(a)\right| \leq \sqrt{\frac{2 P_{ss'}(a)(1-P_{ss'}(a))}{(n-1)(1-\delta)}}$。当 $\delta$ 远小于 1、$n$ 远大于 1 时,误差按 $\mathcal O(\delta/\sqrt n) + \mathcal O(1/n)$ 缩放。

图 3:主定理证明中的复合目标结构。从状态 $s$ 出发执行动作 $a$,以概率 $p$ 进入目标结果 $s'$、以概率 $1-p$ 进入其余状态的集合 $\neg s'$;每次尝试结束后都以概率 1 回到 $s$,重复 $n$ 次之后,「成功次数是否超过阈值」这个二项比较就把 $p$ 的大小暴露了出来。

这一构造带来两个必须强调的技术细节。第一,证明只要求智能体在一小部分复合目标上满足 regret 保证,其数量的量级是 $n|\mathbf{A}||\mathbf{S}|^2$,而不是要求它在全部目标上都够好——这正是「世界模型会随训练自然涌现」的机制解释。第二,恢复映射存在本身就构成世界模型的可识别性:算法不需要激活、不需要监督,权重不可见时同样适用;对阈值 $k$ 的线性搜索可以换成二分,复杂度降到对数级。

本文给出两个具体算法。Algorithm 1 对成功次数低于与高于阈值的两种情形各取一次析取,能逼近主定理给出的误差界;Algorithm 2 只比较两条最简的序列目标,再用 $k$ 次重复细分,误差界更弱但实现简单得多,本文的全部实验都使用 Algorithm 2。下图是论文中恢复算法与策略之间的对应关系。

实验设计与结果

实验刻意选择最简的非平凡设置,用来检验「误差是否按理论预测的阶衰减」。

评测协议:环境是随机生成的受控马尔可夫过程,含20 个状态与 5 个动作,转移函数带稀疏约束,每个状态动作对至多有5 个非零结果,以保证导航到目标状态不是平凡问题。智能体是基于模型的,其模型由最大随机策略采样出的轨迹学习,能力通过把轨迹长度 $N_\text{samples}$ 从500 提升到 10,000来增强。评测时作者有意把最坏情况 regret 放宽成平均regret,用来专门测试定理前提被违反的区间;每个经验量训练10 个不同随机种子的智能体,每个智能体再查询从10 到 600的目标深度。

下表是主结果(表内为平均世界模型误差,行是可达目标深度 $N_\text{depth}$,列是经验轨迹长度 $N_\text{samples}$),完整的 11 组经验量矩阵见附录实验表格。

平均误差5001000500010,000
$N_\text{depth}=10$0.1710.1370.0820.066
$N_\text{depth}=50$0.1570.1080.0480.034
$N_\text{depth}=100$0.1560.1060.0460.032
$N_\text{depth}=600$0.1550.1040.0440.031

完整实验矩阵(10 个智能体重训后的均值,标准差均不超过 0.009):

$N_\text{depth}$ \ $N_\text{samples}$50010003000600010,000
100.1710.1370.0970.0780.066
200.1600.1180.0730.0540.044
500.1570.1080.0630.0440.034
1000.1560.1060.0600.0410.032
2000.1550.1050.0590.0400.031
6000.1550.1040.0580.0400.031

图 4:左图是恢复出的世界模型平均误差 $\langle\epsilon\rangle$ 随可达目标深度 $N_\text{max}(\langle\delta\rangle=0.04)$ 的下降,标度为 $\mathcal O(n^{-1/2})$,与定理给出的最坏情况界同阶;右图是平均误差随深度 50 目标的平均 regret $\langle\delta\rangle$ 上升,近似指数增长。误差棒是 10 次不同经验轨迹重训得到的 95% 置信区间。

结果对比总结

图 7:关键结果对比(Mermaid 流程图)。即使最坏 regret 达到 1、定理前提在实验中失效,平均模型误差仍从 0.171 降到 0.031,按目标深度的平方根速率衰减,与定理给出的界同阶,因此世界模型依然可被准确提取。

关键发现

  • 前提失效,结论仍成立:在全部 11 组经验量与全部 10 个目标深度上,智能体对某些目标的最坏 regret 都达到了 1,也就是说 Theorem 1 的假设在任何一次实验中都不成立;但平均误差仍按 $\mathcal O(n^{-1/2})$ 衰减。
  • 误差双向下降:目标深度为 10 时误差从 0.171 降到 0.066,深度为 600 时从 0.155 降到 0.031,说明越擅长完成长程任务的智能体,其策略里的世界模型越精确。
  • 两个饱和现象:目标深度从 200 增到 600 几乎不再改善误差(0.031 对 0.031),说明收益主要来自经验量而非更深的查询;而经验量从 500 增到 10,000 让误差降低一半以上。
  • 对平均 regret 的敏感性:误差随平均 regret 近似指数上升,拟合形式为 $y = 0.01\left(0.32e^{66.8\langle\delta\rangle} + 1.12\right)$,因此「平均而言够好」是恢复成功的实际条件。
  • 相对误差的例外:把误差界两边同时除以 $P_{ss'}(a)$ 会发现,对 $P_{ss'}(a) \ll 1$ 的低概率转移,相对误差可以非常大——这意味着不完美或有限视界的智能体只需要学习稀疏的世界模型,覆盖常见转移即可。
  • 必要性的边界:对于只优化即时后果的最优 myopic 智能体,转移概率的界平凡($\epsilon = 1$)而且紧,说明世界模型的必要性真正来自多子目标与长时程的目标结构,而不是来自「做目标导向行为」本身。

论文写作与叙事视角

除了结论本身,这篇论文的写法也值得单独拆解,因为它是一篇典型的「把不可回答的问题改造成可解问题」的论文。

叙事弧线是三段式。摘要首句直接把辩论立成二选一:「Are world models a necessary ingredient for flexible, goal-directed behaviour, or is model-free learning sufficient?」;结论则把新定理接进两千年的旧直觉——「It can be traced as far back as Democritus, who claimed that man is a microcosm」,并引用 Friston 的「an agent does not have a model of its world---it is a model」;而中间用一句「While this relation between agents and environments has long been hypothesised, we have sought to formalise and prove it」明确声明本文做的是形式化而不是提出新直觉。这种「双问开局 → 历史锚定 → 承诺兑现」的结构,是这篇论文读起来不像纯理论工作的主要原因。

措辞上有两个可复用的动作。一是强断言与克制的新颖性声明并存:正文用「must have learned a predictive model」这种前置的强断言,但新颖性只声明为「We provide a formal answer to this question」,不自称 first;二是把模糊概念替换成可测量参数,全文用失败率 $\delta$ 与最大目标深度 $n$ 承担了「智能」这个词原本的模糊性。

从顶会写作模式的视角看,本文同时命中三种创新模式。一是把哲学争论重述为一个可解的识别性问题(把「是否需要模型」变成「能否从策略反推转移概率」);二是审计并扭转无模型路线的隐含负载假设,把「能力」显式写成可测的 $\delta$ 与 $n$ 而不是理性公理;三是先刻画 myopic 极限、再证明多步目标下极限被越过。前两种模式的组合在近两千篇 ICLR/ICML/NeurIPS 论文的统计里属于最稳定的「Oral 配方」,而执行质量的落点是闭式误差界、极限的紧度证明,以及前提失效(最坏 regret 达到 1)时仍然成立的实测。不过需要说清楚:本文实际录用等级是 ICML 2025 Poster,命中模式并不等于拿到 Oral,实验规模(20 状态)也是它难以再进一步的原因。

读原文时值得留意的几处瑕疵。结论句里把 its 写成了 it's(引用 Friston 时保留原文的 it's world 则是正确做法);讨论部分残留了若干 hedge,例如「arguably simpler」「perhaps due to risk of death」「There are likely many such choices」;源码中既没有致谢节,正文也没有独立的 Limitations 小节,局限以粗体段落的形式出现在 Discussion 内部。

局限性

  • 仅覆盖完全可观测环境:证明假设环境完全可观测;在部分可观测情形下,智能体究竟需要学到哪些隐变量才能获得同等的行为灵活性,作者明确承认这是开放问题。
  • 是存在性,不是使用性:定理证明的是世界模型被编码在策略中,而不是智能体在规划中使用它;作者也避免对「智能体知道什么」作更深的认识论断言。
  • 环境假设过于理想:结论建立在通信、平稳、有限的受控马尔可夫过程之上;作者预期在含部分可观测或非马尔可夫动力学的现实环境中,约束只会更强。这也意味着 regret-bounded 智能体实际上被限制在「可解」的领域内——那些我们能够学会模型并在其上做长时程规划的领域。
  • 证明的构造性局限:算法的查询目标是精心构造的复合目标,在真实的大规模智能体上如何高效地提出这些查询、以及如何把结果扩展到连续状态空间,仍属于未来工作。
  • myopic 盲区:深度为 1 的最优智能体完全不需要转移概率,因此「世界模型必需」这一论断并不适用于只优化即时后果的智能体类型。

作者给出的未来方向是:把分析推广到更广的目标类、寻找足以蕴含世界模型的「通用任务集」,并发展可扩展的世界模型提取算法,用于预测与审计黑盒智能体,服务 AI 安全与可解释性。

常见问题(FAQ)

这篇论文证明了什么?

它证明任何满足 regret 保证的多步目标条件智能体,其策略本身就唯一确定了环境的转移概率,误差满足 $|\hat P_{ss'}(a) - P_{ss'}(a)| \leq \sqrt{2P(1-P)/((n-1)(1-\delta))}$。因此在信息意义上,训练一个通用目标条件策略与学习一个世界模型是等价的。

「世界模型」在这篇论文里指什么?

指对转移函数 $P_{ss'}(a)$ 的任意近似,误差不超过 $\epsilon$,也就是可用于预测与规划的一步预测器。这与机制可解释性里常见的「状态表示」不同,后者只刻画当前状态的空间结构,并不能预测环境在动作下的演化。

为什么这项结论对无模型方法是个坏消息?

因为它说明无模型路线无法绕过世界模型:只要能零样本泛化到长时程任务,世界模型就已经被编码在策略里了,只是没有显式暴露。模型的保真度反过来界定了智能体泛化能力的上界——想要更强的泛化,就必须更准确地建模世界。

实验是在什么规模上做的,能外推到真实系统吗?

实验规模很小:20 个状态、5 个动作的稀疏受控马尔可夫过程,10 个随机种子的智能体,目标深度从 10 到 600。作者的目标是验证误差的标度关系而非绝对性能,因此外推到真实系统需要额外的工程工作;但前提失效(最坏 regret 达到 1)时结论依然成立这一点,说明该现象有一定的鲁棒性。

有没有反方立场?

有。在有限时域的表格 MDP 上,Zhang、Zhou 与 Ji 在 NeurIPS 2020 的工作证明无模型算法同样可以达到统计最优,Jin 等人 2018 年也证明了 Q-learning 的样本效率。本文的反驳点因此不在单步最优性,而在多步复合目标:一旦要求零样本完成需要多个子目标、跨越较长视界的任务,世界模型就变得不可回避。

这篇论文为什么值得关注?

它把「智能体是否需要世界模型」从一个只能靠经验表态的问题,变成一个可以证明、也可以测量的识别性问题,并顺带给出了一个只依赖黑盒策略的世界模型恢复算法。这解释了为什么在实践中,模型无关的训练方式往往会自发地学到预测性结构——因为不学模型,就没有长时程泛化。

参考链接

  • General agents need world models(arXiv 2506.01622)
  • ICML 2025 正式版(PMLR 267:51659–51687)
  • Richens & Everitt, Robust agents learn causal world models(ICLR 2024)
  • Ha & Schmidhuber, World Models(arXiv 1803.10122)
  • Hafner et al., DreamerV3(arXiv 2301.04104)
  • Schrittwieser et al., MuZero(arXiv 1911.08265)
  • Sutton, Dyna: An Integrated Architecture for Learning, Planning, and Reacting(ACM SIGART Bulletin 2(4), 1991)
  • Brooks, Intelligence without representation(Artificial Intelligence 47:139–159, 1991)
  • Zhang, Zhou & Ji, Almost Optimal Model-Free Reinforcement Learning(NeurIPS 2020,反方立场)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询