摘要
本文解读 ICRA 2025 论文《ExploRLLM: Guiding Exploration in Reinforcement Learning with Large Language Models》。该论文提出用基础模型引导强化学习探索的框架 ExploRLLM,通过融合大语言模型生成的策略代码、视觉语言模型抽出的物体中心表示与残差强化学习,在不牺牲最终策略质量的前提下大幅加速机器人操作任务的收敛,其特别之处在于把基础模型从「替代策略」重新定位为「探索先验」——动作可以次优甚至失败,只要能提高访问有意义状态的概率就有价值。实验表明短程任务成功率 0.86、长程任务 0.70,全面超过纯基础模型基线与关闭探索的强化学习基线,并能在零样本条件下迁移到真实 Franka Panda 机械臂,为 LLM 与 RL 的协同提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:当基础模型不可靠,而强化学习探索又太贵
- 从「语言模型写策略」到「语言模型供探索」的技术脉络
- 研究主线:从问题到结论
- 基准/方法设计:把语言模型的功能一分为三
- 分类全景
- 方法细节:热图采样与残差表示,是两处反直觉的设计
- 实验设计与结果:四种配置全部领先,长程任务从「不收敛」到可学
- 结果对比总结
- 创新模式与写作观察:Oral 信号在哪里
- 三个命中的创新模式
- 叙事与措辞观察
- 关键发现
- 局限性
- 常见问题(FAQ)
- ExploRLLM 与 RLingua 这类工作有什么本质区别?
- 为什么低层动作要按可供性热图采样,而不是取最大值的点?
- 探索频率 ε 需要仔细调吗?
- 训练时怎么处理真机的视觉检测误差?
- 为什么长程任务的提升比短程更明显?
- 这套方法能直接部署到真机吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | ExploRLLM: Guiding Exploration in Reinforcement Learning with Large Language Models |
| 标题(中文) | ExploRLLM:用大语言模型引导强化学习的探索 |
| 作者 | Runyu Ma, Jelle Luijkx, Zlatan Ajanović, Jens Kober |
| 机构 | 代尔夫特理工大学(Cognitive Robotics) & 亚琛工业大学 |
| 会议 | ICRA 2025(IEEE International Conference on Robotics and Automation) |
| arXiv | https://arxiv.org/abs/2403.09583 |
| 项目网站 | https://explorllm.github.io |
背景与动机:当基础模型不可靠,而强化学习探索又太贵
机器人操作里的强化学习一直受制于两个老问题:样本效率低与收敛不确定。在桌面抓取放置这类任务中,观测是俯视的 RGB-D 图像,动作是连续的抓取与放置位姿,状态动作空间很大,智能体常常在稀疏奖励里长时间碰不到成功样本。传统的探索手段——贪心探索、玻尔兹曼探索——本质上是随机的,只关心探索与利用的权衡,没有机制把先验知识注入进来。
基础模型看起来提供了另一条路。大语言模型能从常识出发生成任务计划,视觉语言模型能做开放词表的目标检测,两者配合可以在零样本和小样本设定下给出有意义的动作。但它们也有明显的短板:大模型的预测会有物理与空间上的错误,而且不会从过去的经验中学习。Socratic Models、Inner Monologue 这类工作把语言模型放进闭环直接决策,一旦规划出错,系统没有任何纠正机制;CLIPort 这类视觉操作模型虽然强,但在新场景与复杂几何关系上明显退化。同期还有一条路线是 RLingua,它用大语言模型生成的规则控制器去正则化强化学习策略,让策略向语言模型靠拢——这等于把语言模型的偏置一起继承了下来。
论文的出发点正好相反:语言模型的动作不必正确,只要它们能落在有意义的动作区域就行。基础模型负责把探索引到「值得试一试」的地方,物理层面的偏差交给强化学习通过奖励去修正。这样一来,两边的缺点恰好被对方补上。
从「语言模型写策略」到「语言模型供探索」的技术脉络
这条线走了四年,大语言模型在机器人中的角色从直接替代策略退到了只提供探索先验:
- 2022–2023 —— Code as Policies(ICRA 2023)用大语言模型生成机器人策略代码,第一次把语言先验变成可执行程序;Socratic Models(ICLR 2023)用语言串起多模态零样本推理。
- 2023 —— VoxPoser(CoRL 2023)让语言与视觉模型生成三维价值图做零样本规划;Inner Monologue(CoRL 2023)引入成功检测器让闭环决策更稳。
- 2024 —— Eureka 让语言模型生成奖励代码来优化强化学习训练;同期的 RLingua(RA-L 2024)走「用语言模型正则化强化学习」的路线。
- 2024–2025 —— ExploRLLM(本文,ICRA 2025)把基础模型降级为探索先验,残差强化学习保留纠正权,并完成真机零样本迁移。
- 2026 —— 同一团队的 LLM-TALE(ICRA 2026)把探索推进到任务级与可供性级并在线纠正计划次优性;SIERL 则转向搜索启发的探索,与语言先验形成互补。
图 1:ExploRLLM 总览:基础模型提供基策略、高效表示与探索策略,强化学习智能体学习何时及如何偏离基策略。
研究主线:从问题到结论
图 9:ExploRLLM 研究主线(Mermaid 流程图):RL 探索低效 → 基础模型提供先验但不可靠 → 只把基础模型当探索先验 → 残差 RL 学习如何偏离 → 短程 0.86、长程 0.70。
基准/方法设计:把语言模型的功能一分为三
ExploRLLM 的设计可以概括为一句话:让基础模型产出基策略、表示与探索策略,让强化学习学习何时偏离以及如何偏离。形式化上,每个时刻智能体接收到语言目标与观测,动作被改写为物体中心的残差形式 $\tilde{a}_t = (k_t, i_t, x_r)$,其中 $k_t$ 是抓取或放置的原语索引,$i_t$ 是物体索引,$x_r$ 是相对物体中心的残差位移;真实位姿就是物体位置与残差之和。这样智能体不必从像素直接回归绝对坐标,而是学习「相对物体偏多少」这个更小的问题。
观测侧同样被重写。大语言模型先把自然语言命令改写为模板化命令向量,例如把「把绿色方块放进蓝色碗里」改写成「Pick the [pick_object] and place it in the [place_object]」;视觉语言模型再把与任务相关的物体用包围盒框出来,按框裁剪出图像块。命令向量、物体位置、图像块与夹爪状态被拼成新的观测,像素级的噪声与纹理差异在这一步就被过滤掉了。
探索侧的关键取舍是:动作由语言模型提供,但永远不参与策略参数更新。在 rollout 收集阶段,系统以概率 $\epsilon$ 采样本应由语言模型给出的动作,否则执行强化学习策略 $\pi_{RL}$。这相当于把 $\epsilon$-greedy 里的随机动作换成了「有常识的动作」。
分类全景
图 10:ExploRLLM 的三大组件(Mermaid 分类图):物体中心观测(LLM 重述指令 + ViLD 定位)、残差动作空间(原语索引 + 物体索引 + 残差位移)、分层探索与纠正(代码探索 + SAC 残差)。
方法细节:热图采样与残差表示,是两处反直觉的设计
物体中心观测与残差动作空间是整篇论文的接缝。视觉语言模型已经给出了每个物体的位置,动作空间因此可以改写成「选哪个物体 + 相对它偏多少」。论文举的例子是抓取字母 O:包围盒中心恰好是空心处,直接抓中心必然失败,而残差位移允许智能体学会往边缘偏。这个设计把「基础模型的语义抽象」与「强化学习的物理修正」切成了两层,各自做自己擅长的事。论文还刻意在训练期对包围盒中心注入高斯噪声(标准差取图像块半径的一半),模拟真实检测误差,真机评测时才改用 ViLD 在线检测。
低层动作用可供性热图而不是单点是第二处关键设计。语言模型生成的策略代码并不总能给出正确的抓取点——论文自己的例子就是 O 字热图把高值区域放在了中心。作者没有想办法让语言模型变准,而是让低层动作按热图随机采样,而不是取最大点。这样一来,探索行为天然带有噪声,也天然会产出反例样本;由于强化学习本身就是从奖励中学习的,次优的探索恰恰提供了可以纠正的信号。
分层策略代码与离线筛选解决了成本问题。直接在每个训练步调用大语言模型的时间与费用极高,论文改用 Code-as-Policies 式的分层语言模型程序:高层 $\pi_{LLM}^H$ 选择运动原语与交互物体,低层 $\pi_{LLM}^L$ 生成基于 OpenCV 与 NumPy 的可供性热图代码。候选策略代码先生成一批、评估成功率、再选出最优的执行,之后在训练中反复复用。高层提示用 GPT-4 的少样本示例,低层用 GPT-4V 并附上环境图像与图像块示例。
实现细节方面,网络用两层卷积把每个图像块编码成向量 $\phi \in \mathbb{R}^{n \times d}$,与位置、夹爪状态、命令向量拼接后送入自注意力层,再接两层 MLP,所有 actor 与 critic 共用这一结构。算法本体是 stable-baselines3 里的 SAC,只改动了 rollout 收集阶段,短程任务训练 25k 步、长程 75k 步,每个探索频率训练 6 个随机种子,每次训练都包含 20,000 步不带语言模型探索的预热。真机侧在 EAGERx 框架中实现策略与代码。
图 2:ExploRLLM 的实现结构:(a) LLM 重述语言命令;(b) 物体中心的残差动作空间;(c) 基础模型引导探索与强化学习训练闭环。
图 3:基于探索提示生成候选策略代码,评估后选出探索策略;右下角的例子显示 O 字可供性热图把它定位到中心而非边缘,正是强化学习需要纠正的次优。
实验设计与结果:四种配置全部领先,长程任务从「不收敛」到可学
评测设置:仿真环境是 UR5e 机械臂加俯视 RGB-D 相机,沿用 Transporter 与 CLIPort 的设定,但把方块换成字母等更多样的物体来提高难度。任务分两档:短程(SH)任务是「把指定的字母放进指定颜色的碗」,每回合三个字母与三个碗随机摆放;长程(LH)任务是「把所有字母放进颜色匹配的碗」,必须完成全部配对。每个配置评测50 个回合,初始化分无重叠(NO)与允许重叠(AO)两种。真机使用带吸盘夹爪与 RGB-D 相机的 Franka Panda,训练全在仿真完成,真机只做评测,每场景 15 个回合。
图 4:真机平台:Franka Panda + 吸盘夹爪 + RGB-D 相机,策略与代码实现在 EAGERx 框架中,训练全在仿真完成、真机仅评测。
主结果:ExploRLLM 在四种配置上全部领先,长程无重叠比最强的纯基础模型基线 Inner Monologue(0.58)高出一成二以上;而完全关闭语言模型探索的版本($\epsilon = 0$)在长程任务上根本没有收敛,表中没有数值。另一个容易被忽略的趋势是:本文把「位置不重叠」与「允许重叠」之间的差距压小了,说明探索策略确实在纠正基础模型的定位偏差。
| 方法 | 短程 无重叠 | 短程 允许重叠 | 长程 无重叠 | 长程 允许重叠 |
|---|---|---|---|---|
| ExploRLLM(ε=20%) | 0.86 | 0.80 | 0.70 | 0.54 |
| ExploRLLM(ε=0) | 0.56 | 0.48 | — | — |
| CaP* | 0.60 | 0.48 | 0.38 | 0.30 |
| Socratic Models + CLIPort | 0.78 | 0.64 | 0.50 | 0.36 |
| Inner Monologue + CLIPort | 0.82 | 0.72 | 0.58 | 0.42 |
图 5:短程任务训练曲线:不同探索频率下的收敛表现,ExploRLLM 优于纯探索策略(虚线)与 $\epsilon = 0$ 的标准 SAC。
图 6:长程任务训练曲线:LLM 引导探索是成败关键,关闭探索的智能体在 75k 步内无法收敛。
探索频率消融:训练回报对探索频率呈倒 U 形。频率为零时短程回报在零附近且标准差超过 1($\pm 1.13$),说明结果高度不稳定;长程更差,达到 $-3.22 \pm 0.29$ 且不收敛。频率升到 70% 与 90% 之后两种任务都全面崩坏,原因是在线采样数据占比太低。值得注意的是,纯探索策略本身只有 0.53 与 −1.2,这直接说明收益来自强化学习与大语言模型的协作,而不是大语言模型单独的能力。
| 探索频率 ε(%) | 短程任务(25k 步) | 长程任务(75k 步) |
|---|---|---|
| 0 | −0.03 ± 1.13 | −3.22 ± 0.29 |
| 10 | 0.74 ± 0.13 | −0.73 ± 0.40 |
| 20 | 0.79 ± 0.06 | −0.42 ± 0.31 |
| 30 | 0.76 ± 0.16 | −0.23 ± 0.26 |
| 50 | 0.70 ± 0.17 | −0.40 ± 0.23 |
| 70 | −0.29 ± 0.98 | −1.71 ± 1.38 |
| 90 | −0.52 ± 1.12 | −2.51 ± 1.09 |
| 纯探索策略(LLM-only) | 0.53 | −1.2 |
零样本跨任务与真机迁移:把短程策略接到零样本规划器(Socratic Models)上之后,在已见字母、未见颜色与未见字母上的成功率分别是 74、68、56,对照的 CLIPort 方案是 72、50、34——差距主要出现在未见颜色与未见字母上,说明泛化能力来自视觉语言模型抽出的物体中心表示。真机零样本迁移方面,短程对已见字母是 66.6%、对未见的字母 C 是 53.3%;长程是 40% 与 33.3%,全程没有任何额外的真机训练。
| 方法(Socratic 规划器 + 短程策略) | 已见字母 | 未见颜色 | 未见字母 |
|---|---|---|---|
| Socratic Models +ExploRLLM | 74 | 68 | 56 |
| Socratic Models + CLIPort | 72 | 50 | 34 |
| 真机零样本(每场景 15 回合) | 短程任务 | 长程任务 |
|---|---|---|
| 已见字母 | 66.6% | 40% |
| 未见字母 C | 53.3% | 33.3% |
图 7:真机结果可视化:VLM 检测与抓取/放置动作;策略在不同物体朝向、未见字母与真实光照噪声下仍可执行。
图 8:短程 ExploRLLM 策略可被零样本 LLM 规划器(如 Socratic Models)复用为长程技能,每步重置任务空间后执行。
结果对比总结
图 11:结果对比(Mermaid 流程图):纯 RL(ε=0)短程 0.56 且长程不收敛、基础模型最优基线 0.82 / 0.58、纯探索策略 0.53,全部汇入 ExploRLLM 的短程 0.86 与长程 0.70,最终落到真机零样本 66.6% / 40%。
创新模式与写作观察:Oral 信号在哪里
三个命中的创新模式
按顶会创新模式框架(ResearchStudio-Idea,覆盖 1,947 篇 ICLR/ICML/NeurIPS 论文的 15 种模式)拆解,ExploRLLM 主要命中三条:
- 审计并扭转负载假设(P1,$\Delta_{OH} = +13.1$ pp,PC 最偏爱):子领域默认「基础模型必须先足够准确,才能进入机器人系统」。本文扭转它——动作次优甚至失败也无妨,只要能提高访问有意义状态的概率,误差交给强化学习修正。证据是探索频率的完整消融:$\epsilon = 0$ 时短程回报只有 $-0.03 \pm 1.13$ 且长程 75k 步不收敛,$\epsilon = 20\%$ 时短程升到 $0.79 \pm 0.06$,而 $\epsilon > 0.5$ 后重新崩坏——扭转后的条件成立,而且有明确的边界。
- 重新表述为可解对象(P6,$\Delta_{OR} = +2.9$ pp、$\Delta_{OH} = +7.1$ pp,双赢模式):把「强化学习与基础模型如何耦合」重写为物体中心的残差问题$\tilde{a}_t = (k_t, i_t, x_r)$,使「何时、如何偏离基策略」变成可以直接学习的对象。证据是长程无重叠成功率 0.70 对 CaP* 的 0.38、Inner Monologue 的 0.58,低级错误率 0.14 对 0.38 / 0.18。
- 统一异构输入到同一空间(P5,$\Delta_{OH} = -11.2$ pp,社区最偏爱、高引率 17.4%):把语言命令、物体位置、图像块与夹爪状态统一进同一个物体中心观测,动作空间同步改写为物体中心残差。证据是未见颜色/未见字母 74/68/56 全面优于 CLIPort 的 72/50/34,以及真机零样本 66.6% / 40%。
组合起来看,它的执行力来自「扭转前提 + 残差重述 + 统一表示」三步:先用 7 档频率乘 6 个种子的受控扫描证明「基础模型是探索先验而非替代策略」成立且有边界,再用残差空间把耦合问题变成可解对象,最后用仿真、跨任务与真机三组实测收口。
叙事与措辞观察
叙事弧线是对立开场 → 清单立论 → 承诺兑现:
- 对立开场:"RL often suffers from low sample efficiency and uncertain convergence" 紧接 "Foundation Models (FMs) offer an alternative",两句话内建立起两条路线的张力。
- 清单立论:"To summarize, our main contributions are the following." 之后是三条带编号的贡献:残差空间、分层探索提示、泛化与真机。
- 承诺兑现:引言承诺泛化到未见场景、未见任务与真实世界且无需额外训练,结论用未见颜色/字母 74/68/56 与真机 66.6% / 40% 兑现。
措辞上有三维表现正向:证据框架让结论句紧邻具体数字("We show that ExploRLLM outperforms both policies derived from FMs and RL baselines" 同段就有 0.86 与 0.70);新颖性立场把缺陷重述为价值("actions generated by FMs may be suboptimal or fail, they can highlight meaningful regions in the action space for exploration"),而不是硬碰最强的结果;范围框架诚实收窄("our framework focuses on tabletop manipulation" 与 "it struggles with mitigating high-level errors")。
关键发现
- 基础模型的正确用法是探索先验,而不是替代策略:语言模型的动作不参与策略参数更新,只改变 rollout 的数据分布,因此它的偏置最终会被数据和梯度消化掉。
- 残差表示是两边的接缝:物体中心的观测加上残差动作空间,让基础模型负责「往哪里探索」、强化学习负责「偏多少才抓得住」,字母 O 的边缘抓取就是最直观的例子。
- 探索频率不需要精调:$\epsilon$ 在 0 到 0.5 之间训练都能稳定收敛,20% 附近达到峰值(短程 $0.79 \pm 0.06$);一旦超过 50%,在线数据占比不足会让训练发散,降到 $-0.29 \pm 0.98$。
- 长程任务的收益最大:短程任务上纯强化学习只是不稳定(0.56 且方差 0.40),长程任务上则完全不收敛,这正是语言模型先验价值最高、也是最能体现方法差异的场景。
- 泛化来自表示而非规模:观测空间由视觉语言模型压缩成物体中心表示后,仿真中学到的策略对真实相机噪声与光照变化更不敏感,零样本真机短程 66.6%、长程 40%。
- 低级错误率同步下降:短程无重叠场景下的低级错误率从关闭探索时的 0.32 降到 0.14,说明语言模型引导的探索不只是让训练更快,也让行为更稳。
局限性
- 场景覆盖有限:只验证了桌面的抓取与放置,而且单个任务内的物体数量与类别是固定的,尚未扩展到更广的机器人操作任务。
- 只能纠正低级错误:系统能修正低层动作偏差,但对高层错误(例如选错了物体)无能为力,而这类错误在仿真中本就罕见,因此缺乏训练信号;作者把这一点列为最主要的未来方向。
- 真机成功率仍有限:零样本迁移的短程成绩是 66.6%、长程 40%,颜色与深度感知噪声仍造成明显的仿真到真实落差。
- 依赖大模型接口:仍需要 GPT-4 / GPT-4V 生成与评估候选策略代码,虽然用离线批量筛选替代了逐步在线调用,但存在模型可用性与成本约束。
- 论文自身的可改进点:主表长程允许重叠场景的低级错误率写作 "0.22 ± 0.9",标准差与量级明显不符,疑似应为 0.09;正文称探索频率取值从 0.0 到 0.9,但表中只列出 7 档,缺少 40、60 与 80;另外「the unseen letter `C'」一处的引号使用了反引号加单引号。
常见问题(FAQ)
ExploRLLM 与 RLingua 这类工作有什么本质区别?
RLingua 用大语言模型生成的规则控制器去正则化强化学习策略,让策略向语言模型靠拢;ExploRLLM 只把语言模型的动作当作探索动作,不把策略拉向语言模型。前者会继承语言模型的偏置,后者把纠正权完整留给强化学习。
为什么低层动作要按可供性热图采样,而不是取最大值的点?
因为语言模型给出的热图本身就可能是错的——论文的例子是抓取字母 O 时热图高值落在空心处,真正可行的抓取点在边缘。采样保留了随机性,能产出反例样本,而强化学习恰好可以从奖励中把这些次优纠正过来;取最大点则会把错误固化成确定性策略。
探索频率 ε 需要仔细调吗?
不需要。论文扫了 7 档频率乘以 6 个随机种子,$0 < \epsilon \le 0.5$ 之间训练都能稳定收敛且差别不大,20% 附近最好;只有把探索推到 0.5 以上(70%、90%)才会因为在线数据比例不足而发散。
训练时怎么处理真机的视觉检测误差?
训练阶段直接使用仿真真值包围盒中心,但注入标准差为图像块半径一半的高斯噪声,用来模拟 ViLD 这类开放词表检测器的位置不确定性,真机评测时才真正启用 ViLD 在线检测。
为什么长程任务的提升比短程更明显?
长程任务需要在多个字母与碗之间完成全部配对,成功样本极其稀少。短程任务里纯强化学习只是不稳定(成功率 0.56 且方差高达 0.40),长程任务里它 75k 步内根本不收敛;语言模型引导的探索把智能体带到原本很难自己碰到的状态区域,因此在这里的价值最大。
这套方法能直接部署到真机吗?
可以,但成本主要在训练侧。策略在仿真中训练完成后直接部署到 Franka Panda 上做零样本评测,短程任务对已见字母达到 66.6%、对未见的字母 C 达到 53.3%,长程为 40% 与 33.3%;主要风险来自深度与颜色感知噪声,以及无法修正的高层错误。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2403.09583
- 项目网站(含视频与说明):https://explorllm.github.io
- 后续工作 LLM-TALE(ICRA 2026):https://arxiv.org/abs/2509.16615
- 关键基线 Code as Policies(ICRA 2023):https://arxiv.org/abs/2209.07753
- 关键基线 Socratic Models(ICLR 2023):https://arxiv.org/abs/2204.00598
- 关键基线 Inner Monologue(CoRL 2023):https://arxiv.org/abs/2207.05608
- 关键基线 CLIPort(CoRL 2022):https://arxiv.org/abs/2109.12098
- 同期工作 RLingua(RA-L 2024):https://arxiv.org/abs/2403.06420
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)