摘要
本文解读 ICLR 2025 论文《HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation》。该论文提出分层视觉语言动作模型 HAMSTER,通过融合高层 VLM 的二维路径预测、低层三维策略的精确执行与多源离线数据的统一表示,解决机器人操作中泛化能力与操作精度长期对立的问题,其特别之处在于把视觉语言模型的输出从关节动作换成一条画在图像上的二维末端轨迹,使仿真数据、其他机器人的真机数据甚至人手草图都能成为监督信号。实验表明在真实机器人上,HAMSTER 相对 OpenVLA 在七个泛化轴上平均提升 20 个百分点(相对增益 50%),平均超过单体 VLA 约 2 倍、超过纯 3D 模仿学习策略约 3 倍,为具身智能如何低成本利用跨域数据提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 高层 VLM 与离线数据
- 低层策略与路径条件化
- 训练细节
- 实验设计与结果
- 评测协议
- 真机主结果
- 提升来自分层,不是数据量
- 换相机角度也不塌
- 高层 VLM 本身的路径质量
- 通用能力与路径表示消融
- 失败模式:两种低层策略的瓶颈完全不同
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- HAMSTER 和 RT-Trajectory 有什么区别?
- 为什么一定要分层?直接把 VLM 微调成输出动作不行吗?
- 二维路径这种中间表示会不会信息量太少?
- 高层 VLM 需要域内的真机数据吗?
- 这套方法能配不同的低层策略吗?
- 模型规模有多大,推理成本如何?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation |
| 标题(中文) | HAMSTER:用分层动作模型打通开放世界机器人操作 |
| 作者 | Yi Li、Yuquan Deng、Jesse Zhang、Joel Jang、Marius Memmel、Raymond Yu、Caelan Reed Garrett、Fabio Ramos、Dieter Fox、Anqi Li、Abhishek Gupta、Ankit Goyal(前三位为共同一作;Anqi Li、Abhishek Gupta、Ankit Goyal 为共同指导;Yi Li 为项目负责人) |
| 机构 | NVIDIA · University of Washington · University of Southern California |
| 会议 | ICLR 2025(Poster) |
| arXiv | arXiv:2502.05485 |
| 项目网站 | hamster-robot.github.io |
背景与动机
机器人操作长期被一个矛盾卡住:想要开放世界的语义泛化,就得用大的视觉语言模型(VLM);想要毫秒级的精确控制,就得用小的三维策略模型。二者在单体 VLA 模型里被强行绑在一起——RT-2、Octo、OpenVLA、$\pi_0$ 都是把预训练 VLM 直接微调成动作预测器。
这条路线有两个代价。第一,它必须依赖昂贵的真机「观测-语言-动作」三元组,因为动作标签只能在真机上采集;论文用一句话点破问题的本质:机器人数据"typically obtained through expensive on-robot operation"。第二,推理频率被大模型锁死——OpenVLA 的 70 亿参数模型在 RTX 4090 上只有 6 Hz,而精细操作往往需要远高于此的控制频率。
另一条路线的代表是三维模仿学习策略,例如 PerAct、RVT-2、Act3D 与 3D Diffuser Actor。它们数据高效、几何鲁棒、能完成接触丰富的灵巧任务,但对语义描述与环境外观的变化非常脆弱,而且很难利用仿真数据——仿真与真机在外观和动力学上的差距太大。
论文由此提出一个设问:能不能把大模型的泛化能力与小策略模型的效率、局部鲁棒性和灵巧性结合起来?答案是引入一条中间接口。VLM 不再直接输出动作,而是输出一条粗略的二维路径;低层三维策略跟着这条路径走。这条路径恰好满足三个条件:能从图像序列廉价获得、基本与本体无关、对动力学细节不敏感——因此仿真轨迹、其他机器人的真机轨迹、乃至人手绘制的草图,都可以变成训练信号。
值得注意的是,轨迹条件化本身并不新鲜。RT-Trajectory 最早提出用轨迹草图作为任务规格来条件化策略,但它关心的是"怎么用轨迹来指定任务",而且只轻量尝试过让预训练 VLM 直接生成轨迹(零样本提示)。HAMSTER 关心的是一个不同的问题:轨迹由谁生成、吃什么数据训练。这一转向把中间表示的选择变成了一个跨域数据可用性问题——也是全文真正的贡献所在。
研究主线:从问题到结论
基准/方法设计
HAMSTER 的全称是HierarchicalActionModels withSeparaTEd PathRepresentations。它的核心判断是:接口选得越窄,能被便宜数据监督的部分就越大。
系统的两半各司其职。高层 VLM 以 VILA-1.5-13B 为基座微调,输入一张单目 RGB 图像与语言指令,输出一条二维路径;低层策略以这条路径为条件,同时接收深度图、点云与本体感受——这些模态恰恰是高层 VLM 无法消化的。因为路径只在回合开始生成一次,高层模型规模与低层控制频率彻底解耦。
分类全景
方法细节
高层 VLM 与离线数据
高层 VLM 预测的二维路径 $p=[(x_t,y_t,\mathrm{gripper}_t)]_t$,其中 $x_t,y_t\in[0,1]$ 是末端执行器(或人手)在图像上的归一化像素坐标,$\mathrm{gripper}_t$ 是夹爪开合的语言标记。形式上即 $\hat{p}\sim \mathrm{VLM}(\mathrm{img},z)$。
训练数据被统一成同一种「图像 + 指令 → 点序列」的问答形式,共四类来源:RoboPoint 的77 万条像素点预测(回答"物体在哪")、RLBench 的约32 万条仿真机械臂轨迹(回答"做什么、怎么做")、Bridge 与 DROID 的约11 万条真机轨迹(回答"在真机上怎么做"),另加66 万条通用视觉问答做共训以保留世界知识。四类数据等权混采,训练目标是最大化答案的对数似然 $\log \mathrm{VLM}(\mathrm{ans}\mid \mathrm{img},z)$。
一个容易忽略但很关键的工程细节是路径简化。仿真与真机提取出的路径常常超过 100 步,直接用会让 VLM 陷在低层尺度上。作者用 Ramer–Douglas–Peucker 算法(容差 $\epsilon=0.05$)把路径压到2–5 个点,使模型把注意力集中在夹爪开合点的定位上。消融显示:在 VILA1.5-3B 这类小模型上,RDP 简化显著优于固定 20 点采样;放大到 130 亿参数后两种表示都能做对。
低层策略与路径条件化
低层策略的形式是 $\pi_\theta(a\mid s,o,z,p)$。路径进入策略的方式非常直接:把每个 $(x_t,y_t)$ 用颜色渐变连成折线,渐变色表示时间推进;夹爪状态变化用圆圈标记,绿圆表示闭合、蓝圆表示张开;随后把这条折线叠加到策略看到的所有帧上。
训练细节
论文选用 RVT-2 与 3D Diffuser Actor(3D-DA)两种架构作为低层策略,保持原有架构与超参不变。低层策略在域内用真机遥操作数据训练,路径标签由本体感受投影得到;为了让策略对 VLM 的预测误差鲁棒,训练时给路径坐标叠加 $\mathcal{N}(0,0.01)$ 的高斯噪声(夹爪开合标记不加噪)。
高层 VLM 的训练规模是:8 张 A100(每卡约 65 GB 显存),有效批大小 256,学习率 $1\times10^{-5}$,约 30 小时完成,视觉编码器一并更新。
实验设计与结果
评测协议
真机实验使用 Franka Panda 机械臂,全部数据由人类遥操作采集:抓取放置220个回合(10 个玩具物体)、按按钮50个回合(4 色按钮)、击倒物体50个回合。评测覆盖74个真实任务、共222次试验。评分按子动作累加:抓放按"到达-抓取-移动-放置"每步 0.25 分,按钮与击倒每步 0.5 分。
仿真实验在 RLBench 上训练、在 Colosseum 上评测,涵盖 14 类任务与多种视觉变体,每个配置跑 5 个随机种子。泛化被拆成七个轴分别打分:物体-目标组合、视觉(桌面纹理 / 光照 / 干扰物 / 杂乱 / 混合)、语言(把"糖果"改写成"甜的东西")、空间关系、新物体、多重组合,再加上非抓取任务。
真机主结果
| 任务类型 | RVT-2 | 3D-DA | OpenVLA | HAMSTER+RVT-2 | HAMSTER+3D-DA |
|---|---|---|---|---|---|
| 抓取放置 | 0.28 | 0.19 | 0.46 | 0.79 | 0.78 |
| 按压按钮 | 0.13 | 0.16 | 0.25 | 0.50 | 0.63 |
| 击倒物体 | 0.17 | 0.03 | 0.41 | 0.47 | 0.66 |
总体来看,在考虑显著视觉与语义变化的测试条件下,HAMSTER 平均超过单体 VLA 约2 倍、超过纯 3D 模仿学习策略约3 倍;按七个泛化轴平均是+20 个百分点,即50%的相对增益。
提升来自分层,不是数据量
这是全文最重要的一组控制变量实验。作者把同一份RLBench 仿真数据喂给 OpenVLA,结果真机均分反而从0.58 掉到 0.54——单体 VLA 拿不到跨域数据的收益。换成分层 VLM,同一份数据却能把路径质量与真机泛化同时拉起来。换句话说,收益的来源是架构而非数据规模。
仿真侧的受控对照给出同样的结论。在 Colosseum 上跑 5 个种子取平均,HAMSTER+3D-DA 拿到0.46±0.04,纯 3D-DA 只有0.35±0.04,平均提升31%。作者认为机制在于:用路径绘制图训练让策略盯住路径本身,而不是去拟合无关的视觉特征。
演示效率也翻了一倍:只用50%数据,HAMSTER+3D-DA 就达到0.36±0.04,已经是 3D-DA(0.18±0.10)的两倍;用满数据到0.43±0.05。
换相机角度也不塌
视觉空间推理能力通过更换相机角度来检验。OpenVLA 换视角后成功率从0.60 掉到 0.23;HAMSTER+RVT2 只从0.83 掉到 0.73。
| 方法 | 原相机(成功率 / 完全成功) | 新相机(成功率 / 完全成功) |
|---|---|---|
| OpenVLA | 0.60 / 0.30 | 0.23 / 0.00 |
| HAMSTER+RVT2 | 0.83 / 0.70 | 0.73 / 0.40 |
| HAMSTER+RVT2(拼接) | 1.00 / 1.00 | 0.98 / 0.90 |
一个有意思的发现是:如果把路径作为独立通道与 RGB 拼接(六通道输入)而不是画在图上,成绩会更好——因为 RVT-2 的虚拟重投影会把画在图上的路径切碎。但这个方案要求策略能接受额外通道,而使用预训练 CLIP 图像编码器的 3D-DA 只有三通道,只能用绘制方案。这是通用性与峰值性能之间的真实取舍。
高层 VLM 本身的路径质量
为了评估路径质量,作者请5 位机器人学习研究者对48 组图文对做盲评排名(1 最好、4 最差,数字越低越好):
| 方法 | VLM | 微调数据 | 平均人类排名(越低越好) |
|---|---|---|---|
| RT-Trajectory | 零样本 GPT-4o | 无 | 3.47 |
| RT-Trajectory | Code-as-Policies + GPT-4o | 无 | 3.41 |
| HAMSTER | VILA | 离线数据(不含 RLBench 仿真) | 2.13 |
| HAMSTER | VILA | 离线数据(全量) | 1.40 |
两个结论很关键:其一,零样本路径生成(哪怕用闭源 GPT-4o 并叠加代码即策略)显著不如用跨域数据微调过的开源 VLM;其二,仅仅把低保真的 RLBench 仿真路径加进微调集,真机路径质量排名就从 2.13 提升到 1.40——跨外观域的知识确实被 VLM 吸收了。
通用能力与路径表示消融
微调没有让 VLM 变成"只会画线的专用模型"。在15 个视觉问答与多模态推理基准上,HAMSTER 与基座 VILA1.5-13B 基本持平:VQA-v2 是82.9 vs 82.8、GQA 是64.9 vs 64.3、MMB 是75.3 vs 74.9、MM-Vet 是44.4 vs 44.3,MME 则是1588.4 vs 1569.6。
失败模式:两种低层策略的瓶颈完全不同
按 VLM 路径是否预测正确分类统计后,两种低层策略呈现出截然不同的失败结构:
| 低层策略 | 未跟随路径导致的失败 | 动作执行导致的失败 |
|---|---|---|
| RVT-2 | 72% | 28% |
| 3D-DA | 10% | 90% |
RVT-2 的失败主要来自"跟不住路径",因为它包含虚拟重投影步骤,会把画在图上的路径切碎;3D-DA 的视觉塔直接处理原始二维图像,路径更容易被读懂,因此失败集中在抓取角度等执行环节。这正好解释了为什么 RVT-2 换成独立路径通道(拼接)后收益最大——它的瓶颈本来就在路径解码上。
结果对比总结
关键发现
- 分层才是跨域泛化的成因,不是数据量:同一份 RLBench 仿真数据喂给 OpenVLA,真机均分从 0.58 掉到 0.54;换成分层 VLM 则换来七轴平均 +20 个百分点。
- 窄接口换来数据自由:只让 VLM 输出二维路径,就使仿真数据、其他本体的真机数据、人手草图都能成为监督信号;四类数据合计约 186 万条样本等权混采。
- 覆盖全部三类任务且一致优于基线:抓取放置 0.79 vs OpenVLA 0.46,按压按钮 0.63 vs 0.25,击倒物体 0.66 vs 0.41;整体超过单体 VLA 约 2 倍、纯 3D 策略约 3 倍。
- 演示效率翻倍:仅用 50% 数据,HAMSTER+3D-DA 达到 0.36±0.04,已是 3D-DA(0.18±0.10)的两倍。
- 低保真仿真可迁移到真机:把 RLBench 仿真路径加入微调集,真机路径质量的人类排名从 2.13 提升到 1.40。
- 通用能力没有退化:在 15 个 VQA / 多模态推理基准上与基座 VILA1.5-13B 持平(VQA-v2 82.9 vs 82.8),微调没有把它变成只会画线的专用模型。
局限性
- 只有 2D,没有原生 3D:路径活在图像平面上,VLM 并不具备真正的空间三维理解;"这个点在物体上方还是后方"的歧义会直接造成执行错误。
- 接口带宽受限:坐标加夹爪开合无法传达力、旋转等细节,长时域与接触丰富的任务需要更多次查询或更强的中间表示。
- 执行中不重规划:路径在回合开始只生成一次,若场景在执行中显著变化,模型既不能更新轨迹,也无法重新识别最初指向的物体。
- 离线标注仍需人工介入:Bridge 数据集没有相机外参,需要人工点选夹爪中心做 PnP 估计;DROID 则有大量外参噪声,必须按投影深度与 RGB 的对齐质量过滤。
- 作者展望:未来方向是研究可学习的中间接口,并尝试直接从大规模人类视频中训练这类 VLM,让"便宜数据"的边界继续往外扩。
常见问题(FAQ)
HAMSTER 和 RT-Trajectory 有什么区别?
RT-Trajectory 最早提出用轨迹草图作为任务规格来条件化策略,但只轻量尝试过让预训练 VLM 直接生成轨迹。HAMSTER 关心的是另一件事:轨迹由谁生成、用什么数据训练。它把中间表示的选择变成了一个跨域数据可用性问题,并用控制变量实验证明分层本身是泛化的成因。
为什么一定要分层?直接把 VLM 微调成输出动作不行吗?
论文用实测回答了这个问题。把同一份 RLBench 仿真数据喂给单体 VLA OpenVLA,真机均分反而从 0.58 掉到 0.54——单体架构拿不到跨域数据的收益。原因在于动作输出与本体、动力学强耦合,而二维路径基本与本体无关、对动力学细节不敏感。
二维路径这种中间表示会不会信息量太少?
它确实带宽受限。作者在局限性中明确承认:只有 2D 无法表达力和旋转,也不具备原生三维预测,上下前后的歧义会造成执行错误。但换来的是廉价可得的监督信号——路径可以从仿真、其他机器人数据、人手草图中大量获取,精度则交给低层 3D 策略补齐。
高层 VLM 需要域内的真机数据吗?
不需要。HAMSTER 的高层 VLM 完全没有见过部署环境,只用 RoboPoint、RLBench、Bridge、DROID 与通用 VQA 数据微调;低层策略才使用 320 个回合的域内遥操数据。"高层全离线、低层全在线"的分工正是泛化能力的来源。
这套方法能配不同的低层策略吗?
可以,论文验证了 RVT-2 与 3D Diffuser Actor 两种架构,都成立(抓取放置上分别从 0.28 和 0.19 提升到 0.79 和 0.78)。此外路径的注入方式也可以更换:画在图上,或作为独立通道与原图拼接。拼接对 RVT-2 效果更好(新视角成功率 0.98),但它要求策略能接受额外通道,使用 CLIP 图像编码器的 3D-DA 只能用绘制方案。
模型规模有多大,推理成本如何?
高层是 130 亿参数的 VILA-1.5-13B,训练用 8 张 A100、约 30 小时。推理时 VLM 每个回合只调用一次生成路径,低层策略高频跟随,因此高层规模不会直接拖慢控制频率——这是相对单体 VLA(OpenVLA 7B 在 RTX 4090 上仅 6 Hz)的关键优势。
参考链接
- HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation(arXiv 摘要页)
- HAMSTER 项目网站(含真机演示视频与提示词细节)
- OpenVLA: An Open-Source Vision-Language-Action Model(单体 VLA 代表基线)
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches(轨迹草图的开创工作)
- RVT-2: Learning Precise Manipulation from Few Demonstrations(本文低层策略之一)
- RoboPoint: A Vision-Language Model for Spatial Affordance Prediction(点预测数据来源)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)