你有没有想过这样一个场景:机器人伸出手,稳稳地抓住一个面包,把它放进篮子里,任务完成,屏幕上跳出一个绿色的对勾。
但如果你凑近看那个面包,会发现它已经被捏得凹陷变形,像被人用力攥过一样。
机器人不知道这件事。评分系统也不知道。因为几乎所有机器人操作的评测标准,只关心一件事:任务完不完成。至于完成的过程中,那个面包、那块豆腐、那个软塑料玩具经历了什么,没人记录,也没人打分。
这就是一群来自清华大学、卡内基梅隆大学、香港大学等机构的研究者们想要解决的问题。他们做了一件听起来朴素、做起来极其繁琐的事:给机器人配上"触觉",同时在它看不见的地方装一双"眼睛",专门盯着物体到底被压成什么样了。这套系统叫做 SoftVTBench。
任务成功,不等于做得好
先说清楚这件事为什么重要。
在传统的机器人操作评测里,无论是早期的 Meta-World、RLBench,还是后来更流行的 LIBERO、RoboCasa,衡量标准几乎清一色是"任务成功率":机械臂有没有把杯子放到指定位置,有没有把积木叠起来。这些基准测试推动了整个领域十年的进步,但它们默认了一个前提:只要东西没坏、没掉,过程怎样不重要。
这个前提在操作硬邦邦的积木、金属零件时基本成立。但一旦你要处理面包、水果、医用软组织这类会变形的东西,问题就暴露出来了:一个机器人可能因为抓得太松而让物体滑落,这是失败;但它也可能因为抓得太紧,把物体捏得面目全非,同时还是把它放到了目标位置,这在传统评测里,记为成功。
这两种失败模式,松滑和过压,在任务成功率这一个指标上完全无法区分。你只能看到一堆绿色的对勾,却不知道这些对勾背后,有多少是真正"温柔地"完成了任务,有多少是靠蛮力硬压过去的。
这在食品加工、软包装、医疗材料等领域是致命的。想象一下,如果一个物流机器人被训练来分拣鸡蛋,评测系统只关心鸡蛋有没有到目的地,而从不检查鸡蛋在运输过程中有没有被捏裂,你会敢把这样的系统部署到真实产线上吗?
这就好比一个新手司机开车,你只看他有没有把车开到目的地,却从不检查他一路上有没有急刹车、有没有蹭到马路牙子。如果不检查这些细节,你永远不知道这个司机的驾驶习惯到底安不安全,你以为自己在评估"开车技术",实际上只评估了"到没到"。
要解决这个问题,光靠加一个新指标是不够的。研究者们意识到,真正缺失的是一份完整的记录:一次操作过程中,既要让机器人"看得到"接触瞬间发生了什么(这样它才能学会怎么调整力度),又要独立记录物体本身实际发生了什么形变(这样评测者才能判断它做得好不好),而且这两份记录必须是分开的,不能让机器人靠触觉数据自己给自己打分。
这就是 SoftVTBench 存在的理由。
触觉,是机器人看不见的那一半世界
先说说什么是视觉-触觉数据集,以及为什么触觉这么重要。
> 视触觉(Visuo-Tactile):同时包含视觉图像和触觉传感器信号的多模态数据,触觉部分通常记录的是指尖与物体接触时的压力分布、形变图案和局部滑动信息。
摄像头能看到机器人靠近物体、抓住物体、把物体搬到目标位置的全过程,但恰恰在最关键的"抓住"这一瞬间,视觉会失效。因为一旦手指包裹住物体,摄像头能看到的往往只是手指的外壳,里面到底压力多大、物体有没有开始变形、有没有打滑,视觉是看不到的。
这就好比你隔着手套去感受一个鸡蛋的软硬,你能看到自己的手在动,但看不到鸡蛋壳到底有没有开始出现裂纹的应力。你需要的是手套内侧那层能感知压力的皮肤,而不是外面那双眼睛。
这正是触觉传感器要补上的那一块。SoftVTBench 用的是模拟版的 GelSight Mini 传感器,每个指尖能生成两种信号:一张"触觉RGB图像",记录接触区域的光学形变纹理;还有一个"标记点运动场",记录指尖内部那些微小标记点在接触瞬间如何被推挤、拉伸,从而反推出局部的剪切力和滑动趋势。
> 标记点运动场(Marker Motion Field):触觉传感器内部布满微小标记点,当物体接触指尖并产生压力或滑动时,这些标记点会随之位移,通过追踪它们的位移轨迹可以推算出接触区域的力学状态。
论文里给出的一张图特别直观:十种不同的软质物体,比如白色卷心面包、熊猫脸面包、软方块、软球,在被抓取的瞬间,它们的触觉图像和标记点场都长得完全不一样。有的物体接触面大、压力分散,标记点几乎不动;有的物体接触面小、压力集中,标记点会明显朝一个方向偏转。这些细微的差异,从外部摄像头的画面里根本看不出来,机器人如果只靠"看",是无法察觉这些区别的。
一份数据,两条互不相通的暗线
SoftVTBench 的核心设计,是让每一次机器人操作,同时生成两条数据流,而且这两条流必须严格分开。
第一条叫"策略可见流"(policy-visible stream),包含多视角RGB图像、双指触觉RGB和标记点运动、机械臂本体状态(关节角度、末端位置)、语言指令,以及机器人实际执行的动作。这条流是喂给AI策略去学习的素材,机器人训练和推理时能接触到的所有信息都在这里。
第二条叫"评测专用流"(evaluator-only stream),包含物体的有限元(FEM)节点位置、物体姿态、接触事件、掉落事件。这条流在整个训练和评测过程中,机器人永远看不到,它只用来给评测系统打分。
> 有限元法(FEM, Finite Element Method):一种把连续物体切分成大量微小网格单元,通过追踪每个网格节点的位置变化来精确模拟物体形变的数值方法,常用于工程仿真中计算材料的应力应变。
为什么一定要严格分开这两条流?因为如果机器人能访问到自己被打分用的那把"尺子",它就可能学会"应付考试"而不是真正解决问题,就像一个学生如果提前拿到了标准答案,他做题的正确率会很高,但这并不代表他真的学会了。触觉信号是给机器人用来"感受"接触状态的,而形变数据是给裁判用来"判断"接触结果的,这两者的角色完全不同,混在一起用会破坏整个评测的公正性。
这个设计思路让我想起一个很朴素的类比:你去考驾照,教练车上装了辅助摄像头帮你判断车距,这没问题,因为这是你开车时能用的信息;但如果考官打分用的行车记录仪画面提前给你看了,那你就可能学会针对考官的评分标准做小动作,而不是真正学会安全驾驶。如果不把这两套系统分开,你测出来的永远是"应试能力",而不是真实水平。
围绕这两条流,SoftVTBench 一共收集了 4000 条专家示范轨迹,覆盖 40 个抓取放置任务,分布在四个诊断性任务组里:物体-软体、空间-软体、物体-刚体、空间-刚体。每组各有10个任务、1000条示范。
物体组固定场景布局,只变换被操作的物体本身,用来测试机器人对不同几何形状、软硬程度的适应能力;空间组则把两个外观完全相同的物体放进同一个场景,靠语言指令区分抓哪一个,用来测试机器人的目标定位能力。而"刚体"组用的是和软体版本几何、纹理、质量完全一致,但被人为调高了刚度、几乎不会变形的"孪生物体"。
这个"孪生物体"设计非常关键,它相当于一个对照实验。如果一个策略在软体版本上表现差,你没法判断这是因为它不擅长应付形变,还是因为它本身就不擅长这个任务(比如场景太复杂、语言指令太模糊)。有了外观完全一样、只是硬度不同的孪生版本做对比,你才能把"形变带来的额外难度"这个变量单独抽离出来。
怎么给"温柔程度"打分
有了数据,接下来的问题是:怎么量化"这次操作有没有把物体压坏"?
论文的做法是,在物体内部铺满一张三维有限元网格,追踪网格中每一个节点在整个操作过程中的位移。但光看节点位移是不够的,因为物体被抓起来搬走的时候,整体也会移动、旋转,这种"刚体运动"不算形变。所以研究者先把整体的平移和旋转从位移里剔除,只留下"去除刚体运动后"的残余位移,这才是真正的形变量。
再往下一步,不同大小的物体,同样1毫米的凹陷代表的严重程度是不一样的。一个拳头大的面包被压进去1毫米可能没什么,但一个只有指甲盖大小的软球被压进去1毫米可能已经严重变形了。所以研究者用物体初始包围盒的对角线长度做归一化,让"形变严重程度"这个数字在不同大小的物体之间具有可比性。
这个归一化处理,像是你去医院验血,报告单上不会直接告诉你血糖的绝对数值有多"吓人",而是会给你一个参考范围,告诉你这个数值相对于正常范围偏高还是偏低。同样1个单位的形变,在一个巨大的南瓜面包上可能微不足道,在一个精致小蛋糕上可能已经严重到不可接受,归一化就是把这个"相对严重程度"算出来。
> 归一化位移峰值(Peak Normalized Deformation, $R_{max}$):整个操作过程中物体形变量的最大值,除以该物体预先校准好的容忍阈值,得到一个统一的、可跨物体比较的严重程度指标,大于1就意味着超出了安全范围。
那么这个"容忍阈值"又是怎么定出来的?研究者设计了一套"预先校准"流程:在任何策略开始训练之前,先让一个脚本化的抓取程序,从松到紧逐渐调整夹爪的闭合程度,反复测试。第一个能稳定托举物体不打滑的闭合力度,定义为下限;而形变容忍阈值,则取所有稳定抓取中形变量的第90百分位数;能保持在这个容忍阈值以内的最紧闭合力度,定义为上限。
这一步的关键在于时间顺序:校准发生在任何策略训练之前,用的是纯粹的物理探测,不掺杂任何被评测策略的行为。这就保证了裁判的评分标准不可能被运动员事后动手脚,标准是提前锁死的,谁也没法通过调整策略去"迎合"评分标准变宽松。
一个指标,拆穿了"假成功"
有了这套形变量化和校准体系,研究者提出了整个基准测试的核心指标:形变感知成功率(Deformation-aware Success Rate, DSR)。
> 形变感知成功率(DSR):一次操作只有同时满足"完成了任务"和"整个过程中形变峰值没有超过校准阈值"这两个条件,才被记为成功;与之相对的普通任务成功率(TSR)只看任务有没有完成,不管过程中物体被压成什么样。
两者之差,TSR减去DSR,恰好就是"看起来成功、实际上把东西压坏了"的那部分比例。
研究者用三种主流的机器人操作策略做了实验:Diffusion Policy(扩散策略,一种从头训练的视觉运动策略)、π0.5(一个基于视觉语言动作模型微调而来的策略)、FastWAM(一种更新的"世界-动作模型")。每种策略都训练了纯视觉版本和视觉-触觉融合版本,在物体组和空间组的软体任务上分别测试。
结果是,在全部12种"分布内"配置里,没有一个是干净的。也就是说,不管用哪种策略、哪种输入方式,在训练数据覆盖的正常场景下测试,都会出现"任务完成了,但物体被过度压缩了"的情况。最严重的一例是 Diffusion Policy 的视觉触觉版本,在物体组任务上,TSR是40.0%,DSR只有30.4%,差了9.6个百分点,这意味着这个策略"成功"的案例里,有将近四分之一其实是靠蛮力压出来的。
这就好比你雇了一个搬家工人,他号称"没有一件家具在搬运过程中损坏",但如果你事后拆开箱子检查,发现里面四分之一的箱子其实是被压瘪了,只是外观看起来完好。如果不打开箱子检查,你永远不会知道这个工人真实的操作水平。
有意思的是,三种策略在这个"隐藏违规率"上表现差异巨大。Diffusion Policy 的违规比例在10%到24%之间波动,π0.5是8%到20%,而FastWAM 只有0.7%到6.5%。尤其是在两个空间组任务上,FastWAM 的TSR和DSR几乎完全重合,差距不超过0.4个百分点,也就是500次测试里最多只差2次,同时它还拿到了整张表里最高的完成率。这说明,"完成任务"和"温柔完成任务"这两件事,不是天然对立的,只是很多策略还没学会同时兼顾。
软的东西真的更难操作吗
一个很自然的问题是:操作软体物体,到底比操作硬体物体难多少?
这正是"孪生物体"设计能派上用场的地方。研究者对比了同一个策略在软体和它的刚体孪生版本上的任务成功率差异。
结果出乎意料地不统一。在"物体组"任务(考验适应不同几何形状的能力)上,π0.5 从刚体切到软体,成功率暴跌18.4个百分点(从60%降到41.6%),这个差距足够大,可以确定就是"变形"这件事本身造成的额外难度。但同样的对比放到 Diffusion Policy 和 FastWAM 身上,差距只有2.6和2.0个百分点,小到根本无法确定是不是真实存在的影响,很可能只是测试噪声。
更反常识的是"空间组"任务(考验语言指令定位目标物体的能力)上,差距的方向直接反过来了:FastWAM 在软体版本上反而比刚体版本高出12个百分点,Diffusion Policy 高出1.6个百分点。
这意味着,"形变"本身并不必然让任务更难。在某些任务结构里,真正决定难度的可能根本不是物体软不软,而是别的因素,比如目标定位准不准。如果只用一个笼统的"软体基准测试",你根本无法把这两种因素拆开,你会误以为所有困难都来自"物体是软的",但真相可能是别的东西在拖后腿。
不过这里有两个需要说明的前提。刚体组的视觉触觉数据是从连续控制的策略权重里直接解码出二进制夹爪指令得到的,而不是原生训练出来的,所以这部分对比结果只能算辅助佐证,不是主要证据。另外,Diffusion Policy 本身不支持语言条件输入,所以在空间组任务里,当两个外观相同的物体只能靠语言指令区分时,它天生就没法分辨该抓哪一个,这部分的空间任务表现存在结构性缺陷,不能简单归咎于形变。
触觉带来的提升,可能只是"抓得更细"的错觉
这一部分的发现,可能是整篇论文里最容易让人产生误判的地方。
假设你想验证"触觉传感器有没有用",一个很直观的做法是:训练一个只用视觉、用二进制指令(只有开和合两种状态)控制夹爪的策略,再训练一个同时用视觉和触觉、用连续指令(可以精细控制闭合程度)控制夹爪的策略,对比两者的表现。如果视觉-触觉版本更好,你可能会得出结论:触觉传感器有帮助。
但这个对比其实同时改变了两个变量:一个是有没有触觉输入,另一个是夹爪控制精度是二进制还是连续的。你根本分不清提升到底来自哪一个。
SoftVTBench 的做法很聪明:它在数据采集阶段,就把每一次夹爪动作,同时记录成二进制和连续两种编码形式。这样研究者就能把"输入模态"和"控制粒度"这两个因素交叉组合,产生四种配置:纯视觉+二进制、纯视觉+连续、视觉触觉+二进制、视觉触觉+连续,然后分别测试。
结果非常清楚地拆穿了一个可能的误判。以π0.5在物体组任务上为例,从"纯视觉+二进制"这个基线出发,单独把控制粒度换成连续(纯视觉+连续),任务成功率提升了11.4个百分点;单独加入触觉、保持二进制控制不变(视觉触觉+二进制),提升了10.8个百分点,几乎一样大。但如果把两者都换上(视觉触觉+连续),成功率是41.4%,和只换连续控制那一版(41.6%)基本没有差别。
这说明什么?说明如果有人只对比"纯视觉+二进制"和"视觉触觉+连续"这两个极端配置,得出"触觉传感器让成功率提升了11个百分点"的结论,其实是把控制粒度带来的提升,全部错误地归功给了触觉。
这就像你测试一款新跑鞋能不能让你跑得更快,如果同时换了跑鞋和跑道(比如从沙地换到了塑胶跑道),你测出来的成绩提升,可能大部分来自跑道,而不是鞋子。如果不把这两个变量分开测,你永远没法知道鞋子本身到底值不值这个钱。
而且这个实验还揭示了一个更微妙的地方:哪怕两个配置的任务成功率几乎一样,它们的"温柔程度"可能天差地别。"纯视觉+连续"和"视觉触觉+二进制"这两组,在TSR上只差0.6个百分点,几乎没区别,但DSR上却差了10.4个百分点(38.4%对28.0%)。也就是说,"纯视觉+连续"这一组的成功案例里,只有7.7%是靠蛮力压出来的;而"视觉触觉+二进制"这一组,这个比例高达31.7%。仅仅看任务完成率,你完全看不出这两者的巨大差异。
触觉在什么时候真正有用:分布外测试的答案
那么触觉传感器到底有没有用?答案藏在"分布外"(out-of-distribution, OOD)测试里。
> 分布外测试(Out-of-Distribution, OOD):把训练时从未见过的环境变化,比如更换灯光亮度、改变物体质量、改变物体材质硬度,应用到测试场景中,用来检验策略是不是死记硬背了训练数据,还是真正学到了可泛化的能力。
研究者设计了9种单一变量的分布外扰动:灯光强度从135调到67.5、180、270三档;物体质量放大到1.25倍、1.75倍、2.5倍;材质弹性模量缩放到0.5倍、0.8倍、2.0倍。每次只改变一个因素,其余条件保持和训练时一致,这样测出来的结果变化,才能明确归咎到那一个被改变的因素上。
在这9种分布外条件下汇总测试,视觉-触觉版本在全部6组"策略×任务组"对比中,任务成功率都超过了纯视觉版本;在形变感知成功率上,6组里有5组也是视觉-触觉版本更好。用统计学上的符号检验来看,6组全部一致的情况,概率只有1.6%,是一个相当有说服力的信号。
但反观分布内测试(也就是训练数据覆盖范围内的正常测试),同样的对比却是各打三十大板:视觉-触觉版本在6组里只赢了4组,输了2组,这种胜负比例更接近随机波动,说不上谁更强。
这个反差挺耐人寻味的。触觉传感器的价值,似乎不在于让策略在"熟悉的场景"里表现得更好,而在于让策略面对"陌生的变化"时更加稳健。这也许可以理解为:触觉信号提供的是接触瞬间才出现的、视觉难以捕捉的补充信息,当外部环境发生视觉层面的干扰(比如换了灯光)或者物理层面的干扰(比如物体变重了)时,这些干扰有的会直接影响视觉判断,有的却完全不影响触觉感受,这时候多一路信息来源,就能起到"以防万一"的保险作用。
但保险也不是没有代价的。论文发现,在分布外场景下,加入触觉信息之后,原本"TSR和DSR差距就比较大"的策略,这个差距反而进一步拉大了。比如 Diffusion Policy 的这个差距,从物体组的2.6个百分点扩大到6.2个百分点,空间组从2.2扩大到7.4。也就是说,触觉带来的完成率提升,并不总是伴随着形变控制的同步提升,有时候策略学会了"用触觉信息硬撑着完成任务",但没有学会"用触觉信息判断该不该松手"。
唯一的例外还是FastWAM,不管在哪种模态下,它的TSR和DSR在所有汇总对比中都保持在1个百分点以内的差距,这说明触觉带来的稳健性提升,是可以做到不以牺牲操作质量为代价的,只是目前大多数策略架构还没有做到。
这套系统和之前的基准测试有什么不一样
如果你回顾整个机器人操作评测领域的发展脉络,会发现每一代基准测试都在补上前一代缺失的维度。
Meta-World、RLBench 这类早期基准建立了多任务、语言指令条件下的标准评测框架,但它们主要用刚体物体,只看任务完不完成。SoftGym、PlasticineLab 这些后续工作把可形变物体引入了仿真环境,但很多时候"让物体变形"本身就是任务目标(比如把黏土捏成指定形状),而不是"完成一个和形变无关的任务,同时避免过度形变"。
再往后,像 VTDexManip、ManiFeel 这些工作开始把触觉传感器接入策略输入,但它们评测触觉带来的好处,依然是通过任务成功率这个单一维度,而没有独立记录物体的物理形变状态。
最接近 SoftVTBench 的一篇工作叫 Tabero,它评测语言引导下的"温柔操作",用闭环力反馈来约束交互质量,但它测的是刚体物体上的接触力,而不是软体物体真正的形变量,所以只能算部分实现了这个思路。
SoftVTBench 第一次把"完整的多阶段任务、三维体积形变物体、机器人可见的触觉输入、评测者专用的隐藏物理状态"这四件事同时凑齐了。这不是简单地把已有的几个想法拼在一起,而是找到了一个此前被普遍忽略的空白区域:大家要么让机器人看得到触觉但测不到真实形变,要么测得到形变但只测单次抓取而不是完整任务。
这类工作往后大概率会朝着两个方向延伸。一个是把评测范围从模拟环境扩展到真实世界,毕竟论文自己也坦诚地说明,目前用的触觉渲染管线(TacEx、Taxim、FOTS)虽然各自在原论文里都验证过和真实GelSight传感器的仿真-现实一致性,但那是在各自的实验条件下,并不等同于SoftVTBench这套特定资产、材质、渲染参数在真实机器人上也同样成立。另一个方向,则可能是把这套"完成任务+形变合规"的双重评测思路,推广到更多种类的柔性物体操作场景里,比如布料折叠、绳索打结,这些领域目前的基准测试依然停留在"完成度"这个单一维度上。
写在后面
这篇论文里最让我意外的一点,是那个"控制粒度和触觉传感器混淆"的发现。
在此之前,我一直下意识地觉得,只要给机器人加上触觉传感器,它就应该表现得更好,这几乎是个不言自明的常识。但SoftVTBench 用一个很干净的交叉实验证明了,很多我们以为是"触觉的功劳",其实只是因为顺带把控制方式从粗糙的二进制换成了精细的连续调节。如果不做这种拆解,几乎所有宣称"触觉有用"的论文,都可能在无意中把两种改进混在了一起说。
这让我想起一件事:很多所谓的技术优势,其实是几个变量同时改变造成的错觉,只有把变量一个一个拆开测,才能知道钱到底花在了哪儿。这不只是机器人研究里的问题,任何一个"我们换了新方案,效果变好了"的说法,背后都值得多问一句:到底是哪个具体改动起了作用?
还有一个细节值得单独提一句:研究者们发现FastWAM能同时做到"完成率最高"和"违规率最低",这说明"完成任务"和"温柔完成任务"之间并不存在必然的取舍。这多少让人松了口气,如果真相是"越温柔的策略必然越慢、越笨",那这个领域的前景会很悲观。但既然存在一个策略能两者兼得,这至少说明这是个可以攻克的工程问题,而不是一堵天然的物理墙。
如果这套评测体系被更广泛采用,不知道会不会倒逼更多研究团队去重新审视自己那些"任务成功率提升了"的论文里,到底藏着多少个被压碎的面包。
Q&A
Q1:SoftVTBench 是什么?
A:SoftVTBench 是一套面向可形变物体操作的视觉-触觉数据集和闭环评测基准,包含4000条专家示范轨迹,覆盖40个抓取放置任务,核心创新是提出了形变感知成功率(DSR)这个指标,只有任务完成同时形变没超标才算真正成功。
Q2:为什么光看任务成功率不够,还要专门测物体形变?
A:因为一个机器人可能靠抓得过紧、把物体压变形来"硬撑"完成任务,传统的任务成功率指标看不出这种情况。论文发现,三种主流策略在全部12种测试配置里,都存在"任务完成但形变超标"的隐藏问题,占比从0.7%到24%不等。
Q3:给机器人加触觉传感器真的有用吗?
A:在分布外(遇到没见过的光照、材质变化)场景下,加触觉的版本在6组对比中全部提升了任务成功率,5组提升了形变合规率,说明触觉更适合提升稳健性。但在正常场景下,加触觉带来的提升并不稳定,而且部分被误认为的"触觉优势"实际上是夹爪控制方式变精细导致的。