EgoSteer:一种基于第一人称视角视频、实现可控灵巧操作的全栈系统
2026/8/5 1:27:14 网站建设 项目流程

26年7月来自北大、灵初智能和UPenn的论文“EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos”。

“可操控性”(Steerability)是通用机器人策略的关键能力,但由于缺乏大规模、语言对齐且动作精准的演示数据,这一能力在灵巧手系统中长期缺失。为突破这一瓶颈,提出一套全栈系统,实现基于人类第一人称视角(egocentric)视频的灵巧手 VLA预训练,并支持数据高效的真实机器人后训练。该系统集成以下组​​件:EgoSmith——一个将野外场景下的第一人称视频转化为 9600 小时高质量预训练数据的流水线(其吞吐量是此前 SOTA 方案的 9 倍,且精度更高);一套支持遥操作与人在环修正(human-in-the-loop correction)的统一机器人控制栈;以及 EgoSteer——一个基于优化基础设施训练的、由世界模型增强的 VLA 模型。基于人类数据的预训练赋予 EgoSteer 语言引导的操作先验知识,这些知识通过机器人后训练得以落地,并通过 DAgger 算法进一步优化。实验表明,EgoSteer 能够稳健地执行 40 多种不同任务的自由形式指令,展现出故障恢复、灵巧操作及泛化能力。该预训练模型还能通过少样本学习适配(few-shot adaptation)适应复杂的长程任务(如折叠纸盒),在两种不同的机器人形态上均实现超过 75% 的成功率。如图1 所示:


尽管以自我为中心(egocentric)的数据蕴含丰富的细粒度交互信息,且极具通用具身学习(embodied learning)的扩展潜力,但它们通常表现为单目 RGB 视频,存在相机抖动、频繁遮挡及缺乏标注等问题。EgoSmith(图 2所示),这是一个高效的自动化流水线,旨在将海量原始视频转化为带有完整标注的训练样本,从而实现有效学习。

为实现原始数据的清洗、标注及质量控制,EgoSmith 采用一个包含四个阶段的流水线。

第一阶段为预过滤(pre-filtering),利用简单而有效的启发式规则剔除那些会干扰后续 4D 运动估计的片段,例如包含运动(locomotion)的片段或手部误检结果。具体而言,利用光流与以自我为中心视频中人体运动的强相关性,通过计算 128 点网格上的平均光流来滤除包含主动位移(active displacement)的片段。随后,基于 YOLO [44, 45] 检测的手部数量、尺度及坐标信息,应用几何准则剔除存在严重遮挡或旁观者干扰的帧,仅保留清晰可见的以自我为中心操作动作。

第二阶段为 4D 运动估计,该阶段基于最先进的 HaWoR [19] 方法,重建相机外参、深度信息以及世界坐标系下的手部轨迹。鉴于 HaWoR 缺乏深度估计功能且依赖 DROID-SLAM [46] 进行追踪(后者计算开销大,且在头部快速运动或场景剧烈变化时易产生漂移),其提出一种改进方案,使其更具鲁棒性与效率。利用 DPVO [47] 实现更稳定且无需度量尺度(metric-free)的相机追踪与关键帧深度估计,并结合 Any4D [48] 进行逐帧的度量尺度深度预测。通过对齐两者的尺度比率,能够恢复更精确的度量尺度相机轨迹,进而将相机坐标系下的手部动作转换为更一致的世界坐标系轨迹。得益于 DPVO 远超 DROID-SLAM 的运行速度,以及对 I/O 和批处理(batching)的优化,该流水线的吞吐量较 HaWoR 提升 9 倍,从而支持大规模数据处理。

第三阶段为语言标注,该阶段执行多粒度语言标注,这对实现自由形式指令遵循(free-form instruction following)至关重要。首先利用 Qwen3.5-VL-Plus [49] 筛选出缺乏有意义的“手-物”交互操作的片段,剔除另外 3.5% 虽然通过启发式规则但实际缺乏主动操作的视频片段。针对剩余片段,该模型生成从粗到细、包含五个层级的语言指令。这种分层标注同时提供任务级的语义对齐与动作级的时空对齐,使下游模型能够学习并响应不同抽象层级的指令。

第四阶段,后过滤,对生成的数据执行多级质量控制。首先,在episode级别,计算相机平移分布以丢弃异常值,同时应用硬旋转阈值以丢弃头部运动过多的剧集。其次,在块(chunk)级别,将手腕姿势转换为其中间相机框架,将手指关键点投影到逐帧手腕框架中,并丢弃手腕和手指坐标上的空间异常值。最后,在帧(frame)级别,计算相机、手腕和手指运动的帧到帧增量,用硬阈值过滤掉突然的跳跃。这种从粗到细的过滤系统地消除由动作跳跃、不准确的度量尺度或头部跟踪漂移引起的不可靠剪辑,确保高语料库质量。

通过 EgoSmith,在 12 个原始数据集 [35、50、34、33、51、36、52、31、18、17、32、37] 中策划一个大规模的以自我为中心的预训练语料库。为了过滤掉高度重复的视频,对 Egocentric-10K [32] 和 Egocentric-100K [37] 进行二次采样。对于 Ego4D [31] 和 EPIC-KITCHENS [52],将 EgoSmith 应用于它们各自的 VITRA [38] 子集。最终,该管道产生一个完全注释的以自我为中心数据集,包括 960K 小时、209 万集和 104B 帧。


尽管 EgoSmith 提供的精选以自我为中心(egocentric)的数据包含丰富的操作先验知识,但由于视觉、动力学及运动学自由度方面的“具身差异”(embodiment gap),这些数据无法直接迁移到真实机器人上;因此,必须通过真实机器人遥操作将这些先验知识映射到目标机器人的具体形态上。

“统一机器人栈”(Unified Robot Stack,见图 3所示),共享底层控制与动力学模块,从而同时支持遥操作、策略推理以及“人在环”(human-in-the-loop)的纠正干预。

在遥操作模式下,系统利用一对 P​​siBot SynGlove-Air 手套和 Vive 追踪器捕捉操作员手腕位姿及手部关节角度;这些数据分别通过基于 mink [53] 计算的逆运动学(IK)驱动两条机械臂,并通过关节映射驱动两只 6 自由度(6-DoF)机械手。在策略推理阶段,训练好的策略会输出相机坐标系下的手腕位姿轨迹以及手腕坐标系下的手部关键点信息。这些动作指令与遥操作模式共用相同的机械臂与机械手正/逆运动学(FK/IK)及控制节点,从而确保了训练与推理过程中的执行动力学特性保持一致。

实现“人在环”干预的主要挑战在于防止控制权交接时出现状态突变,以确保过渡平滑。为此,提出一种相对运动映射方案。当操作员在时间步 t 踩下脚踏板发出干预信号时,系统会记录下针对每条机械臂/手(索引 i ∈ {1, 2})的机器人末端执行器位姿、人手腕位姿、机器人手部关节状态以及手套状态。

这种设计允许操作员仅通过模仿机器人的运动,即可平滑地接管控制权。在纠正失败动作后,操作员再次踩下脚踏板将控制权交还给策略,从而恢复推理过程。

后续训练仅使用这些干预片段的数据。该设计实现超过 85% 的交接成功率,从而能够高效地收集纠正性演示数据。

基于这一统一机器人架构,构建一个包含 187 小时数据的机器人数据集,涵盖 193 项桌面操作任务,这些任务分属七大类别:简单/中等/困难难度的抓取与放置(PnP)、非抓取式操作、重定向操作、双臂操作以及高接触性操作。数据集包含56项涵盖大多数核心操作原语的常见任务,以及137项旨在促进“人-机”技能迁移与语义落地的长尾任务。研究利用Qwen3-VL-Flash [54] 生成多层级语言标注,并辅以人工核查。为涵盖多样化的操作原语并建立模态对齐,数据采集采用自由形式的方案:环境布局杂乱,且桌布、物体实例及初始配置均随机设定,不预设运动轨迹。这种强调自然、类人执行方式的策略带来极高的数据多样性,从而增强策略的鲁棒性与多任务泛化能力。


为了从人类数据、遥操作及人工修正中有效地学习语言引导的操作任务,提出 EgoSteer——一种结合世界模型(world-model)目标的基于流(flow-based) VLA模型,如图 4 所示。为在建模多模态连续动作的同时确保稳健的视觉-语言理解能力,EgoSteer 结合 Qwen3-VL 2B 主干网络 [54] 与基于 DiT [55] 的动作专家模块;两者通过协同注意机制(joint attention)相互交互,并利用流匹配(flow-matching)技术 [1] 生成动作块(action chunks)。为促进人机间的知识迁移,在两个领域间设计统一的数据格式及状态-动作空间。

一个长度为 N 的片段(episode)τ 表示为 τ = {l, K, (I_t, D_t, Tw2c_t, sw_t, aw_t)},其中 l 为指令,K 为相机内参,t 为时间步,I_t 和 D_t 分别为 RGB 图像与深度图像,Tw2c_t 为世界坐标系到相机坐标系的外参;双手的世界坐标系状态 sw_t 和动作 aw_t 包含双手手腕的 3D 平移、6D 旋转以及 15 维指尖关键点信息。由于本模型不使用深度信息,每个时间步 t 训练样本简化为 {l, K, Ic_t_t−k+1:t, sc_t_t−k+1:t, ac_t_t:t+h−1},其中 k 和 h 分别表示历史窗口长度与预测窗口长度,sc_t_t−k+1:t 是通过 Tw2c_t 转换至当前相机坐标系 c_t 的状态历史序列。相对动作块 ac_t_t:t+h−1 是在相机坐标系 c_t 下相对于 sc_t_t 计算得出的,其中手腕运动表示为相对 SE(3) 变换,手指运动则表示为坐标位移。

此外,为了避免在真实机器人推理过程中出现执行停顿,在动作专家模型中采用训练阶段的实时分块(RTC)[24] 策略。具体而言,将基于随机采样延迟 d 得到的干净动作前缀 a_pre = a_t:t+d-1 作为真值(ground truth),并专门训练专家模型对后续动作序列 a ̃_suf = a ̃_t+d:t+h-1 进行去噪。在部署阶段,机器人会在异步 VLA 推理期间执行预留的前缀 a_pre,并无缝过渡到新的动作块 a_suf,从而避免执行间隙。将模型记为 pi,并利用条件流匹配(CFM)[56] 对其进行训练;具体做法是,在给定上下文 C_t = {l, K, I_t-k+1:t, s_t-k+1:t, a_pre} 的条件下,回归目标动作后缀 a_suf 的线性速度场,其中目标函数 L_CFM(π)。为了扩大有效批次大小并改善损失梯度,针对每个样本随机采样四个 eta 值。

尽管 VLA 在视觉-语言理解方面表现出色,但缺乏对未来的想象能力限制其动作生成的准确性 [16]。为解决这一问题,引入一个世界模型专家(world-model expert)来预测由动作引发的未来 DINOv3 特征 [21]。该专家以真实动作序列 a_{t:t+h-1}、相对相机运动 Delta T 以及长度为 L_z 的可学习查询token)z_0:L_z-1 作为输入,对自身及主干网络(backbone)进行联合注意计算。z 经上采样后的输出通过回归损失(regression loss)与未来帧 I_t+h-1 的 DINOv3 特征进行监督,这种方式相比生成式损失提供更直接且稳定的监督信号。对于配备额外胸部相机的机器人配置,主干网络接收两个相机的历史图像及内参作为输入;专家则接收两者的相对运动信息,并通过向 z 添加不同的相机嵌入(camera embeddings)来回归两组未来的 DINOv3 特征。为了将优化重点集中在主干网络的表征上,该模块仅包含四个 Transformer 层,并以固定间隔对主干网络层进行注意计算,从而引导梯度主要作用于主干网络。关键在于,该专家在推理阶段会被移除,从而避免额外的计算开销。


可控多任务操作与泛化能力测试的设置。 EgoSteer 首先在分辨率为 384×384 的 9600 小时第一人称视角(egocentric)数据集上进行预训练,随后在分辨率为 640×480、利用头部和胸部摄像头采集的 187 小时真实机器人数据集上进行后训练。接着,进行三轮 DAgger 迭代,涵盖 56 个任务并收集 3700 条轨迹,从而获得 8.3 小时的修正数据以优化策略。最后,该策略在 32 个已见任务、4 个组合泛化任务和 4 个未见任务上进行评估。组合任务将已见的基本动作单元(primitives)重新组合成新序列,而未见任务则涉及全新的动作语义。每个任务均在自由形式指令下进行 10 次随机试验,以衡量成功率。

DAgger 后训练有效性实验的设置。仅遥操作数据微调的模型被称为 EgoSteer-FT,而经过三轮 DAgger 迭代优化的模型被称为 EgoSteer-DG。这些模型在四个需要灵巧操作且易失败的已见任务(例如“将手机放置在支架上”)上进行比较。针对每个任务,均采用相同的设置进行 10 次评估试验。

​预训练规模扩展与基线比较的实验设置。分别在 3000、6000 和 9600 小时第一人称视角数据上预训练的 EgoSteer 模型,以及一个从零开始训练的无预训练基线模型,均在真实机器人数据集上进行了后训练。这些模型(分别标记为 EgoSteer-0/3/6/9.6K)在 10 个任务上进行了评估。此外,基线模型 π0.5 [2] 和 Being-H0.5 [8] 也在真实机器人数据集上进行后训练,并在 10 个难度较低的任务上进行比较。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询