Mistral AI推出了Robostral Navigate,这是一个拥有80亿参数的具身导航模型,旨在通过自然语言指令和单个RGB摄像头的图像,引导机器人在陌生环境中自主移动。与许多视觉语言导航系统不同,该模型无需激光雷达、深度传感器或全景多摄像头装置。
在R2R-CE验证未见集基准测试中,Mistral报告的成功率为76.6%。据该公司称,这一成绩比最强的单摄像头系统高出9.7个百分点,比使用深度传感或多摄像头的最佳系统高出4.5个百分点。Robostral在验证已见集上也达到了79.4%的成功率。
R2R-CE比原始的Room-to-Room基准测试更具挑战性,因为机器人在连续的三维环境中运行,而非在已知导航图上的预设全景视点之间移动。智能体必须理解指令、感知周围环境并执行底层运动,且无法依赖精确定位或已知的环境拓扑结构。
Robostral的动作表示方式是其较为有趣的设计选择之一。该模型通常在当前摄像头图像中预测一个点,指示机器人应移动的位置以及到达时的目标朝向。Mistral表示,这种图像空间表示方式提高了对摄像头内参变化和机器人尺度变化的容忍度。当目的地超出摄像头视野范围时,模型则改为在机器人本地坐标系中输出位移向量。
Mistral完全在仿真环境中训练该模型,使用了跨35万个场景的约240万条轨迹数据。一种前缀缓存训练方法将一个完整回合压缩为单一序列,并在一次前向传播中完成所有时间步的训练,与将每个时间步作为独立样本处理相比,Token使用量减少了22倍。随后通过在线强化学习进一步将导航成功率提升了3.2个百分点。
对于边缘AI工程师而言,这一结果表明,更强的空间推理学习能力有时可以替代额外的传感硬件。然而,这并不能证明低成本RGB摄像头可在量产机器人中取代激光雷达。Mistral的公告未提供推理延迟、功耗、算力或内存需求、安全性能以及大量真实世界测试结果。该公司也要求潜在用户直接联系其团队,而非提供可下载的模型权重或部署文档。
尽管如此,这一基准测试结果仍值得关注:一个仅使用单目RGB输入的80亿参数模型,在公认的连续导航任务上能够超越传感器更为丰富的系统。下一个问题是,Mistral能否在实时、功耗受限的部署条件下,以及在仓库、工厂和公共场所等控制程度较低的环境中保持这一优势。
Q&A
Q1:Robostral Navigate是什么?有什么特别之处?
A:Robostral Navigate是Mistral AI推出的一款拥有80亿参数的机器人具身导航模型。它的特别之处在于仅依靠单个RGB摄像头和自然语言指令,就能引导机器人在陌生环境中自主移动,无需激光雷达、深度传感器或多摄像头装置。在R2R-CE基准测试中,其成功率达76.6%,超越了使用多传感器的系统。
Q2:Robostral Navigate是怎么训练出来的?
A:Robostral完全在仿真环境中训练,使用了跨35万个场景的约240万条轨迹数据。训练中采用了一种前缀缓存方法,将整个回合压缩为单一序列进行训练,Token使用量减少了22倍。此后还通过在线强化学习进一步优化,使导航成功率额外提升了3.2个百分点。
Q3:Robostral Navigate现在能直接用于实际机器人部署吗?
A:目前尚不能直接用于生产部署。Mistral的公告未提供推理延迟、功耗、计算及内存需求等关键部署参数,也未提供可下载的模型权重或部署文档。用户若有需求需联系Mistral团队。此外,真实世界中仓库、工厂等复杂环境下的表现仍有待验证。
Edge AI and Vision Alliance - Latest News具身导航Robostral NavigateMistral AI