自主机器人入门
- 简介
- 自主机器人
- 具身 AI
- 自主导航
- 物体操控
- 人机交互
- 机器人系统与架构
- 机器人系统集成
- 仿真与测试
- 开发框架
- 硬件集成
- 传感器
- 执行器
- 控制器
- 自主软件架构
- 理解周围环境
- 感知
- 摄像头
- 激光雷达
- 其它常见传感器
- 感知的关键组成部分
- 定位与建图
- 定位的重要性
- 建图技术
- 导航与路径规划
- 经典导航系统
- 避障
- 机器人控制系统
- 反馈控制
- 轨迹跟踪
- 机器人发展趋势与未来
- 利用基础模型完成机器人任务
- 关键应用领域
- 先进技术
- 物理 AI 与仿真
- NVIDIA Cosmos
- 移动基础模型
- VLM、LLM 和 RAG 在机器人领域的应用
- 主要特性
- 技术组件
- 机器人领域面临的开放性挑战
- 主要挑战
- 发展机遇
简介
自主机器人
自主机器人种类繁多,包括水下机器人、无人机、自动驾驶出租车、家用机器人、救援机器人、四旋翼飞行器、四足机器人、人形机器人、外骨骼和机械臂。
机器人广泛应用于各行各业,包括制造、医疗保健、农业、物流、运输、探索、家用、零售、教育、公共安全和娱乐。可以看到,机器人技术几乎能够影响所有市场。那么,从宏观层面来看,什么是机器人技术?机器人又是如何工作的?
这张图概述了具身 AI。机器人的工作方式与人类非常相似。人类用眼睛进行感知,用大脑进行认知,并用手和腿等执行器采取行动。人类和机器人都是通过这种方式与世界交互的。
感知模块接收来自外部世界的信息,并将结果传递给认知模块,也就是机器人的大脑,随后机器人采取行动与世界交互。
具身 AI
具身 AI 是物理 AI 的一个子集,代表着机器人技术和人工智能领域的一次重大飞跃,使机器人能够以日益复杂的方式与物理世界交互。
自主导航
具身 AI 的主要能力之一是自主导航。它让机器人能够在各种环境中自主移动,在没有人为干预的情况下规划路径并避开障碍物。
物体操控
物体操控是具身 AI 的另一个关键方面,包括:
- 抓取:牢固抓持不同形状和大小物体的能力
- 复杂操控:执行组装部件或折叠衣物等精细任务
这些技能使机器人能够以接近人类能力的方式与环境交互。
人机交互
AI 领域的最新进展彻底改变了机器人与人类交互的方式,包括:
- 自然语言处理:让人类与机器人能够使用口头或书面语言进行交流
- 协作:让机器人能够与人类共同完成各种任务,应用场景涵盖制造业和医疗机构等
大语言模型的出现进一步增强了人机交互能力。这些模型显著提升了机器人理解和响应复杂指令及问题的能力,使交互更加自然直观。
机器人系统与架构
机器人系统集成
机器人系统的核心在于硬件与软件组件之间的无缝协作。集成过程包括:
- 硬件组件:传感器、执行器,以及让机器人能够与环境交互的其它物理部件
- 软件系统:控制机器人行为和决策过程的程序与算法
目标是构建一个各部分协同工作的统一系统,使机器人能够执行复杂操作,并实现内部通信。
仿真与测试
借助 NVIDIA Isaac Sim、NVIDIA Isaac Lab 或 Gazebo 等仿真环境,可以在将机器人部署到现实场景之前验证整个系统。此外,还可以利用各种测试框架,例如硬件在环 (HIL) 测试、软件在环 (SIL) 测试,以及单元测试或系统级测试。
开发框架
机器人开发通常依赖专用平台和框架。一个典型示例是 ROS(机器人操作系统),它为编写机器人软件提供了灵活的框架。也可以使用其它中间件操作系统。
硬件集成
硬件集成的目标是将各种硬件组件整合为一个无缝协作的统一系统,确保传感器、执行器与控制器之间能够可靠、高效地交互。
传感器
传感器对于环境感知、导航辅助以及向控制系统提供反馈至关重要。常见类型包括:
- 摄像头:用于视觉输入
- LIDAR:用于距离测量
- IMU(惯性测量单元):用于确定方向
- GPS:用于位置跟踪
执行器
执行器负责实现移动和操控,并根据传感器反馈施加作用力和进行调整。执行器的类型包括:
- 电机:用于移动的 DC 电机和步进电机
- 伺服机构:用于精确的位置控制
- 气动和液压执行器:用于施加作用力
控制器
控制器负责处理传感器数据、执行控制算法,并促进各组件之间的通信。例如:
- 微控制器:例如 Arduino 和 PIC
- 单板计算机:例如 Raspberry Pi 和 NVIDIA Jetson
- 嵌入式系统:用于集成式控制解决方案
集成过程需要确保所有硬件组件高效协作,使整个机器人系统能够可靠运行,并高效处理数据以支持实时决策。通过重点关注这些方面,硬件集成使机器人能够精准、灵活地执行复杂任务。
自主软件架构
此图概述了一种相对复杂的自主软件架构,常用于无人驾驶出租车等应用。它展示了自主系统所需各类组件的集成方式,不过有些机器人可能只会使用其中一部分组件。
感知与定位:利用摄像头和 LIDAR 等传感器以及建图系统评估周围环境,并确定机器人的位置和状态
规划:包括多个阶段:
- 全局规划:类似于在地图上设定路线,通过定义任务和途经点来抵达目标
- 行为规划:决定要采取的动作,例如操作哪个物体以及如何操作
- 局部规划:为特定任务生成轨迹,引导机器人沿精确路径移动
控制与执行:控制器跟踪轨迹状态来执行操作或导航动作,并在虚拟仿真和真实场景中测试结果
反馈循环:持续收集传感器和定位数据,以优化规划并提升系统性能。这一迭代过程确保机器人的行为具有适应性,并能及时响应
理解周围环境
感知
在机器人领域,感知对于自主机器人理解周围环境至关重要。人类会综合运用视觉、听觉和触觉等多种感官来理解周围世界,同样,机器人也依赖传感器融合。此过程整合多个传感器的数据,从而全面、准确地呈现环境。
摄像头
- 单目摄像头:使用单镜头拍摄 2D 图像。这类摄像头结构简单、具性价比且易于获取,非常适合基本的物体检测、图像识别和简单导航任务
- 双目摄像头:使用两个镜头同时拍摄图像,模拟人类的双眼视觉。这种配置能够提供深度感知和 3D 信息,适用于避障和 3D 建图。Hawk 3D 深度摄像头就是一个例子
- RGB-D 摄像头:将标准 RGB 彩色成像与深度感知相结合,提供可靠的 3D 感知能力。这类摄像头适用于高级导航、物体操控和交互。Intel RealSense 双目 RGB-D 摄像头是一种常见选择
- 热成像摄像头:检测红外辐射,并根据温度差异生成图像。它们在黑暗环境中,或透过烟雾和雾气时也能有效工作,因此非常适合搜索、救援和监控任务
- 事件相机:具备高时间分辨率和低延迟,非常适合高速运动检测与跟踪
了解这些摄像头类型有助于为特定机器人应用选择合适的传感器,从而增强机器人有效感知周围环境并与之交互的能力。
激光雷达
- 2D 激光雷达:更简单、更便宜且速度更快,但功能有限。非常适合基本的平面导航和障碍物检测
- 3D 激光雷达:能够提供详细的空间信息、宽广的视野和高分辨率,适用于自动驾驶车辆建图。不过,它通常比摄像头更昂贵
- 固态、闪光式和 MEMS 激光雷达:兼具耐用性和性价比,通过激光脉冲测量距离并创建详细地图
其它常见传感器
- 超声波传感器:发射声波,并根据回声返回时间测量距离。价格实惠,常用于家用吸尘机器人等低成本机器人
- 雷达:在各种环境条件下都能可靠工作,可提供距离、速度和尺寸信息,应用于无人驾驶出租车等场景
- GPS:对于户外定位至关重要
- IMU(惯性测量单元):测量加速度和旋转速率,以跟踪运动和姿态,广泛应用于移动机器人
- 车轮编码器:测量车轮转动量,以确定行驶距离
- 磁传感器(指南针):检测地球磁场,以确定姿态并提供航向信息
- 环境传感器:测量温度、湿度和空气质量
- 触摸传感器:具性价比,可用于检测接触,常见于家用机器人
这些传感器共同增强了机器人感知周围环境并根据实时数据做出合理决策的能力。
感知的关键组成部分
- 传感器融合:整合不同传感器的数据,以全面了解周围环境
- 物体检测与识别:识别机器人环境中的物体并对其进行分类
- 物体跟踪:持续跟踪移动中的物体,就像人眼追踪移动物体一样
- 场景理解:理解环境的整体情境,使机器人能够做出合理决策
NVIDIA 开发了 Isaac Perceptor,这是一套专为移动机器人设计、基于摄像头的 3D 感知系统。该系统提供:
- 稳健的里程计:跟踪机器人在环境中的移动,就像人在行走时判断自身位置一样
- 局部 3D 场景重建:构建周围环境的三维地图,为自主导航提供支持
Isaac Perceptor 利用 VSLAM(视觉同步定位与建图)等技术实现精确的里程计,并利用 NVBlox 完成细致的 3D 重建。这些技术的集成对于开发先进的机器人导航应用至关重要,也为未来类人机器人视觉系统的创新奠定了基础。
定位与建图
定位与建图对机器人有效地在环境中导航并与环境交互至关重要。可以把机器人想象成一名旅行者,需要借助地图和指南针探索陌生区域。通过这些过程,机器人能够确定自身位置并绘制周围环境的地图。
定位的重要性
定位可帮助机器人确定自身在环境中的位置,从而作出合理决策。例如,在轨迹跟踪等任务中,准确掌握位置对于确保机器人严格按照预定路径行进至关重要。
- GPS(全球定位系统):主要用于室外环境,以提供位置数据
- 视觉里程计:利用摄像头图像估算运动,将这项任务转化为计算问题
- 基于激光雷达的定位:使用激光传感器,将当前位置与已有地图进行匹配
建图技术
建图是指创建环境的表示,对于仓库或工厂等大型空间至关重要。
- SLAM(同步定位与建图):机器人在构建地图的同时,跟踪自身在地图中所处位置的技术
- 占用栅格:将环境表示为网格,每个单元格表示该位置被占用的概率
这些技术是自主导航的基础,使机器人能够有效地理解环境并与环境交互。
导航与路径规划
在自主移动机器人领域,导航与路径规划对于确保机器人在环境中高效、安全地移动至关重要。其中包含多个规划层级,每个层级各有侧重。
经典导航系统
路线与任务规划
路线与任务规划用于确定地图网络中的首选路线,常用算法包括 A*、D* 和 RRT(快速探索随机树)。这类似于在路口确定行进方向——决定直行还是转弯。
仅靠这一层通常并不足够,因此还需要其它规划层级。这就是引入运动规划的原因。
运动规划
运动规划会生成一系列动作,使机器人能够沿规划路径行进,同时避开障碍物。它通常需要几秒钟来处理决策和轨迹生成这两个部分。
- 决策:侧重于行为规划和交互,例如决定是绕过托盘等障碍物,还是避让移动中的叉车
- 轨迹生成:生成基于时间的轨迹,详细指定速度、加速度和航向角,以实现精确控制
避障
- 实时检测:通过实时检测并避开障碍物来确保功能安全
- 反应式导航:利用传感器立即做出调整,在主要自主系统未能检测到障碍物时作为备用机制
这种分层方法使机器人能够与环境进行动态交互,并有效执行复杂的导航任务。
机器人控制系统
机器人的轨迹和目标状态确定后,控制系统会将这些信息转换为发送给机器人执行器的指令,从而确保机器人准确地沿规划路径移动。
反馈控制
反馈控制根据传感器输入调整机器人的动作,以实现预期行为。
一种常见的反馈控制方法是 PID 控制(比例-积分-微分)。PID 控制是一种广泛使用的算法,它通过持续调整运动,最大限度地减小期望位置与实际位置之间的误差。其工作原理是将期望的轨迹状态与根据定位数据获得的实际状态进行比较,并实时进行修正。
轨迹跟踪
可以使用轨迹跟踪来确保机器人准确地沿规划轨迹移动。
一种常用的方法是 MPC(模型预测控制)。MPC 是一种高级控制策略,它使用机器人行为的预测模型来优化机器人的路径。MPC 比 PID 控制更为复杂,通常用于精准的轨迹跟踪和人形机器人的全身控制。
这些控制方法对于确保机器人能够在环境中有效导航,同时保持运动的准确性和安全性至关重要。
在深入理解感知、定位、建图和控制系统等基础要素之后,接下来可以探索机器人技术的当前趋势和未来发展方向。这正是基础模型发挥关键作用的领域。
机器人发展趋势与未来
利用基础模型完成机器人任务
基础模型通过增强感知、决策和控制能力,正在推动机器人技术变革。这些模型基于海量数据集进行预训练,与传统方法相比,具有更强的适应能力和泛化能力。
关键应用领域
- 机器人策略学习:扩散策略、语言条件模仿学习和强化学习等技术可提高数据效率和上下文理解能力。这些模型利用语言驱动的奖励,帮助机器人学习最优动作
- 价值学习:机器人不直接学习策略,而是学习价值函数,以选择成本最低的动作,从而增强决策能力
- 高层任务规划:基础模型让机器人能够针对复杂任务进行认知层面的规划。例如,人形机器人可以利用这些模型理解“拿起特定箱子”之类的高层指令
- 基于 LLM 的代码生成:大语言模型 (LLM) 可生成用于机器人训练和执行的代码。GenSim 等系统便体现了这种能力,它们可以为各种应用创建任务仿真
先进技术
- 开放词汇目标检测与 3D 分类:Dino V2 等模型无需预定义类别,即可增强对各种对象的编码能力,这对于动态环境至关重要
- 语义分割:开放词汇分割让机器人能够识别此前未见过的对象并与之交互,从而拓展其任务范围
- 3D 表征与可供性:基础模型提供开放词汇 3D 表征,让机器人能够推断对象的可供性,即根据对象的属性决定如何与其交互
物理 AI 与仿真
像 Voyager 和 MineDojo 这样的物理 AI(或具身 AI)系统通过模拟任务,在虚拟和现实环境中训练机器人。这些系统利用基础模型来提升任务执行能力和适应性。
基础模型正在推动机器人系统变得更加智能、用途更加广泛,使其能够在极少人工干预的情况下执行复杂任务。
更多内容见文章:机器人领域的基础模型:应用、挑战与未来
NVIDIA Cosmos
NVIDIA Cosmos 是一款世界基础模型,旨在加速物理 AI 系统的开发,包括机器人和自动驾驶汽车。Cosmos 推出了一系列世界基础模型 (WFM),专为生成符合物理规律的视频和世界状态而设计。
世界基础模型是一类能够预测和生成符合物理规律的虚拟环境的神经网络。这些模型使用海量数据进行训练。Cosmos WFM 可帮助开发者高效生成大量基于物理规律的照片级真实感合成数据。这项能力显著减少了训练和评测物理 AI 模型所需的时间和成本。
NVIDIA Cosmos 标志着物理 AI 和机器人开发取得了重大突破。通过提供强大的世界基础模型和工具,它有望加快自动驾驶汽车、机器人及其它物理 AI 应用的创新,或将开启智能机器的新时代。
移动基础模型
移动基础模型充当机器人系统的中央“大脑”,处理稳健的视觉状态并生成词语模型和行动策略。该模型可适用于多种机器人形态,包括自主移动机器人 (AMR)。
主要特点
- 基于仿真的训练:该模型仅使用仿真数据进行训练,无需开展实体测试即可高效开发
- 零样本部署:无需额外训练即可成功部署到 Hubble 实验室等真实环境中,展现出良好的适应能力
- 跨形态能力:为 AMR 开发的策略可迁移到其它机器人上,例如人形机器人、四足机器人和太空叉车
该模型展现了机器人技术实现跨平台功能的潜力,有助于解决复杂的计算难题,并为多样化应用铺平道路。
更多内容:X-Mobility:通过世界建模实现端到端的通用导航
VLM、LLM 和 RAG 在机器人领域的应用
视觉语言模型 (VLM)、大语言模型 (LLM) 与检索增强生成 (RAG) 的集成,正通过一种称为附带感知的概念推动机器人技术变革。这种方法让机器人能够构建并利用记忆,从而有效地在环境中导航并与环境交互。
主要特性
- 构建记忆:机器人使用这些模型记住事件、地点和时间,以便在需要时返回特定地点
- 演示示例:在最近的一次 NVIDIA 办公室演示中,机器人接到指令去寻找一处“美景”。它回想起之前观察到的景象(例如绿植),并将用户带到那个位置
- 执行任务:机器人可以根据记忆执行取物等任务。例如,它能通过回忆之前在哪里见过薯片,在厨房中找到薯片
技术组件
- 视觉语言模型 (VLA):每隔几秒采集视频数据并生成说明,将这些信息存入向量数据库,形成长期记忆
- 语音处理:利用 NVIDIA 的 Vsper 将语音转换为文本,增强交互能力
- 开放词汇学习:让机器人无需预定义类别,也能理解并响应各种新的查询
VLM、LLM 和 RAG 的集成让机器人拥有更持久的记忆和更强的交互能力,为打造更加直观、响应更灵敏的机器人系统铺平了道路。
更多内容:
- ReMEmbR:为机器人导航构建长时空记忆并基于记忆进行推理
- 利用生成式 AI 让机器人借助 ReMEmbR 进行推理和行动
机器人领域面临的开放性挑战
尽管基础模型带来了显著进展,但机器人领域仍面临多项挑战。
主要挑战
- 数据稀缺:训练模型需要海量数据,而机器人领域的数据通常有限。NVIDIA 提供的 Isaac Sim 和 Isaac Lab 等工具可通过环境仿真生成数据,帮助解决这一问题
- 实时性能:基础模型的实时部署至关重要。NVIDIA 的 Orin 等技术支持在设备端进行处理,从而减少对云计算的依赖并提升性能
- 通用感知:要实现能够应对各种任务和环境的真正通用感知系统,仍然充满挑战
- 统一表示:将多模态输入(例如视觉和听觉)整合成连贯的理解十分复杂,但这对于机器人表现出稳健的行为至关重要
- 稳健性与安全性:对机器人进行评测,并确保其在不可预测的情况下安全可靠至关重要。OSMO(软件在环和硬件在环)等工具可为这一评测过程提供支持
发展机遇
- 边缘端部署:如 NVIDIA 的 VLA 演示所示,直接在设备上运行模型可以提升性能并减少对云端的依赖
- 基准开发:创建基准有助于比较算法在不同场景下的表现,从而提高可复现性并改进性能评估
- 人机交互:增强社会化导航能力并更好地理解人类预期,可以改善人类与机器人之间的协作
这些挑战也带来了创新机遇,推动机器人系统向能力更强、适应性更高的方向发展。