Visual Grounding for Object-Level Generalization in Reinforcement Learning
摘要
泛化是遵循自然语言指令的智能体面临的一个关键挑战。为实现这一目标,本文利用视觉语言模型(VLM)完成视觉定位,并将其视觉 - 语言知识迁移到面向以物体为中心任务的强化学习(RL)中,使智能体能够对未见过的物体和指令实现零样本泛化。通过视觉定位,本文为指令所指示的目标物体生成一张以物体为锚点的置信度图。基于该置信度图,本文提出两种将 VLM 知识迁移至强化学习的路径。第一,本文基于置信度图提出了一种以物体为锚点的内在奖励函数,能够更有效地引导智能体向目标物体靠近。第二,与语言嵌入相比,置信度图为智能体的策略提供了一种更统一、更易理解的任务表征。这使得智能体能够通过可解读的视觉置信度图处理未见过的物体与指令,从而助力实现零样本物体级泛化。单任务实验证明,本文提出的内在奖励显著提升了智能体在高难度技能学习任务上的表现。在多任务实验中,本文通过对训练集之外的任务进行测试,结果表明当以置信度图作为任务表征时,智能体的泛化能力优于基于语言条件的方法。代码已开源于https://github.com/PKU-RL/COPL。
关键词:强化学习 视觉定位
1 引言
在人工智能领域,智能体以开放方式理解并执行自然语言指令的能力至关重要[5_RT1, 4_RT2, 10_NLMap, 50_ LM-Nav]。然而,智能体policy学习的训练内容范围总是有限的。零样本泛化任务指的是让智能体与训练过程中未遇到的各种对象进行交互,这需要从庞大的词汇库中选取合适的指令,从而创造出能够适应各种现实世界场景的通用人工智能系统[10_NLMap, 54_MOO]。作为一款流行的开放式3D游戏,Minecraft非常适合用于学习和评估智能体的泛化能力。从根本上说,Minecraft提供了procedurally生成的世界,这些世界具有无限的大小,同时包含了从导航、战斗到建造和生存等多种任务[17, 61, 63_Plan4MC, 58_Voyager, 68_GITM]。与围棋[53_AlphaGo]、Atari[39]和星际争霸[57_AlphaStar,16_SMACv2]等经典游戏环境相比,《Minecraft》模拟了现实世界中的复杂挑战,提供了多种带有自然语言指令的任务和对象。
由于智能体的策略学习所依赖的数据范围有限,策略无法直接理解训练集之外的大量物体名称,而这些名称可能包含在人类语言指令中。为了让代理具备对物体的泛化能力,引入视觉-语言模型是一个可行的解决方案[62_Open-Vocabulary]。视觉-语言模型能够将图像和语言词汇映射到相同的特征空间,从而弥合视觉观察与自然语言指令之间的差距。因此,它能够将对未见过的文本(例如新物体的名称)转化为视觉信息,使代理能够理解在训练过程中未遇到的指令。CLIP 模型作为一种重要的模型,已被广泛采用[41_GLIDE, 46_DALL·E2, 51_CLIP-ViL, 52_CLIPort, 18_CoW, 37_OWL-ViT]。近年来,研究者广泛采用 CLIP 作为开放词汇目标检测[19_ViLD, 27_F-VLM, 64_OV-DETR]和开放词汇分割 [12_MaskCLIP, 47_DenseCLIP, 31_OVSeg]的基础模型,以利用其丰富的视觉语言知识。此外,CLIP 甚至在未经微调的情况下,也展现出了出色的分割能力和可解释性[67_MaskCLIP, 30_CLIP_Surgery]。
CLIP 基于视觉定位的分割能力,为将视觉语言模型(VLM)的知识迁移到强化学习(RL)中、从而增强 Minecraft 中智能体的策略学习提供了两条思路。第一种是通过奖励进行迁移(transfer via reward)。目标物体在图像中占据的像素面积可以作为智能体与目标物体之间距离的替代指标。进而,这一指标可以用作内在奖励[2_curiosity-driven],引导智能体靠近目标物体,从而促进交互。第二种是通过表征进行迁移(transfer via representation)。分割结果可以替代语言指令,作为一种统一且更易于理解的任务表征。机器人领域的实证研究表明,与仅使用文本输入的模型相比,以此类位置信息作为输入的模型表现更优[54_MOO]。最重要的是,这种分割具有开放词汇能力 [44_CLIP, 67_MaskCLIP],这意味着,即使指令中包含智能体在训练过程中未曾遇到的新物体,分割仍然有效。
得益于MineCLIP[17],遵循上述思路在Minecraft中开发具有泛化能力的智能体成为可能。