☰
Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction
2026/10/7 16:18:55 网站建设 项目流程

一、文章主要内容和创新点

1. 主要内容

本文提出了一种基于注视(gaze)和语音的大型语言模型(LLM)框架,用于双向人机交互(HRI)。该框架旨在解决现有HRI系统在协作任务中缺乏动态适应性、多模态上下文感知能力的问题,具体内容包括:

  • 框架设计:通过多视觉输入感知工作环境,结合用户的注视追踪和语音交互,实现对动态用户任务的实时支持;采用模块化设计,可迁移至不同任务和机器人,且基于语言的交互状态表示和快速机载感知模块确保了实时性。
  • 开发过程:通过多次公开传播活动收集反馈,提升了系统的鲁棒性和用户体验。
  • 实验验证:在实验室研究中,将该框架与传统脚本式HRI流程进行对比,发现基于LLM的方法在适应性、用户参与度和任务执行指标上略有提升,但可能产生冗余输出;而脚本式流程更适合简单任务。
2. 创新点
  • 多模态融合:首次将注视追踪、语音交互与多视觉3D环境感知深度融合,通过LLM实现上下文感知的双向交互。
  • 模块化与可迁移性:框架设计支持快速适配不同机器人和任务,减少任务特定修改或重新编程的需求。
  • 推理机制:采用思维链(Chain-of-Thought, CoT)推理机制,结合GPT-4o-mini模型,实现动态任务分解(从高层语言描述到低层机器人动作)。
  • <

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询