人类为什么会信任机器人?这个问题不是哲学闲聊,而是当前人机交互(Human-Robot Interaction,HRI)领域最值得关注的研究方向之一。一个机器人如果只是程序上“正确”,但用户不信任它,就不会真正使用它;反过来,一个机器人如果看起来热情,但能力频繁翻车,用户很快会放弃它。信任,本质上决定了机器人能不能从“实验室演示品”变成“长期可用的工具”。
这次我们来看 HRI 2026 关注的信任形成机制问题。文章会聚焦一个核心框架:人类对机器人的信任分为认知信任和情感信任两条通道,它们形成路径不同、衰减速度不同、修复难度也不同。后面会给出适合研究者和开发者的实验设计思路、常用度量方法、数据采集流程,以及把结论落到机器人产品上的实践建议。
如果你在做服务机器人、协作机器人、人形机器人相关项目,或者正在研究人机交互、具身智能、AI 产品信任设计,这篇文章可以直接收藏。
1. 核心能力速览
| 维度 | 说明 |
|---|---|
| 研究对象 | 人类对机器人的信任形成机制,包括认知信任与情感信任 |
| 核心问题 | 机器人能力表现、行为透明度、交互风格如何影响信任建立与崩坏 |
| 主要方法 | 行为实验、主观量表、生理信号记录、交互日志分析、纵向追踪 |
| 典型场景 | 服务机器人、协作机械臂、助老机器人、导览机器人、人形机器人 |
| 实验条件 | 真实机器人交互或高保真仿真平台,需要视频/音频/日志同步采集 |
| 度量工具 | 主观问卷、任务完成率、信任修复行为、眼动与生理指标、交互后访谈 |
| 适用人群 | HRI 研究者、机器人产品经理、交互设计师、AI 应用开发者 |
| 输出价值 | 信任评估指标体系、实验范本、可解释性设计建议、产品优化方向 |
2. 适用场景与使用边界
信任机制研究适合解决以下问题:
- 机器人第一次与用户见面时,哪些行为能更快建立初始信任。
- 机器人在执行任务中出现错误后,用户是否愿意继续依赖它。
- 机器人应该“更像人”还是“更像工具”,不同场景是否有不同最优解。
- 如何通过界面、语音、动作设计,让机器人的决策过程对用户可见。
- 如何预测不同用户群体(老人、儿童、技术背景用户)的信任变化趋势。
不适合的场景也需要说清楚。如果只关心机器人定位精度、运动控制、路径规划这类底层性能问题,信任机制研究不是直接选项。它更适合回答“人愿不愿意用、为什么会持续用”这类用户侧问题。
同时,涉及人类被试的实验必须遵守伦理规范。实验中不能故意制造虚假紧急情况,不能诱导被试做出危险行为,采集生理和行为数据需要明确告知并获得知情同意。涉及儿童、老年人等群体时要格外谨慎。所有数据使用均应在授权范围内进行。
3. 环境准备与实验前置条件
研究信任机制不一定要从零搭建机器人平台,但实验环境需要满足三个基本条件:可控的交互场景、可记录的行为数据、可重复的变量控制。
3.1 机器人平台选择
- 真实机器人:适合验证生态效度较高的结论,例如助老机器人、前台导览机器人、协作机械臂。
- 仿真平台:适合大规模被试测试和早期变量筛选,例如 Gazebo、Webots 或基于 ROS 2 的仿真环境。
- 虚拟形象:适合剥离物理机器人外观因素,单独研究语言、表情、任务表现的影响。
从已有研究经验看,真实机器人的效果往往比仿真平台更明显,但实验成本更高。如果团队没有现成的实体机器人,先用仿真平台完成小规模预实验,再在真实平台上复现关键发现,是更稳妥的路线。
3.2 软件与开发环境
如果涉及机器人端开发,建议准备以下环境:
# 以 ROS 2 为例,安装基础环境(具体版本按项目实际要求调整) sudo apt update sudo apt install ros-humble-desktop python3-colcon-common-extensions# 创建工作空间并编译(按实际项目目录调整) mkdir -p ~/trust_lab_ws/src cd ~/trust_lab_ws colcon build source install/setup.bash如果不需要机器人端开发,只做交互记录和问卷采集,一台配备摄像头的电脑加一套问卷工具就能启动。
3.3 数据采集设备
- 摄像头:记录被试面部表情和视线方向。
- 麦克风:记录机器人语音与被试语音。
- 生理传感器:心率、皮肤电导等指标可以辅助判断情绪唤醒度。
- 软件日志:机器人的动作、语音、任务状态需要以时间戳形式同步保存。
3.4 环境检查清单
| 检查项 | 说明 |
|---|---|
| 实验场地 | 安静、无干扰,有固定机位 |
| 机器人状态 | 电量充足,动作稳定,紧急停止按钮可用 |
| 数据记录 | 视频、音频、日志时间同步 |
| 被试知情同意书 | 明确告知数据用途与匿名化处理方式 |
| 预实验 | 至少邀请 3 到 5 人先跑通流程 |
4. 研究设计与信任形成机制拆解
信任不是单一变量,而是由多个维度构成的过程。当前 HRI 领域比较认可的做法,是把信任拆成认知信任和情感信任两个通道:
- 认知信任:用户基于机器人“能不能做到”形成判断。它来自任务成功率、响应速度、决策合理性。
- 情感信任:用户基于机器人“可不可亲近”形成判断。它来自表达方式、拟人化程度、情绪反馈、对用户状态的反应。
这两者不是各自独立发生的。一次任务失败可能折损认知信任,但如果机器人能主动解释原因并表达歉意,情感信任可能上升,从而缓冲总体信任的下跌。反过来,一个外表非常可爱的机器人,如果多次无法完成任务,认知信任也会持续下降,最终拖垮整体信任水平。
4.1 典型实验范式:2×2 因子设计
一个可复用的实验设计是把机器人能力表现和交互风格作为两个自变量,各取两个水平:
| 自变量 | 低水平 | 高水平 |
|---|---|---|
| 能力表现 | 任务成功率低(约 60%) | 任务成功率高(约 90%) |
| 交互风格 | 工具化(简洁、命令式) | 拟人化(带情感反馈、解释性语言) |
四组被试分别与四种机器人交互,测量交互前后信任变化、任务中是否愿意接受机器人建议、交互后访谈中的主观感受。
这种实验设计的好处是逻辑清楚,可复现,数据也容易做方差分析。研究者可以根据自己的主题把“能力表现”替换成“可解释性高低”,把“交互风格”替换成“外观拟人化程度”等变量。
4.2 信任形成的关键时间窗口
从已有研究看,信任变化通常有三个关键窗口:
- 初始信任:交互开始前,用户基于外观、描述、品牌形成的预期。
- 实时信任:交互过程中,用户根据实际表现持续调整信任。
- 习得信任:多次交互后形成的稳定态度。
如果只做单次实验,得到的主要是初始信任和实时信任。想研究长期信任维持,需要纵向实验设计,例如让被试在连续两周内每天与机器人完成一次任务,记录信任变化曲线。
4.3 信任崩坏与修复
信任崩坏比信任建立更容易发生。一次明显错误对信任的破坏,需要多次成功表现才能修复。
信任修复策略通常分为三种方向:
- 功能性修复:承认错误,直接提升任务表现。
- 信息性修复:解释错误原因,提供更多决策信息。
- 情感性修复:表达歉意、遗憾、理解用户感受。
不同用户群体对不同修复策略的敏感度不同。技术背景用户通常更接受信息性修复,而老年用户可能更看重情感性修复。这部分结论直接关系到机器人产品的容错设计。
5. 功能测试与效果验证
如果你在设计自己的信任机制实验,可以按下面的流程验证。
5.1 测试目的
- 检验机器人能力表现对认知信任是否有显著影响。
- 检验交互风格对情感信任是否有显著影响。
- 检验能力表现与交互风格是否存在交互效应。
- 检验信任变化能否预测用户的实际顺从行为。
5.2 输入素材与实验流程
以一个服务机器人导览任务为例:
第一步,设计任务脚本:机器人需要完成 5 个导览动作,其中成功和失败项目提前设定,用脚本精确控制成功率。
第二步,准备两类交互覆盖层:低拟人化版本只提供“前方是展厅 A”这类信息;高拟人化版本额外加入“请注意脚下台阶,安全第一”这类关怀表达。
第三步,被试到现场后先填写前测问卷,再与机器人完成交互,结束后填写后测问卷,并接受简短访谈。
5.3 预期结果
如果实验设计有效,预期看到:
- 能力表现的主效应显著:成功率高导致认知信任显著更高。
- 交互风格的主效应显著:拟人化表达导致情感信任更高。
- 交互效应可能出现在失败场景:当机器人失败时,高情感信任组的总体信任下降幅度小于低情感信任组。
5.4 判断标准
- 问卷信度:Cronbach's α 不低于 0.7。
- 主效应与交互效应的显著性水平:p < 0.05。
- 行为数据与问卷数据方向一致。
- 访谈结果能对量化数据提供合理解释。
5.5 常见失败原因
| 失败现象 | 可能原因 | 调整方向 |
|---|---|---|
| 所有组差异不显著 | 任务太简单或太难,地板/天花板效应 | 调整任务成功率差异 |
| 问卷结果与行为不一致 | 被试可能高估或低估自己的信任 | 加入行为指标,如是否接受机器人建议 |
| 被试明显受机器人外观影响 | 外观变量未控制 | 使用同一平台、只改变软件层变量 |
| 数据丢失 | 视频与日志时间不同步 | 使用统一时间戳,测试多机同步 |
6. 信任度量工具与数据指标
信任必须可测量,否则研究无法落地。常用度量方式有四类。
6.1 主观量表
多数研究会使用人机信任量表或改编后的 HRI 信任问卷,覆盖能力、可靠性和意图三个维度。问卷需要在交互前后分别施测,才能看到信任变化。
示例维度:
| 维度 | 题目示例 |
|---|---|
| 能力感知 | 我认为这台机器人有能力完成分配的任务 |
| 可靠性感知 | 我预计这台机器人在关键时刻不会失误 |
| 意图感知 | 我感觉这台机器人是真心帮助我的 |
6.2 行为指标
行为指标比问卷更不容易受到社会期待效应影响:
- 接受机器人建议的比例。
- 任务中重新接管控制权的频率。
- 与机器人保持的物理距离。
- 面对机器人错误时的纠正次数。
其中“接受建议比例”是相对稳定的行为指标。例如机器人给出错误建议时,被试是否采纳,能比较直接地反映信任倾向。
6.3 生理指标
心率、皮肤电导、瞳孔直径可以反映情绪唤醒和压力状态。这类指标适合辅助判断信任崩塌时的生理反应,但数据噪声大,不建议单独作为核心指标。
6.4 交互日志与事后访谈
机器人端记录所有交互事件并打上时间戳。事后访谈重点询问:哪些细节让你更信任/不信任这台机器人;你当时为什么接受或拒绝它的建议。
6.5 数据记录示例
# 数据记录大致结构,具体字段按实验需求调整 experiment_data = { "participant_id": "P001", "condition_group": "high_performance_low_humanization", "task_index": 1, "task_result": "success", "followed_robot_suggestion": True, "reaction_time_sec": 2.35, "trust_score_before": 3.8, "trust_score_after": 4.2, "heart_rate": 76.5 }7. 数据采集与性能观察
信任实验的数据不是“跑一次网页脚本就完事”,它需要多路数据同步。
7.1 数据同步方案
推荐使用机器人端日志作为时间基准,视频和生理数据在接入时校准时间戳。一个低成本方案是在实验开始时播放可见的闪光信号,让三路数据同时打点。
# 查看机器人日志时间戳(示例,命令按实际系统调整) ros2 topic echo /robot_status --once7.2 资源占用与方法选择
如果使用仿真平台,需要关注 GPU 占用;如果使用实体机器人,占用问题更多体现在日志存储和视频文件大小上。建议按一次实验 30 分钟估算存储空间,提前准备数据盘。
| 数据源 | 预估单次实验数据量 | 备注 |
|---|---|---|
| 视频文件 | 1 到 3 GB | 取决于摄像头分辨率和帧率 |
| 生理信号 | 几十 MB | 采样率较低 |
| 机器人日志 | 几 MB | 文本格式 |
7.3 信效度检验
- 主试验前必须做小规模预实验。
- 问卷必须做信度分析。
- 多主试场景下要做评分者一致性检验。
- 单次实验数据不能用于建立长期信任模型,需要纵向数据支撑。
8. 常见问题与排查方法
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 问卷信度过低 | 题目表述模糊或维度划分不合理 | 做探索性因子分析 | 删改题目,重新预实验 |
| 行为数据没有差异 | 任务难度设置不合理 | 检查任务成功率和被试决策空间 | 调整任务参数 |
| 生理信号噪声大 | 被试紧张或设备佩戴不适 | 查看原始波形 | 增加适应期,检查设备佩戴 |
| 视频与日志时间不同步 | 没有统一校时 | 对比闪光信号时间戳 | 重新校准,预实验时同步 |
| 机器人表现不稳定 | 电量、网络、脚本逻辑问题 | 查看机器人日志 | 固定电量阈值,减少网络依赖 |
| 被试对机器人没有兴趣 | 任务枯燥或交互时间太短 | 访谈被试 | 增加任务趣味性或延长交互时间 |
| 复现不出已有研究结果 | 文化、用户群体、任务场景差异 | 对照原文实验条件 | 先做概念复制,再做直接复制 |
9. 从信任研究到产品实践
信任机制研究不只是学术问题,它可以转化为非常具体的机器人产品设计原则。
9.1 让机器人的决策过程可见
机器人不能只输出结论,要输出原因。用户更容易信任“我建议走左侧路线,因为右侧有积水”而不是“请走左侧”。这是可解释性在 HRI 中的直接应用。
9.2 为“可接受的失败”设计缓冲
机器人无法保证永远不出错。产品层面可以做:
- 出错前表达不确定性。
- 出错后主动提供补偿方案。
- 在关键任务中允许用户快速接管。
9.3 不同场景使用不同信任策略
- 工业协作场景:优先强化认知信任,提供准确的自检信息。
- 助老服务场景:优先强化情感信任,使用稳定的、温和的交互节奏。
- 教育机器人场景:兼顾两者,既要能力可信,也要情感联结。
9.4 建立信任监测机制
在产品端记录以下数据,用于持续优化:
- 用户对机器人建议的接受率。
- 用户接管控制权的频率与时机。
- 用户主动发起交互的次数。
- 交互中断与重新建立连接的模式。
10. 最佳实践与合规要求
做信任机制研究和产品落地时,有几个原则值得长期坚持。
第一,先跑小样本预实验,不要直接铺大样本,否则问卷和实验流程有问题时成本极高。
第二,每一批实验都要检查信效度,不能等到全部数据收完才发现问卷维度崩塌。
第三,数据采集必须获得被试知情同意,数据必须匿名化保存。涉及老人、儿童、医疗场景时,授权边界要额外确认。
第四,实验中真实任务和模拟任务要区分清楚,不能伪造安全相关的重要信息。这一点直接关系到伦理底线。
第五,视频、日志、生理数据要有备份机制,一次实验采集多路数据,丢任何一路都很可惜。
11. 总结与下一步
关于“人类为什么会信任机器人”,核心答案已经比较明确:信任来自两条通道,一条是能力判断,一条是社会情感判断。认知信任靠稳定的任务表现和透明的决策过程建立,情感信任靠主动解释、合理共情和一致性的交互风格建立。两条通道相互作用,一个有能力但不友善的机器人可能让用户敬而远之,一个友善但频繁出错的机器人则会让用户很快失去耐心。
对研究者来说,下一步最值得做的是把单次交互实验扩展成纵向追踪,研究信任的长期变化规律。对开发者来说,最优先的是把“可解释性”和“错误恢复策略”加到现有机器人系统里,然后通过用户接受率和接管频率的数据验证效果。
最容易被低估的坑是实验设计和变量控制。很多团队在做机器人产品时,把大量精力投入算法性能,却忽略了用户“信不信”这个维度。建议先花一周时间做一个 2×2 的小实验,把能力表现和交互风格拆开测试,你会更清楚自己的机器人到底是在哪个环节失去了用户的信任。