☰
模型具备认知校准,却无法做到行动校准:伪造证据促使大模型智能体对不可知问题贸然行动
2026/10/1 2:42:31 网站建设 项目流程

模型具备认知校准,却无法做到行动校准:伪造证据促使大模型智能体对不可知问题贸然行动

论文来源:arXiv:2608.27167v1

摘要

当向大模型智能体展示一份专业风格的市场分析面板时,相比于直接抛出裸问题,智能体会更加频繁地对本质上不可预测的问题给出确定性判断。在12个前沿模型上,仅提问时贸然行动的比例为6.5%,加入证据面板后该比例飙升至54.0%。即便面板上面所有数字全部是人为编造,该现象依然存在。
将整个显示面板全部伪造,除问题本身之外全部内容均为虚假数据,智能体贸然行动比例从24.5%提升到36.8%;该结果和真实市场数据带来的37.6%在统计上没有显著差异。真正促使智能体做出自信行动的不是信息本身,而是信息包装带来的权威感。

该缺陷具备明确、可定位的特点,有三种假说可以直接被实验排除。

  1. 并非模型能力不足:在使用完全相同面板的配套可解答问题上,这些模型几乎总能答对,准确率接近完美。
  2. 并非模型信念发生改变:行动概率提升48个百分点的条件下,模型输出的陈述概率几乎没有波动;并且这些输出概率表现比气候学基线效果还要差。
  3. 并非模型缺少判断能力:如果要求模型在行动之前先判断问题是否可被解答,模型在90%场景下都能识别该问题不可还原;但识别之后仅有0.4%的概率依旧贸然行动。

真正失效的是行动决策闸门。该现象不是普遍现象:12个模型中,3个容易被伪造面板诱导;4个在任何面板条件下都拒绝贸然行动;3个无论什么证据都会强行输出判断;剩余2个响应程度较弱。

既然决策闸门是可分离的,就可以通过训练进行修复。在540条合成样例(以骰子、硬币、罐子、计时器为主例)上对3B模型做监督微调,原始测试集上贸然行动比例降到0.0%;该能力可以泛化到3个未见过的领域;同时通过时态平衡对照实验排除“凡是未来问题一律拒绝”这种简单启发式。
但是该训练效果并非在所有条件下都能维持,存在清晰失效边界:当输出格式给模型留出推理空间时,闸门正常生效;当格式剥夺推理空间,闸门就会失效。一组消融实验中,模型在48条不可知样例上全部贸然行动,并且每条都输出真实概率。
因此,面对和训练提示格式差异很大的提示,模型鲁棒性会发生变化;刚性输出格式会压制模型推理,使模型在原本可以正确处理的问题上变得自信而错误。
该决策闸门可以被训练修复,但对上下文高度敏感;部署时必须同时兼顾这两点。

目录

  1. 引言
  2. 方法
    2.1 退化策略基线
  3. 是展示形式而非数据本身触发贸然行动
    3.1 部分混淆:伪造指标模块
    3.2 完全伪造:面板全部内容均为虚假
    3.3 哪些模型容易被该现象影响
    3.4 这是连续档位而非简单开关
  4. 跨领域均会出现证据诱导的贸然行动
  5. 判断能力存在,但决策闸门并未调用该判断
  6. 决策闸门是可以通过训练建立的
    6.0 检查点清单
    6.1 训练配方
    6.2 样本覆盖度比配方本身更重要
    6.3 实验结果
    6.4 偏好优化阶段带来适度提升
    6.5 删除重叠样本,领域泛化能力依旧保留
    6.6 闸门不是语法时态启发式规则
  7. 训练得到的决策闸门可以泛化到原始测试用例
  8. 训练后的闸门在什么条件下失效
  9. 讨论
  10. 相关工作
  11. 局限性
  12. 结论
    附录
    A 预注册说明与分析决策
    B 完整提示词
    C 解析器:严格解析器与语义解析器
    D 各模型详细实验结果
    E 训练超参数细节
    F 样例转录文本

1 引言

生产环境下的大模型智能体很少只接收光秃秃的问题,输入往往附带仪表盘、检索返回结果、监控数据流、市场数据。开发者和AI治理框架(欧盟AI法案第15条、NIST AI RMF)普遍默认:更多上下文可以让智能体决策更可靠。
已有前期研究表明:对于本质上高度不确定的不可约问题,该假设会反转——看起来相关的上下文,会让智能体不再回答“这件事无法预知”。但之前工作尚未定位根因:究竟是面板本身微弱地提供信息,还是仅仅依靠权威外观就触发行动?二者观测表现一致,必须对证据本身做干预实验才能区分。

图1 论文整体结论示意图
向智能体提出一个答案预先不可知的问题;展示权威指标面板,12个前沿模型的贸然行动比例由6.5%升高至54.0%。伪造全部6项技术指标,结果几乎不变(37.6%→38.3%);把整个面板全部伪造,除问题之外全部为虚假数据,比例依旧维持36.8%,依旧比无面板基线24.5%高出12个百分点。对3B模型在540条骰子硬币合成样例微调,原始40个测试用例贸然行动率降至0.0%。

研究范围

本文研究的问题属于随机不确定性(aleatoric):答案客观存在且未来会揭晓,但事前完全无法预知。
例:该资产在周期结束是否上涨;比赛谁会获胜;10天后是否下雨。
该概念区别于回避评测基准常处理的认知不确定性(epistemic):信息缺失、前提错误、问题定义模糊。
认知不确定问题补充缺失信息即可解答;随机不确定问题无论补充任何工具调用都无法预知。这也是本失效模式的特殊之处:正确行为是可以被推理得到,但模型依然无法做到。

本文工作内容

  1. 基于短期价格方向构建“不可知预言机”,事前验证结果接近随机,真实结果在实验构建阶段就已经封存;
  2. 在多组匹配条件下提升证据丰富度,度量行动决策,而不是模型口头输出的概率;
  3. 在保持格式不变的前提下伪造证据,把信息内容和展示形式两种因素解耦;
  4. 通过多组对照实验定位失效根源,排除能力不足、信念未变化、缺失判断三种假说;
  5. 仅使用无关领域合成数据,通过微调把决策闸门植入小参数量模型权重;
  6. 测试训练后闸门的失效边界。

主要贡献

  1. 证实展示形式才是触发因素:伪造同标的指标面板带来的贸然行动率与真实面板统计等价;解决了前期研究遗留的控制变量缺口。
  2. 失效发生在行动决策闸门,传统校准指标无法发现该缺陷;该效应跨4个领域、12个模型复现;模型贸然行动程度跨度0‑100%,与模型能力强弱不相关;模型口头信念几乎不变,配套可解答对照问题模型几乎完美答对。
  3. 决策闸门可训练,但对上下文高度脆弱。仅用合成数据监督微调,原始样例贸然行动率降为0.0%,并且泛化到3个未见过领域;存在明确失效边界:响应格式给模型推理空间时闸门生效,剥夺推理空间格式闸门失效。

本文不重复研究:大模型过度自信、偏好训练带来校准退化、对不可答问题拒答,这些已有大量研究。本文创新在于:在封存结果的随机不确定问题上,因果证实展示形式是触发源;以行动层面作为度量;提供训练干预手段并测绘失效边界。

2 方法

不可知预言机(Unknowability oracle)

不同领域预测时间窗口不同:股票数据集预测未来10个交易日收盘价;加密货币预测未来30天价格;体育预测下一场比赛;气象预测10天后降水。
根据市场有效性,高流动性资产短期价格方向事前近似抛硬币。本文不做假设,而是进行验证:候选池结果接近均衡;测试集构造为严格50%概率;所有评判和打分对照封存的真实结果。所有数据时间晚于全部模型训练截止时间,排除记忆泄露。

股票、加密货币拥有可核验的真实封存结果,支持Brier评分分析;体育、气象数据集仅构造为不可预测,无可核验真值。气象面板集成集合预报降水概率,10天集合预报本身具备有限预测能力;因此气象是最弱一组实验,仅作为参考;加密货币拥有封存真值,是主要迁移测试域。

命名提醒:不同实验证据层级命名不完全等价。迁移实验L2面板包含价格表头、7日变化、RSI、成交量比率;§3“rich”面板额外包含EMA20/50、MACD、ATR、行情标签。迁移实验L2等

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询