文章主要内容总结
本文聚焦大型语言模型(LLMs)中认知偏差的起源,旨在厘清预训练、微调数据和训练随机性对认知偏差的影响。研究通过两步因果实验展开:
- 评估训练随机性的影响:对同一预训练模型使用相同微调数据但不同随机种子进行多次微调,量化32种认知偏差的变异程度,发现随机性仅引入轻微波动。
- 交叉微调(crosstuning)实验:将不同模型的微调数据集交叉应用于彼此,通过聚类分析模型的“偏差向量”(即各偏差的得分组合),发现模型的偏差模式更倾向于与预训练骨干一致,而非共享微调数据的模型。
研究结论表明:LLMs的认知偏差主要源于预训练,微调仅对偏差有轻微调整,而训练随机性的影响有限。这一发现为评估和缓解LLMs的偏差提供了新视角,强调需从预训练阶段入手干预。
创新点
- 提出两步因果实验框架:通过控制随机种子和交叉微调,系统分离预训练、微调数据和随机性对认知偏差的影响,解决了此前偏差来源不明确的问题。
- 交叉微调方法:首次通过交换微调数据集的方式,直接验证偏差是否依赖于微调数据,实验设计具有创新性。
- 量化偏差模式的聚类分析:将模型的偏差表现转化为“偏差向量”,通过 silhouette 分数、Calinski-Harabasz 指数等指标量化聚类质量,客观证明预训练对偏差模式的主导作用。