今天分享的论文是《Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning》
原文链接:[2507.22887] Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
这是一篇关于探究prompt文字不变只是传输给LLM方位变化而导致LLM性能发生变化的论文,很有趣。同时在文末也提了一嘴可能的对于多语言探究还有的说明(是在限制里提了一嘴:我们的结果主要关注英语数 据。语法、词法和文字的跨语言差异可能 会导致不同的位置偏差,应该进一步研究。)
上下文学习(ICL)是大型语言模型(LLM)的 一项重要新兴功能,通过在提示中包含一 些演示(demos ),可以在推理过程中进行少 量学习。然而,我们发现 ICL 的表现对演 示的选择和顺序很敏感。本文首次研究了 ICL 的一种新的位置偏差:我们观察到,当 演示、系统提示和用户信息在 LLM 输入中 的位置发生变化时,预测和准确性会发生 剧烈的漂移。这种偏见,我们称之为德莫 斯立场中的即时偏见(DPP 偏见)。我们设 计了一个系统评估管道来研究分类、QA、 总结和推理任务中的这种位置偏差。我们 引入了两个度量,准确性变化和预测变 化,来量化由投资者头寸变化引起的净收 益和产出波动。对来自四个开源模型家族 (QWEN、LLAMA3、MISTRAL、COHERE)的十个 LLM 进行了广泛的实验 证实偏差显著影响他们的准确性和预测:将 演示放在提示的开始产生最稳定和准确的 输出,增益高达+6 点。相比之下,将演示 放在用户消息的末尾会推翻 30%的预测, 而不会提高 QA 任务的正确性。较小的模型 受这种敏感性的影响最大,尽管在复杂的 任务中,即使是较大的模型也会受到轻微 的影响。
图 1:第 3 节中演示样例在提示词(DPP)中的四种位置配置:ssp(系统提示词开头)、esp(系统提示词结尾)、sum(用户消息开头,默认配置)以及 eum(用户消息结尾)。右侧展示了在 AG 新闻数据集上使用 QWEN-1.5B 模型的实验结果:这些配置的准确率差异显著,且(与默认配置 sum 相比)预测结果的变化百分比最高可达 45.5%。
我们在情境学习(ICL)中发现了一种新的位 置偏差:DPP 偏差,在这种偏差中,从提示开始 到结束移动一个未改变的演示块可以使任务准 确度提高 20 %,并翻转几乎一半的模型预测(见 图 1)。1).这种现象,纯粹是空间的,独立于 演示内容,挑战了大语言模型从任何适当格式 的上下文中学习健壮的普遍假设。尽管越来越 多的人意识到了提示的敏感性,但是相对于说 明、查询或其他上下文元素来说,演示定位的 作用仍然没有得到充分的探索。先前的研究主 要集中在演示选择(Liu et al.,2022),或模 板措辞(Cho et al. 2024;Voronov et al.,2024),留下了理解空 间排列如何调节 ICL 功效的空白。本文通过对 跨越分类、推理和生成等八项任务的位置效应 的系统研究,解决了这一问题。通过对 LLAMA3 (1B,3B,8B,70B)和 MIXTRAL_8X7B 等模型 进行对照研究,我们证明了战略布局(例如, 将关键演示聚集在任务指令附近)可以产生性 能波动,即使演示内容保持不变。
本文主要贡献如下:
1.我们首先发现并量化了上下文学习中以前未报道的位置 偏差(DPP 偏差),表明简单地在提示中重新定位 一个相同的演示块可以在翻转近一半的模型预 测时将精确度提高 50 个百分点。
2.基于这一认识,我们设计了一个受控的评估管道,它在 系统提示的开始或结束以及用户消息的开始或 结束处隔离了四个规范的演示位置,因此任何 性能变化都完全归因于位置。
3.为了捕捉净性 能变化和输出波动,我们引入了两个与任务无 关的指标,准确性变化和预测变化。使用这个 框架,
4.我们对 8 个任务和 10 个最先进的 LLM 进行了第一次大规模的位置效应实证研 究,揭示了一致的首要偏差,随着模型规模的 增长,这种偏差变得不那么严重。
5.最后,我们将这些发现转化为实践指南。
讨论:
DPP 偏差为何会产生?
我们推测,DPP 偏差的产生源于两个互补性根源:(1)架构层面:因果解码器类大语言模型(Causal-decoder LLMs)通过自回归掩码(autoregressive masking)进行训练,因此较早出现的 tokens(词元 / 标记)会对隐藏状态产生不成比例的影响,而该隐藏状态又会制约后续所有预测结果。尽管系统提示、演示样例和用户消息这几个部分在逻辑上可以互换,但模型底层的优化目标并非如此。例如,针对 “归纳头”(induction heads)的机制可解释性研究(Olsson 等人,2022)已表明,注意力权重会集中在早期 tokens 和 “锚定 tokens”(sink tokens)上 —— 这种行为与我们观察到的 DPP 实证趋势一致。(2)数据层面:指令微调语料库(Instruction-tuning corpora)本身存在位置规律性(例如,演示样例会固定出现在某些位置槽中),进而会在模型中植入一个分布先验(distributional prior)。特定领域的训练集可能会增强或减弱这种效应,这也解释了为何最优演示样例位置会因任务和模型的不同而发生变化。
缓解 DPP 偏差的方法
我们提出未来工作的两个方向,旨在减少这种位置异常问题:
- 测试时校准(Test-time calibration)鉴于该偏差具有任务特异性与模型特异性,我们提出一种基于检索的校准方法:对于每个未见过的样本(unseen instance),利用外部嵌入模型(external embedding model)在带标注的参考集中找到其 k 个最近邻样本(k nearest neighbours),随后对这些最近邻样本标注的 “最优位置” 进行多数投票(majority-vote),为查询样本(query instance)选择合适的演示样例位置槽(demo slot)。这种轻量级流程无需微调成本(fine-tuning cost),且能动态适应输入分布偏移(input distribution shifts)。
- 基于随机排列上下文的后训练(Post-training on randomly permuted contexts)另一种方案是:通过对每个训练样本中的演示样例位置进行随机排列,构建一个无偏的上下文学习语料库(unbiased in-context learning corpus)。在该新数据集上进行微调(fine-tuning)或持续预训练(continued pre-training),有助于模型学习位置不变表示(position-invariant representations),从而抵消标准指令微调流程(standard instruction-tuning pipelines)所诱导的结构偏好。
限制:
虽然我们的实验揭示了演示位置如何影响 LLM 性能的强大趋势,但仍存在一些限制:
• 模型多样性:我们只评估了模型大小和架 构的一小部分(例如,7B,13B)。更大规 模的模型或不同的体系结构(例如,那些 在对话中微调过的)可能表现出不同的灵 敏度模式。
• 任务覆盖范围:尽管我们测试了多任务(分 类、QA、总结、推理),但是某些具有更 复杂结构的任务(例如,多跳检索或对话 上下文)没有被深入研究。
• 关注英语:我们的结果主要关注英语数 据。语法、词法和文字的跨语言差异可能 会导致不同的位置偏差,应该进一步研 究。
道德说明:
我们的工作侧重于提示设计的技术方面,并不 直接涉及潜在的敏感内容或私人数据。然而, 以下伦理考虑是相关的:
1. Prompt Engineering 的误用:通过战略演 示位置增强对 LLM 行为的控制可能被利用 来更有效地生成欺骗性或有害的内容。我们鼓励研究人员在部署这些方法时结合内 容过滤和审核框架。
2. 偏见和公平:如果演示带有隐含的偏见(例 如,倾斜的标签分布或刻板的例子),将 它们放在提示的早期可能会放大模型输出 中的这种偏见。从业者应该小心谨慎地策 划演示集,并验证输出中的意外偏差。
我们相信,提高对提示中空间效应的认识将 最终有助于设计更安全、更可靠的基于 LLM 的 系统,同时减少误用和偏差。
做个总结:
本文介绍并系统研究了先前被忽视的情境学习 (ICL)的一个方面:在 LLM 提示中演示位置的影 响。通过跨越十个开源模型、八个 NLP 任务和 四个典型提示位置的大规模评估,我们发现了 一致的 DPP 偏差,其中在提示前放置的演示 (ssp,esp)比在提示后放置的演示(sum,eum) 产生更高的准确性和更大的预测稳定性。这些 发现在分类和生成任务中都存在,并且在较小 的模型中尤为明显。 我们的分析表明,不仅不同位置的表现有很大 差异,而且后期演示(尤其是 eum)会导致显著 的预测波动翻转模型输出,而不会提高正确 性。我们进一步表明,位置敏感性受到任务和 模型规模的调节:虽然较大的模型表现出更大 的鲁棒性,但它们仍然表现出非平凡的不稳定 性和跨任务移动最佳位置。 我们引入了新的诊断工具,准确性变化和预测 变化来量化这些影响,并揭示标准准确性指标 掩盖的隐藏波动性。我们的胜负分析加强了关 键的洞察力:没有单一的示范位置是普遍最佳 的。因此,有效的提示设计必须是模型感知和 任务敏感的。 这些发现对实践中的激励策略有广泛的意义。 我们建议指令调整 LLM 的用户明确评估演示位 置,而不是依赖默认或特别格式。此外,位置 鲁棒性应该被认为是即时优化和指令微调流水 线的核心。
未来展望
首先,更深入的可解释性研究可探索为何特定位置会具有优势 —— 无论是源于注意力初始化(attention initialization)、解码器优先性(decoder primacy)、指令微调模板(instruction tuning templates),还是训练语料惯例(training corpus conventions)。其次,将此分析扩展至少样本思维链提示词(few-shot chain-of-thought prompts)及真实世界指令数据集(例如 HELM、BIG-Bench),有助于让这些见解更具普适性。最后,开发能将位置与内容联合适配的自动化演示样例位置优化程序(automated demo-placement optimization routines),可为构建更稳健的上下文学习(ICL)系统提供一种系统性方案。
此外,文章在附录A8中补了一个简单的针对任务相同的实验。