Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning论文分享

发布时间:2026/9/25 18:28:50
Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning论文分享 今天分享的论文是《Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning》原文链接[2507.22887] Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning这是一篇关于探究prompt文字不变只是传输给LLM方位变化而导致LLM性能发生变化的论文很有趣。同时在文末也提了一嘴可能的对于多语言探究还有的说明是在限制里提了一嘴我们的结果主要关注英语数 据。语法、词法和文字的跨语言差异可能 会导致不同的位置偏差应该进一步研究。上下文学习(ICL)是大型语言模型(LLM)的 一项重要新兴功能通过在提示中包含一 些演示(demos ),可以在推理过程中进行少 量学习。然而我们发现 ICL 的表现对演 示的选择和顺序很敏感。本文首次研究了 ICL 的一种新的位置偏差:我们观察到当 演示、系统提示和用户信息在 LLM 输入中 的位置发生变化时预测和准确性会发生 剧烈的漂移。这种偏见我们称之为德莫 斯立场中的即时偏见(DPP 偏见)。我们设 计了一个系统评估管道来研究分类、QA、 总结和推理任务中的这种位置偏差。我们 引入了两个度量准确性变化和预测变 化来量化由投资者头寸变化引起的净收 益和产出波动。对来自四个开源模型家族 (QWEN、LLAMA3、MISTRAL、COHERE)的十个 LLM 进行了广泛的实验 证实偏差显著影响他们的准确性和预测:将 演示放在提示的开始产生最稳定和准确的 输出增益高达6 点。相比之下将演示 放在用户消息的末尾会推翻 30%的预测 而不会提高 QA 任务的正确性。较小的模型 受这种敏感性的影响最大尽管在复杂的 任务中即使是较大的模型也会受到轻微 的影响。图 1第 3 节中演示样例在提示词DPP中的四种位置配置ssp系统提示词开头、esp系统提示词结尾、sum用户消息开头默认配置以及 eum用户消息结尾。右侧展示了在 AG 新闻数据集上使用 QWEN-1.5B 模型的实验结果这些配置的准确率差异显著且与默认配置 sum 相比预测结果的变化百分比最高可达 45.5%。我们在情境学习(ICL)中发现了一种新的位 置偏差:DPP 偏差在这种偏差中从提示开始 到结束移动一个未改变的演示块可以使任务准 确度提高 20 %,并翻转几乎一半的模型预测(见 图 1)。1).这种现象纯粹是空间的独立于 演示内容挑战了大语言模型从任何适当格式 的上下文中学习健壮的普遍假设。尽管越来越 多的人意识到了提示的敏感性但是相对于说 明、查询或其他上下文元素来说演示定位的 作用仍然没有得到充分的探索。先前的研究主 要集中在演示选择(Liu et al.,2022)或模 板措辞(Cho et al. 2024Voronov et al.,2024)留下了理解空 间排列如何调节 ICL 功效的空白。本文通过对 跨越分类、推理和生成等八项任务的位置效应 的系统研究解决了这一问题。通过对 LLAMA3 (1B3B8B70B)和 MIXTRAL_8X7B 等模型 进行对照研究我们证明了战略布局(例如 将关键演示聚集在任务指令附近)可以产生性 能波动即使演示内容保持不变。本文主要贡献如下1.我们首先发现并量化了上下文学习中以前未报道的位置 偏差(DPP 偏差),表明简单地在提示中重新定位 一个相同的演示块可以在翻转近一半的模型预 测时将精确度提高 50 个百分点。2.基于这一认识我们设计了一个受控的评估管道它在 系统提示的开始或结束以及用户消息的开始或 结束处隔离了四个规范的演示位置因此任何 性能变化都完全归因于位置。3.为了捕捉净性 能变化和输出波动我们引入了两个与任务无 关的指标准确性变化和预测变化。使用这个 框架4.我们对 8 个任务和 10 个最先进的 LLM 进行了第一次大规模的位置效应实证研 究揭示了一致的首要偏差随着模型规模的 增长这种偏差变得不那么严重。5.最后我们将这些发现转化为实践指南。讨论DPP 偏差为何会产生我们推测DPP 偏差的产生源于两个互补性根源1架构层面因果解码器类大语言模型Causal-decoder LLMs通过自回归掩码autoregressive masking进行训练因此较早出现的 tokens词元 / 标记会对隐藏状态产生不成比例的影响而该隐藏状态又会制约后续所有预测结果。尽管系统提示、演示样例和用户消息这几个部分在逻辑上可以互换但模型底层的优化目标并非如此。例如针对 “归纳头”induction heads的机制可解释性研究Olsson 等人2022已表明注意力权重会集中在早期 tokens 和 “锚定 tokens”sink tokens上 —— 这种行为与我们观察到的 DPP 实证趋势一致。2数据层面指令微调语料库Instruction-tuning corpora本身存在位置规律性例如演示样例会固定出现在某些位置槽中进而会在模型中植入一个分布先验distributional prior。特定领域的训练集可能会增强或减弱这种效应这也解释了为何最优演示样例位置会因任务和模型的不同而发生变化。缓解 DPP 偏差的方法我们提出未来工作的两个方向旨在减少这种位置异常问题测试时校准Test-time calibration鉴于该偏差具有任务特异性与模型特异性我们提出一种基于检索的校准方法对于每个未见过的样本unseen instance利用外部嵌入模型external embedding model在带标注的参考集中找到其 k 个最近邻样本k nearest neighbours随后对这些最近邻样本标注的 “最优位置” 进行多数投票majority-vote为查询样本query instance选择合适的演示样例位置槽demo slot。这种轻量级流程无需微调成本fine-tuning cost且能动态适应输入分布偏移input distribution shifts。基于随机排列上下文的后训练Post-training on randomly permuted contexts另一种方案是通过对每个训练样本中的演示样例位置进行随机排列构建一个无偏的上下文学习语料库unbiased in-context learning corpus。在该新数据集上进行微调fine-tuning或持续预训练continued pre-training有助于模型学习位置不变表示position-invariant representations从而抵消标准指令微调流程standard instruction-tuning pipelines所诱导的结构偏好。限制虽然我们的实验揭示了演示位置如何影响 LLM 性能的强大趋势但仍存在一些限制:• 模型多样性:我们只评估了模型大小和架 构的一小部分(例如7B13B)。更大规 模的模型或不同的体系结构(例如那些 在对话中微调过的)可能表现出不同的灵 敏度模式。• 任务覆盖范围:尽管我们测试了多任务(分 类、QA、总结、推理)但是某些具有更 复杂结构的任务(例如多跳检索或对话 上下文)没有被深入研究。• 关注英语:我们的结果主要关注英语数 据。语法、词法和文字的跨语言差异可能 会导致不同的位置偏差应该进一步研 究。道德说明我们的工作侧重于提示设计的技术方面并不 直接涉及潜在的敏感内容或私人数据。然而 以下伦理考虑是相关的:1. Prompt Engineering 的误用:通过战略演 示位置增强对 LLM 行为的控制可能被利用 来更有效地生成欺骗性或有害的内容。我们鼓励研究人员在部署这些方法时结合内 容过滤和审核框架。2. 偏见和公平:如果演示带有隐含的偏见(例 如倾斜的标签分布或刻板的例子)将 它们放在提示的早期可能会放大模型输出 中的这种偏见。从业者应该小心谨慎地策 划演示集并验证输出中的意外偏差。我们相信提高对提示中空间效应的认识将 最终有助于设计更安全、更可靠的基于 LLM 的 系统同时减少误用和偏差。做个总结本文介绍并系统研究了先前被忽视的情境学习 (ICL)的一个方面:在 LLM 提示中演示位置的影 响。通过跨越十个开源模型、八个 NLP 任务和 四个典型提示位置的大规模评估我们发现了 一致的 DPP 偏差其中在提示前放置的演示 (sspesp)比在提示后放置的演示(sumeum) 产生更高的准确性和更大的预测稳定性。这些 发现在分类和生成任务中都存在并且在较小 的模型中尤为明显。 我们的分析表明不仅不同位置的表现有很大 差异而且后期演示(尤其是 eum)会导致显著 的预测波动翻转模型输出而不会提高正确 性。我们进一步表明位置敏感性受到任务和 模型规模的调节:虽然较大的模型表现出更大 的鲁棒性但它们仍然表现出非平凡的不稳定 性和跨任务移动最佳位置。 我们引入了新的诊断工具准确性变化和预测 变化来量化这些影响并揭示标准准确性指标 掩盖的隐藏波动性。我们的胜负分析加强了关 键的洞察力:没有单一的示范位置是普遍最佳 的。因此有效的提示设计必须是模型感知和 任务敏感的。 这些发现对实践中的激励策略有广泛的意义。 我们建议指令调整 LLM 的用户明确评估演示位 置而不是依赖默认或特别格式。此外位置 鲁棒性应该被认为是即时优化和指令微调流水 线的核心。未来展望首先更深入的可解释性研究可探索为何特定位置会具有优势 —— 无论是源于注意力初始化attention initialization、解码器优先性decoder primacy、指令微调模板instruction tuning templates还是训练语料惯例training corpus conventions。其次将此分析扩展至少样本思维链提示词few-shot chain-of-thought prompts及真实世界指令数据集例如 HELM、BIG-Bench有助于让这些见解更具普适性。最后开发能将位置与内容联合适配的自动化演示样例位置优化程序automated demo-placement optimization routines可为构建更稳健的上下文学习ICL系统提供一种系统性方案。此外文章在附录A8中补了一个简单的针对任务相同的实验。