Google 最新研究发现,一个简单操作——将提示词复制粘贴两遍,能让主流大模型在非推理任务上的准确率最高暴涨 76 个百分点。该技巧不仅效果显著,还不增加时间与成本。它巧妙地解决了大语言模型因架构限制而产生的“因果盲点”问题,为提升 AI 应用效果提供了全新视角。
智能速览
Google 研究证实,重复提示词能让大模型非推理任务准确率最高提升 76%。
该技巧对 Gemini、GPT-4o、Claude 等主流模型均有效,实测 70 组任务 47 胜 0 负。
其原理是弥补了 Transformer 架构“从左到右”单向处理的“因果盲点”短板。
此方法几乎不增加耗时与成本,是真正意义上的“免费午餐”性能提升。
该技巧仅适用于信息提取、分类等非推理任务,对复杂数学逻辑题无效。
重复提示词是把双刃剑,既可能被用于“越狱”攻击,也可用于加固安全防护。
精华内容
这个看似无厘头的操作,背后实则揭示了当前大语言模型架构的底层短板,也为提升模型性能提供了一个全新的、低成本且立即可行的角度。
“复读机”的威力
Google Research 团队的一项发现令人惊讶:只需将给大模型的提问原封不动地重复一遍,就能让其在众多非推理任务上的表现发生质变。在名为“NameIndex”的测试中,让 Gemini 2.0 Flash-Lite 从一串 50 个名字里找出第 25 个,原本准确率仅有 21.33%;但在将名单和问题重复输入后,准确率飙升至 97.33%,完成了从“学渣”到“学霸”的逆袭。
这项研究覆盖了 ARC、OpenBookQA 等常见基准,测试了从轻量级 Gemini 到重量级 Claude、DeepSeek 在内的多种模型。在 70 组非推理任务的对比中,这个“复读机”技巧取得了 47 胜 0 负的惊人战绩,其余 23 组均为平局,效果显著到令人难以置信。
为何能开窍?
这并非玄学,而是对症下药。当前主流大模型本质上是“因果语言模型”,其处理信息如同走单行道,只能从左到右读取,无法回头。这种单向性导致了“因果盲点”:模型处理到后文时,可能已经忘记了前文的关键信息。
例如,当“问题”出现在“上下文”之前时,模型读完问题再去读上下文,很可能早已忘记问题本身。而重复提示词,相当于把“问题”变成了“问题+问题”。模型在处理第二遍问题时,第一遍的内容已存在于其注意力范围内,使其有了“回头看”的机会,从而能精准捕捉信息并给出正确答案。
真・免费午餐
最吸引人的是,这项性能提升几乎是零成本的。将提示词翻倍,是否会加倍耗时和费用?测试结果是否定的。大模型处理分为高度并行的“预填充”阶段和串行的“生成”阶段。重复提示词仅略微增加了并行的预填充时间,现代 GPU 处理极快,用户几乎感觉不到延迟。
这意味着,企业和开发者无需升级到昂贵的超大模型,只需利用轻量级模型配合这个简单技巧,就能在检索、信息提取等任务上达到甚至超越未优化的顶配模型性能,性价比极高。
并非万能灵药
这个技巧并非万能,其适用场景有明确边界。研究明确指出,它仅在“非推理任务”中表现卓越,如信息提取、简单分类、直接问答等。一旦涉及需要多步推导的复杂数学题或逻辑推理题,其效果便会大打折扣。
当研究人员将“重复提示词”与“思维链”技巧结合时,结果趋于平淡:在 28 组推理测试中仅赢 5 组。原因在于,擅长推理的模型本身就会在答题前“复述”题目,此时人工重复指令反而可能多余,甚至干扰其固有思路。因此,解数学题时还是应回归思维链,避免画蛇添足。
安全双刃剑
任何增强注意力的技术都可能是一把双刃剑。研究人员警示,攻击者可能利用此技术进行“重复注入”攻击,将“忽略之前指令”等恶意指令重复多遍,从而集中模型的注意力,突破其安全防线。
但换个角度,这也为防御者提供了低成本加固方案。防御者可以在系统提示词的开头,将安全规则和禁止行为重复两遍,相当于给模型上了“双保险”,使其更重视约束条件,从而轻松提升安全性。
这项研究有力地证明,能解决问题的技巧往往不必复杂。在追求更大模型和更复杂提示工程的浪潮中,一个简单的“复制”技巧提供了意想不到的性能飞跃。它不仅是一个即时可用的工具,更启发我们重新思考提升 AI 效能的路径,或许最有效的优化,就隐藏在最朴素的操作中。