张大妈

惊!复制粘贴提示词,大模型直接变学霸?

源自公众号:智元宇宙

01-31 20:10

Google 最新研究发现,一个简单操作——将提示词复制粘贴两遍,能让主流大模型在非推理任务上的准确率最高暴涨 76 个百分点。该技巧不仅效果显著,还不增加时间与成本。它巧妙地解决了大语言模型因架构限制而产生的“因果盲点”问题,为提升 AI 应用效果提供了全新视角。

惊!复制粘贴提示词,大模型直接变学霸?智能速览

  • Google 研究证实,重复提示词能让大模型非推理任务准确率最高提升 76%。

  • 该技巧对 Gemini、GPT-4o、Claude 等主流模型均有效,实测 70 组任务 47 胜 0 负。

  • 其原理是弥补了 Transformer 架构“从左到右”单向处理的“因果盲点”短板。

  • 此方法几乎不增加耗时与成本,是真正意义上的“免费午餐”性能提升。

  • 该技巧仅适用于信息提取、分类等非推理任务,对复杂数学逻辑题无效。

  • 重复提示词是把双刃剑,既可能被用于“越狱”攻击,也可用于加固安全防护。

惊!复制粘贴提示词,大模型直接变学霸?精华内容

这个看似无厘头的操作,背后实则揭示了当前大语言模型架构的底层短板,也为提升模型性能提供了一个全新的、低成本且立即可行的角度。

复读机”的威力

Google Research 团队的一项发现令人惊讶:只需将给大模型的提问原封不动地重复一遍,就能让其在众多非推理任务上的表现发生质变。在名为“NameIndex”的测试中,让 Gemini 2.0 Flash-Lite 从一串 50 个名字里找出第 25 个,原本准确率仅有 21.33%;但在将名单和问题重复输入后,准确率飙升至 97.33%,完成了从“学渣”到“学霸”的逆袭。

这项研究覆盖了 ARC、OpenBookQA 等常见基准,测试了从轻量级 Gemini 到重量级 Claude、DeepSeek 在内的多种模型。在 70 组非推理任务的对比中,这个“复读机”技巧取得了 47 胜 0 负的惊人战绩,其余 23 组均为平局,效果显著到令人难以置信。

为何能开窍?

这并非玄学,而是对症下药。当前主流大模型本质上是“因果语言模型”,其处理信息如同走单行道,只能从左到右读取,无法回头。这种单向性导致了“因果盲点”:模型处理到后文时,可能已经忘记了前文的关键信息。

例如,当“问题”出现在“上下文”之前时,模型读完问题再去读上下文,很可能早已忘记问题本身。而重复提示词,相当于把“问题”变成了“问题+问题”。模型在处理第二遍问题时,第一遍的内容已存在于其注意力范围内,使其有了“回头看”的机会,从而能精准捕捉信息并给出正确答案。

真・免费午餐

最吸引人的是,这项性能提升几乎是零成本的。将提示词翻倍,是否会加倍耗时和费用?测试结果是否定的。大模型处理分为高度并行的“预填充”阶段和串行的“生成”阶段。重复提示词仅略微增加了并行的预填充时间,现代 GPU 处理极快,用户几乎感觉不到延迟。

这意味着,企业和开发者无需升级到昂贵的超大模型,只需利用轻量级模型配合这个简单技巧,就能在检索、信息提取等任务上达到甚至超越未优化的顶配模型性能,性价比极高。

并非万能灵药

这个技巧并非万能,其适用场景有明确边界。研究明确指出,它仅在“非推理任务”中表现卓越,如信息提取、简单分类、直接问答等。一旦涉及需要多步推导的复杂数学题或逻辑推理题,其效果便会大打折扣。

当研究人员将“重复提示词”与“思维链”技巧结合时,结果趋于平淡:在 28 组推理测试中仅赢 5 组。原因在于,擅长推理的模型本身就会在答题前“复述”题目,此时人工重复指令反而可能多余,甚至干扰其固有思路。因此,解数学题时还是应回归思维链,避免画蛇添足。

安全双刃剑

任何增强注意力的技术都可能是一把双刃剑。研究人员警示,攻击者可能利用此技术进行“重复注入”攻击,将“忽略之前指令”等恶意指令重复多遍,从而集中模型的注意力,突破其安全防线。

但换个角度,这也为防御者提供了低成本加固方案。防御者可以在系统提示词的开头,将安全规则和禁止行为重复两遍,相当于给模型上了“双保险”,使其更重视约束条件,从而轻松提升安全性。

这项研究有力地证明,能解决问题的技巧往往不必复杂。在追求更大模型和更复杂提示工程的浪潮中,一个简单的“复制”技巧提供了意想不到的性能飞跃。它不仅是一个即时可用的工具,更启发我们重新思考提升 AI 效能的路径,或许最有效的优化,就隐藏在最朴素的操作中。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章