动态RAG性能提升14个点!用4万亿token教会大模型 「什么时候该检索」

源自公众号:新智元

01-27 20:37

动态检索增强生成(RAG)面临何时检索的难题,现有方法因依赖模型自身不可靠的内部信号,常导致“自信的幻觉”。QuCo-RAG另辟蹊径,通过分析4万亿token预训练语料的客观统计来量化不确定性,成功解决了这一问题,在多项测试中实现最高14个EM点的性能飞跃。

动态RAG性能提升14个点!用4万亿token教会大模型 「什么时候该检索」智能速览

  • 现有动态RAG方法因依赖不可靠的模型内部信号而失效。

  • QuCo-RAG利用预训练语料的实体频率与共现统计来量化不确定性。

  • 其双阶段检测机制分别评估问题和生成声明的知识可靠性。

  • 在多跳QA基准上,QuCo-RAG带来5-14个EM点的显著性能提升。

  • 该方法成功迁移至Llama3、Qwen2.5等预训练数据未公开的模型。

  • QuCo-RAG以更少的检索次数和Token消耗,实现了更高的准确率。

动态RAG性能提升14个点!用4万亿token教会大模型 「什么时候该检索」精华内容

传统动态RAG依赖模型内部信号,但这往往导致自信的幻觉。QuCo-RAG提出了一种全新的范式,即利用预训练语料的客观统计来量化不确定性,从而精准判断何时需要检索。

旧法缺陷

现有动态RAG方法,如FLARE和DRAGIN,普遍依赖模型内部的生成概率、熵或注意力分数来决定何时检索。这一范式存在根本缺陷,即大语言模型的校准能力普遍较差,经常对错误答案表现出极高的置信度,导致“自信的胡说八道”。例如,DRAGIN方法可能对问题中的普通词汇标记出高不确定性,却对幻觉出的错误实体表现出低不确定性,完全无法识别真正的知识缺口。

核心洞察

QuCo-RAG的核心洞察是,大模型的事实知识源于预训练语料。因此,知识的不确定性可以通过语料的客观统计来衡量。其关键原则包括:低频实体代表长尾知识风险,模型难以可靠记忆;而零共现则意味着模型正在编造训练数据中从未出现过的实体关系,这几乎必然是幻觉。这种“零共现≈幻觉”的逻辑,为判断幻觉提供了客观依据。

双阶段检测

QuCo-RAG通过两阶段检测机制精准触发检索。第一阶段是在生成前评估问题中关键实体的频率,若平均频率低于阈值(默认1000次),则触发检索,因为低频实体代表模型可能缺乏相关知识。第二阶段是在运行时验证生成声明的可靠性,系统会提取知识三元组,并查询头尾实体在语料中的共现次数,若为零,则立即触发检索并重新生成,以阻止无中生有的幻觉。

实测领先

实验结果全面验证了QuCo-RAG的有效性。在2WikiMultihopQA和HotpotQA基准上,OLMo-2系列模型(7B至32B)获得了5到12个EM点的显著提升,远超所有基线方法。更值得注意的是,即使对于Llama3、Qwen2.5和GPT-4o/5等预训练数据未公开的模型,使用OLMo-2语料作为代理同样有效,其中Qwen2.5-32B在2WikiMultihopQA上提升了14.1个EM点。效率方面,QuCo-RAG平均每个问题仅需1.7次检索,以最低的Token消耗实现了最高性能。

未来展望

QuCo-RAG将语料统计确立为模型内部信号的可靠替代方案,其影响超越RAG本身。在AI安全领域,它可赋能模型进行选择性回答和正确性预测。在以数据为中心的AI方面,语料统计能精确识别模型知识盲区,指导训练数据的收集与合成。未来,该方法可向多语言、时序动态、非实体声明验证等方向延伸,并与智能体系统深度集成。

QuCo-RAG的成功标志着动态RAG研究从依赖主观内部信号转向利用客观语料统计的范式转变。它不仅以更高效的方式显著提升了模型性能,更为构建更可信、更鲁棒的人工智能系统开辟了一条全新路径。未来,如何将这种客观验证机制更广泛地应用于AI的各个角落,是一个值得期待的课题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章