张大妈

北大:双智能体让RAG不再搜着搜着就跑偏

源自小红薯:每日ComputerScience

01-27 15:59

在复杂多跳问答中,检索增强生成(RAG)常因搜索链失效或被无关信息干扰而跑偏。北京大学提出的D2PLAN新范式,通过双智能体与动态全局规划,从结构上根治了“搜不准、想跑偏”的痛点,显著提升了模型推理的准确性和稳定性。

北大:双智能体让RAG不再搜着搜着就跑偏智能速览

  • 双智能体架构,解耦搜索、判断与推理环节。

  • 动态全局规划,根据检索结果实时调整策略。

  • 净化器机制精准提取关键事实,抵抗外围证据干扰。

  • 创新两阶段训练框架,引导模型学会合理规划。

  • 系统性削减两类核心错误,将推理失败转为信息缺失。

北大:双智能体让RAG不再搜着搜着就跑偏精华内容

面对RAG模型在复杂推理中的“失焦”难题,D2PLAN没有在原有框架上修补,而是引入了全新的双智能体协作架构。

双智能体分工

D2PLAN的核心是引入了两个智能体:Reasoner(推理者)和Purifier(净化者)。Reasoner专注于规划与推理,负责构建和调整解决问题所需的子问题序列。Purifier则负责检索相关性判断和信息压缩,它不会将原始检索结果直接交给Reasoner,而是先进行过滤和提纯。这种分工将“搜索—判断—推理”流程彻底解耦,避免了冗余信息对核心推理过程的干扰。

动态全局规划

传统方法往往是静态规划,一旦制定便难以调整。D2PLAN的Reasoner则采用显式的动态全局规划机制。在推理开始时,它会先构建一个完整的子问题序列作为初始计划。在后续的检索过程中,如果遇到失败或成功,Reasoner会动态地进行子问题细化或整体重规划。这种能力确保了即使过程中出现意外,也能及时修正方向,防止目标在多跳搜索中逐渐漂移。

抗干扰设计

被无关证据“劫持”是RAG系统的一大顽疾。Purifier智能体专门用于解决这个问题。它接收到检索结果后,会执行两个关键动作:一是判断该文档是否与当前推理步骤相关;二是从相关文档中提取出支撑推理所必需的最小事实集合。通过这种方式,只有高质量、高相关性的核心信息被传递给推理模块,极大地降低了因外围信息干扰而导致的错误推断概率。

规划导向训练

为了让模型学会这种复杂的协作模式,研究者设计了两阶段训练框架。第一阶段是SFT Cold-Start,利用一个强大的教师模型来合成符合D2PLAN工作流的高质量行为轨迹,完成模型的基础能力构建。第二阶段是SPLANRL,这是一种强化学习算法,其核心是设计了“规划导向奖励”。这个奖励不只关注最终答案是否正确,更会奖励模型生成了合理数量的子问题、以及在失败后做出了正确的计划调整行为,从而引导模型学会“思考”。

错误类型削减

通过对模型行为的系统性错误分析,D2PLAN的效果得到了验证。实验结果表明,该方法显著降低了两种核心失败类型:E1(搜索链构造错误)和E2.1(被无关证据直接劫持推理)。这意味着模型的逻辑严谨性得到了大幅提升。更重要的是,D2PLAN将大部分失败转化为了E2.2类型,即问题本身的信息缺失。相比于逻辑推理错误,承认信息不足是一种更诚实、更可控的失败模式,为后续交互提供了明确方向。

D2PLAN通过结构创新,为复杂推理任务提供了鲁棒的解决方案,其核心思想对优化各类AI系统均有启发。未来,这种规划与检索的分离协作模式,是否会成为下一代大模型推理的标准范式?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章