在复杂多跳问答中,检索增强生成(RAG)常因搜索链失效或被无关信息干扰而跑偏。北京大学提出的D2PLAN新范式,通过双智能体与动态全局规划,从结构上根治了“搜不准、想跑偏”的痛点,显著提升了模型推理的准确性和稳定性。
智能速览
双智能体架构,解耦搜索、判断与推理环节。
动态全局规划,根据检索结果实时调整策略。
净化器机制精准提取关键事实,抵抗外围证据干扰。
创新两阶段训练框架,引导模型学会合理规划。
系统性削减两类核心错误,将推理失败转为信息缺失。
精华内容
面对RAG模型在复杂推理中的“失焦”难题,D2PLAN没有在原有框架上修补,而是引入了全新的双智能体协作架构。
双智能体分工
D2PLAN的核心是引入了两个智能体:Reasoner(推理者)和Purifier(净化者)。Reasoner专注于规划与推理,负责构建和调整解决问题所需的子问题序列。Purifier则负责检索相关性判断和信息压缩,它不会将原始检索结果直接交给Reasoner,而是先进行过滤和提纯。这种分工将“搜索—判断—推理”流程彻底解耦,避免了冗余信息对核心推理过程的干扰。
动态全局规划
传统方法往往是静态规划,一旦制定便难以调整。D2PLAN的Reasoner则采用显式的动态全局规划机制。在推理开始时,它会先构建一个完整的子问题序列作为初始计划。在后续的检索过程中,如果遇到失败或成功,Reasoner会动态地进行子问题细化或整体重规划。这种能力确保了即使过程中出现意外,也能及时修正方向,防止目标在多跳搜索中逐渐漂移。
抗干扰设计
被无关证据“劫持”是RAG系统的一大顽疾。Purifier智能体专门用于解决这个问题。它接收到检索结果后,会执行两个关键动作:一是判断该文档是否与当前推理步骤相关;二是从相关文档中提取出支撑推理所必需的最小事实集合。通过这种方式,只有高质量、高相关性的核心信息被传递给推理模块,极大地降低了因外围信息干扰而导致的错误推断概率。
规划导向训练
为了让模型学会这种复杂的协作模式,研究者设计了两阶段训练框架。第一阶段是SFT Cold-Start,利用一个强大的教师模型来合成符合D2PLAN工作流的高质量行为轨迹,完成模型的基础能力构建。第二阶段是SPLANRL,这是一种强化学习算法,其核心是设计了“规划导向奖励”。这个奖励不只关注最终答案是否正确,更会奖励模型生成了合理数量的子问题、以及在失败后做出了正确的计划调整行为,从而引导模型学会“思考”。
错误类型削减
通过对模型行为的系统性错误分析,D2PLAN的效果得到了验证。实验结果表明,该方法显著降低了两种核心失败类型:E1(搜索链构造错误)和E2.1(被无关证据直接劫持推理)。这意味着模型的逻辑严谨性得到了大幅提升。更重要的是,D2PLAN将大部分失败转化为了E2.2类型,即问题本身的信息缺失。相比于逻辑推理错误,承认信息不足是一种更诚实、更可控的失败模式,为后续交互提供了明确方向。
D2PLAN通过结构创新,为复杂推理任务提供了鲁棒的解决方案,其核心思想对优化各类AI系统均有启发。未来,这种规划与检索的分离协作模式,是否会成为下一代大模型推理的标准范式?