张大妈

中山大学:强化学习解决RAG取多取少都不对

源自小红薯:每日ComputerScience

01-17 18:33

RAG系统长期面临上下文选择难题:取少则证据不足,取多则引入噪声并浪费资源。一项名为Context-Picker的新研究,通过多阶段强化学习,将问题升级为寻找最小充分证据子集,直接优化回答质量与信息紧凑度,为该核心痛点提供了方法论创新与实证方案。

中山大学:强化学习解决RAG取多取少都不对智能速览

  • 核心问题:RAG系统在长上下文问答中,难以平衡证据的充分性与噪声的引入。

  • 方法创新:Context-Picker将上下文选择从Top-K排序转为寻找最小充分证据子集。

  • 技术路径:采用两阶段强化学习,先保障召回再精简压缩,实现渐进优化。

  • 关键设计:奖励函数显式惩罚冗余,并输出选择理由以提升模型稳定性。

  • 实验效果:在多个基准测试中,新方法的准确率比强基线提升4-18个百分点。

中山大学:强化学习解决RAG取多取少都不对精华内容

Context-Picker的成功之处,在于它改变了游戏规则,不再纠结于片段的相关性排序,而是直接学习回答问题所必需的最优证据组合。

范式转变

传统RAG系统多采用Top-K或启发式方法裁剪上下文,其隐含假设是“相关性越高越该保留”,但这往往导致关键证据缺失或噪声过多。Context-Picker从根本上转变了思路,不再进行简单的排序,而是将问题重新定义为一个“最小充分证据子集”的选择任务。其目标是精确地找到回答问题所必需,且任何部分都多余的证据集合,实现了从“找相关的”到“找必需的”的理念升级。

分阶段优化

为实现这一目标,研究设计了课程式的两阶段强化学习框架。第一阶段(Recall)侧重于高召回率,策略相对宽松,确保多跳推理所需的所有潜在证据链都不会断裂。第二阶段(Precision)则转向高精确率,强化模型的压缩能力,系统性地剔除第一阶段保留的冗余信息。这种“先保全、再求精”的渐进式优化路径,是模型性能显著提升的关键设计。

智能奖励机制

在强化学习的奖励函数设计中,Context-Picker显式地建模了“证据多了反而有害”这一事实。奖励函数同时考虑证据覆盖率与超额惩罚,且在优化过程中动态收紧对冗余的容忍度。此外,为解决强化学习奖励稀疏的难题,研究引入了离线证据蒸馏与Leave-One-Out(LOO)监督,通过generator-judge回路自动挖掘出“移除任一证据就会导致回答错误”的最小充分集,为策略学习提供了密集且高质量的监督信号。

实证表现

该方法的优越性在多个权威基准上得到验证。在LoCoMo、HotpotQA等5个长上下文或多跳问答数据集上,Context-Picker的最终模型在相同甚至更短的上下文长度下,其判断准确率相比强RAG基线提升了4至18个百分点。消融实验也进一步证明了其核心设计的合理性:移除第一阶段(召回阶段)会使性能骤降14.1%,而去掉冗余惩罚或理由输出,模型效果同样会出现显著退化。

Context-Picker为RAG系统的精细化优化提供了一个强大且新颖的框架,它证明了通过强化学习精准控制信息输入的可行性。未来,这种动态选择思路能否进一步拓展到更广泛的生成任务中,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章