张大妈

中科大:让论文检索像研究员一样思考

源自小红薯:每日ComputerScience

01-31 19:29

传统学术搜索流程僵化,难以应对复杂科研问题。PaperScout提出了一种新范式,将论文检索转化为多轮自主决策过程,通过强化学习训练Agent,使其能像资深研究员一样动态调整搜索策略,显著提升了检索的精准度和效率。

中科大:让论文检索像研究员一样思考智能速览

  • 将论文搜索建模为多轮决策过程,取代固定搜索流程。

  • 提出PSPO强化学习方法,解决多轮Agent训练不稳定难题。

  • 训练后的小模型性能可匹敌甚至超越未经训练的大模型。

  • 通过维护论文池状态,实现对检索过程的精细化管理。

中科大:让论文检索像研究员一样思考精华内容

PaperScout的核心创新在于其颠覆性的搜索框架,它如何通过建模与训练,让AI真正拥有了“思考”的能力?

自主决策框架

传统学术搜索遵循“查询→搜索→扩展”的固定流程,在处理带约束或多轮判断的复杂问题时效率低下。PaperScout颠覆了这一模式,将论文搜索构建为一个多轮决策过程,即部分可观察马尔可夫决策过程(POMDP)。在此框架下,AI Agent不再机械地执行预设步骤,而是能够根据当前状态自主判断是继续深入挖掘现有论文的引用,还是开启一轮全新的搜索,从而极大提升了策略的灵活性。

精细化管理

为实现精准决策,PaperScout显式维护了一个包含论文内容、相关性分数及扩展状态的“论文池”。系统通过构造“已扩展/未扩展”双列表视图,让Agent在有限的上下文中清晰掌握全局进展。其奖励函数也独具匠心,并非只看最终结果,而是基于每一轮新增论文的相关性增益进行奖励,并明确惩罚重复的工具调用,确保了训练过程的稳定与高效。

PSPO训练法

多轮Agent训练的核心挑战是信用分配困难。为此,研究者提出了Proximal Sequence Policy Optimization(PSPO)方法,在“每一轮完整回复”的序列层面进行优势估计和策略更新,有效规避了传统PPO在token-level上的噪声干扰。实验表明,经过PSPO训练的Qwen3-4B小模型,在多项关键指标上能够匹敌甚至超越未经训练的Qwen3-Max大模型,证明了该方法的有效性。

效率与智能

PaperScout的智能性体现在其更高的工具调用效率和更接近人类的搜索行为上。在相同的Search/Expand调用次数下,它能检索到更多高相关度的论文,这归功于策略层面的优化而非单纯增加搜索量。在RegionCLIP的案例中,当Agent发现扩展引用的收益递减时,会主动停止扩展并转向搜索新的方向,展现了类似研究员避免陷入局部最优的智慧。

PaperScout为AI驱动的科研自动化提供了方法论与工程实践的完整范例,其决策式搜索范式代表了学术检索的未来方向。随着类似技术的成熟,未来的科研工具或将真正成为研究者的智能伙伴,大幅提升知识探索的深度与广度。下一个被AI变革的科研环节会是什么呢?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章