深度研究型智能体的训练长期依赖昂贵且不稳定的在线强化学习(Online RL),限制了其发展与普及。一项名为OffSeeker的新研究打破了这一常规,证明了仅通过高质量离线数据与偏好优化,即可训练出媲美甚至超越主流在线RL模型的研究型Agent。这一发现不仅为AI研究领域提供了一种低成本、高效率的训练新路径,也预示着高性能Agent的开发门槛将被显著降低,具有极高的学术和工程应用价值。
智能速览
在线强化学习并非训练顶尖研究型Agent的必需品。
研究提出了DeepForge框架,可自动合成高复杂度的网络研究任务。
项目开源了首个完整深度研究资源包,包含66k QA及训练数据。
OffSeeker-8B模型在六大基准测试中表现优异,全面超越纯SFT模型。
新范式下的API训练成本几乎为零,极大降低了研究门槛。
精华内容
OffSeeker的成功,关键在于其独特的离线训练范式与高质量数据生成策略。它究竟是如何绕开在线RL,实现高性能Agent的低成本训练的?
颠覆在线RL依赖
传统观念认为,训练顶尖的研究型Agent必须依赖在线强化学习,但其过程不仅成本高昂,而且训练过程不稳定,结果难以复现。OffSeeker研究团队通过系统性地实证分析,有力地证明了这一观点可以被打破。研究结果显示,仅采用离线监督微调(SFT)结合直接偏好优化(DPO)的技术路径,其训练出的模型在性能上能够逼近,甚至在某些方面超越那些需要庞大计算资源的30B级在线RL模型。这一发现从根本上动摇了在线RL在研究型Agent训练领域的核心地位。
自建高难度数据
高质量的数据是模型成功的关键。为此,研究团队提出了DeepForge任务合成框架。该框架的创新之处在于,它无需依赖Wikipedia等经过重度预处理的数据库,而是直接基于真实的网络搜索环境,自动化地生成具有复杂、多跳和高度不确定性特征的研究任务。通过这种方法合成的数据集,其平均工具调用次数高达11.2次,远超现有公开数据集的复杂度,更贴近真实世界的研究工作流,为模型提供了更接近实际应用场景的学习素材。
完整开源生态
为了降低该领域的进入门槛,OffSeeker项目一次性开源了极为珍贵的资源包。这包括66k高质量问答对、33k的SFT训练轨迹以及21k的DPO偏好数据对。这些资源的公开,使得其他研究者和开发者无需从零开始收集和标注数据,极大地节省了时间和经济成本。这种开放共享的态度,将有力推动整个研究型Agent社区的发展,加速相关技术的迭代与创新。
性能与成本双赢
基于Qwen3-8B基础模型,OffSeeker通过纯离线训练范式取得了卓越成果。在GAIA、BrowseComp、HLE等六大权威基准测试中,融入DPO训练的模型全面超越了仅使用SFT的基线模型,证明了偏好优化在离线环境下的有效性。更重要的是,整个训练过程的API调用成本几乎为零,相较于动辄数百万美元投入的在线RL训练,OffSeeker为学术研究和商业应用提供了一个极具吸引力的低成本、高性能解决方案。
OffSeeker的出现,无疑为研究型智能体的训练开辟了一条成本更低、更易复现的全新道路。它证明了在特定领域,精心设计的离线训练策略完全可以取代昂贵的在线RL。这一转变是否会催生更多高性能的小型Agent,并加速AI在科学发现等领域的应用?