通义DeepResearch的全面开源,为构建高阶AI Agent提供了新的标杆。它不仅在多项权威基准测试中性能领先,更关键的是,研究团队同步分享了从数据合成到强化学习的全套方法论。这份详尽的技术实践,为开发者提供了一条可复现的路径,降低了探索顶尖AI智能体的门槛,极具实践参考价值。
智能速览
通义DeepResearch开源,性能媲美OpenAI同类产品并在多项评测中领先。
研究团队公开了一套从数据合成到强化学习的端到端高阶Agent构建方法论。
模型能力完全基于合成数据,通过多阶段数据策略创建了海量高质量代理训练数据。
提出IterResearch范式,通过重构工作空间解决长期任务中的认知瓶颈问题。
在强化学习环节,发现稳定的数据和训练环境比算法创新对最终效果更关键。
精华内容
如何训练出一个能媲美OpenAI DeepResearch的开源智能体?通义团队不仅开源了模型,更将背后复杂的训练流程和思考毫无保留地呈现出来。
性能登顶
通义DeepResearch作为全开源Web Agent,在多个高难度信息检索与推理任务中取得了SOTA成绩。在极具挑战的Humanity’s Last Exam (HLE)上,得分达到32.9;在BrowseComp-EN和BrowseComp-ZH评测中,分别获得45.3和49.5分。此外,在用户中心化的xBench-DeepSearch测试中,其得分高达75.0,系统性地超越了所有已知的闭源与开源Deep Research代理。
合成数据引擎
该模型的核心突破之一在于其完全依赖合成数据的训练策略。研究团队提出了AgentFounder数据合成方案,通过重组来自文档、知识图谱和历史轨迹的数据,系统化地构建了海量高质量的(问题-答案)对。特别值得一提的是,他们开发了一个自动化引擎,能够生成并迭代升级博士级研究问题,通过多轮自我引导,确保任务难度的系统性提升,为模型能力奠定了坚实基础。
深度推理模式
除了标准的ReAct模式,通义团队还开发了创新的深度模式。该模式基于IterResearch范式,旨在解决传统Agent在处理复杂任务时,因信息堆积导致的认知瓶颈和噪音污染问题。IterResearch将任务解构为多个“研究轮次”,在每一轮中仅基于上一轮的关键输出重建一个精简的工作空间,使Agent能持续保持认知焦点和高质量推理,从而将规划与决策能力推向新高度。
端到端训练法
研究团队构建了Agentic CPT → SFT → RL的端到端训练闭环。在关键的强化学习阶段,他们发现,数据和环境的稳定性对效果的影响甚至超过了算法本身。为此,团队搭建了基于离线数据的合成训练环境和高效稳定的工具沙盒,确保了训练过程的可控与高效。这一整套方法论,为训练能够在动态环境中稳健解决复杂任务的AI代理提供了全新的实践范例。
通义DeepResearch的开源不仅是发布了一个强大的模型,更重要的是其背后一套可复现、可扩展的构建方法论。它为AI Agent领域的研究者和开发者提供了宝贵的实践蓝图,降低了探索顶尖智能体的门槛。未来,这套方法论能否催生出更多元化的应用?