当前深度研究智能体缺乏贴近真实需求的评测体系。DeepResearch Bench II跳脱模型自评惯性,以人类专家报告为标尺,将抽象能力拆解为可验证的9430项二元判断,首次实现对信息召回、分析推理与报告呈现的三维归因诊断。
智能速览
评测基准基于400+专家工时打磨的高质量开源调查文章构建黄金标准
覆盖22个领域、132个真实研究任务,要求生成完整长篇研究报告
采用9430条原子化、可核查的二元rubrics(是/否)进行细粒度判定
评价维度明确划分为information recall、analysis、presentation三类
诊断结果指向具体短板:是证据缺失、推理断裂,还是表达失序
所有rubrics经四阶段LLM协同+人工审阅流程验证,杜绝模型先验偏移
精华内容
评测不是打分游戏,而是工程化归因——当一个智能体交出一份万字调研报告,它究竟在哪一环卡住了?DeepResearch Bench II把‘写得好不好’这个模糊命题,还原成一张可执行、可追溯、可优化的诊断清单。
范式转向
传统基准如BrowseComp聚焦于“找到答案”,本质是单点检索测试;而DeepResearch Bench II锚定用户真实目标——获得一份可信、可读、有洞见的深度研究报告。该基准不预设答案,而是以《The Markup》《ProPublica》等机构发布的开源调查报道为范文,从真实人类产出中逆向提炼任务定义与质量标准,使评测起点回归研究行为本身。
粒度革命
全基准共设置9430条二元rubrics,平均每项任务对应约71条检查点。例如在‘气候政策影响评估’任务中,rubrics不仅检验是否引用IPCC AR6原文,还逐条核查是否标注数据来源页码、是否对比不同模型预测分歧、是否说明政策落地的时间滞后性。所有条款均可通过报告文本与原始引用直接验证,无主观解释空间。
三维归因
9430条rubrics按information recall(证据完整性)、analysis(推理有效性)、presentation(结构与表达)三类严格归集。实测显示,某主流研究智能体在recall维度达标率82%,但analysis仅47%、presentation仅53%;另一系统recall仅61%,却在analysis达79%。这种分离式诊断直接暴露能力断层,避免‘总分掩盖短板’的误导性排名。
人机协同校准
所有rubrics经四阶段迭代:LLM初筛→领域专家标注→跨学科交叉复核→400+小时人工终审。最终保留的条款全部满足三项条件:能由报告文本独立验证、不依赖LLM隐含偏好、在至少两个独立专家评审中达成90%以上一致率。相较纯LLM生成的rubrics,其人类判断一致性提升3.8倍。
DeepResearch Bench II不是又一个排行榜,而是一套面向工程落地的诊断协议。它让深度研究能力的优化路径变得清晰可见:是加强跨文档证据聚合,还是重建因果推理链,抑或重构报告叙事逻辑?未来研究者能否据此构建‘修复导向’的训练信号,值得持续观察。