张大妈

视频理解+开放网络搜索=首个视频Deep Research评测基准

源自公众号:新智元

01-31 20:02

传统视频AI模型被困在视频内容的孤岛里,而真实世界的复杂任务往往需要结合视觉观察与网络搜证。首个视频深度研究评测基准VideoDR应运而生,旨在评估AI模型“看视频找线索,上网搜信息,再综合推理”的能力,揭示了当前顶级模型的真实水平与未来挑战。

视频理解+开放网络搜索=首个视频Deep Research评测基准智能速览

  • VideoDR是首个结合视频理解与网络搜索的评测基准。

  • 其核心任务是让AI从视频中找线索,再上网搜索验证得出答案。

  • Gemini-3与GPT-5.2在评测中表现最佳,准确率约69%-76%。

  • 评测发现,显式的工作流模式比端到端的代理模式更具稳定性。

  • 长视频场景下的长期一致性是当前视频AI普遍面临的挑战。

视频理解+开放网络搜索=首个视频Deep Research评测基准精华内容

VideoDR的评测结果揭示了视频AI领域的一些反直觉洞察,尤其是关于模型架构和任务处理方式的思考,其结论对未来的发展方向具有重要参考价值。

性能王者出炉

在VideoDR的评测中,闭源模型表现出了明显优势。其中,Gemini-3-pro-preview和GPT-5.2构成了第一梯队,准确率达到了69%至76%的水平,显著领先于包括GPT-4o在内的其他测试模型。这一数据清晰地划分了当前视频多模态模型在复杂深度研究任务上的能力层次。

模式之争

研究对比了两种主流技术范式:Workflow(工作流)和Agentic(代理)。尽管Agentic模式因其灵活性备受推崇,但评测发现它在长视频或高难度任务中容易出现“目标漂移”,即忘记最初的任务目标。相比之下,Workflow模式通过将视频转化为结构化文本线索,为模型提供了“外部记忆”,有效防止了在漫长的搜索推理过程中遗忘关键的视觉细节,从而表现得更为稳定。

长视频照妖镜

长视频处理能力成为了检验模型成色的“照妖镜”。评测结果显示,模型在长视频场景下保持“长期一致性”的能力是当前的一大瓶颈。例如,强大的Gemini-3模型在Agentic模式下能利用其长上下文能力获得性能提升,但部分开源模型在面对长视频时,性能反而出现了大幅下降,暴露了其在信息记忆和连贯性处理上的短板。

未来破局点

VideoDR的出现,将视频理解的战场从封闭的测试集延伸到了无限的开放网络。其核心结论指出,“端到端”并非解决一切问题的万能药,模型在长链路搜索中普遍面临“记忆衰退”的困境。因此,未来的视频智能体若想胜任真实世界的复杂调研任务,必须在保持视觉线索的长程一致性上取得根本性突破。

VideoDR基准不仅为视频AI的评估设立了新标杆,更深刻指出了端到端模型在长链路任务中的记忆短板。未来的视频智能体,若想在真实复杂任务中取代人类,突破视觉信息的长程一致性将是关键所在,这会是下一个技术奇点吗?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章