张大妈

VideoDR:让视频推理学会在开放网络深度调研

源自小红薯:啊啊啊啊啊哦哦哦哦哦

01-14 12:55

VideoDR基准的出现,标志着视频推理技术正从理解视频内容,迈向在开放互联网中进行深度调研的新阶段。它挑战的并非模型是否会看视频,而是如何利用视频线索,在广阔网络中搜证、验证并完成复杂任务,这对评估AI的真实能力提出了更高要求。

VideoDR:让视频推理学会在开放网络深度调研智能速览

  • 传统VideoQA问题封闭,无法模拟现实世界的复杂调研需求。

  • VideoDR要求模型结合视频线索与开放网络搜索,完成证据链闭环。

  • 其核心流程包含多帧锚点定位、交互式深搜与可验证推理三个环节。

  • 基准通过双重依赖性测试,确保题目必须同时依赖视频和网络信息。

  • 研究发现,长链推理的主要瓶颈是长程一致性,而非搜索能力本身。

VideoDR:让视频推理学会在开放网络深度调研精华内容

VideoDR的提出,旨在打破传统视频问答的“闭卷考试”模式,推动AI模型像人类研究员一样,根据视频线索进行跨平台的深度研究与验证。

超越传统VideoQA

过去的视频问答(VideoQA)任务存在明显局限,可以被称为“开卷但封闭”。这类任务默认所有线索都包含在视频内部,问题也是封闭且有标准答案的,模型只需理解视频并生成答案即可。然而,现实世界中的信息需求远比这复杂,例如看到博物馆展品的视频后,可能会想查询该馆官方推荐列表中离它最近的另一个展品的注册编号,这已超越单纯的视频理解范畴。

定义全新推理闭环

VideoDR为此定义了一个完整的推理闭环:Video(视频)→ Anchors(锚点)→ Search(搜索)→ Evidence(证据)→ Verified Answer(验证答案)。它评测的核心不再是模型的“答题能力”,而是更贴近现实的“干活能力”,具体体现在三个不可或缺的环节:首先是多帧锚点,通过分析多帧画面来稳定捕捉关键线索,避免单帧猜测的偏差;其次是交互式深搜,模型能自主规划关键词、模拟点击和定位信息;最后是可验证推理,确保视频线索与网页证据能够相互对应,形成可被复查的证据链。

严苛的双重验证

为了确保测试的有效性,VideoDR采用了严苛的双重依赖性测试。研究团队会系统性地剔除两类题目:一类是仅通过观看视频就能回答的题目,另一类是仅通过文本搜索就能回答的题目。最终留下的题目,必须同时满足两个条件:既需要对视频的深度理解,也需要在开放网络上进行深度搜索,并完成多跳信息的对齐验证。这种设计彻底杜绝了模型“撞大运”得分的可能性,保证了评测的严谨性。

长程一致性是关键

一个反直觉的结论是,端到端的模型并非万能。当推理链路变长,涉及多个页面和跳转时,模型最常见的崩溃点并非“不会搜索”,而是“线索漂移”或“记忆衰退”。这揭示出当前多模态模型在长程任务中真正的瓶颈是长程一致性,即如何在长链路中保持对初始线索的准确追踪和信息的连贯性。这一发现为后续模型优化指明了关键方向。

VideoDR基准不仅是一个评测工具,更是对视频智能体未来发展方向的指引。它强调的“干活能力”与“可验证性”,预示着AI模型将从被动的观察者转变为主动的研究者。未来,当模型能胜任此类任务时,人与AI的协作将进入何种新境界?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章