张大妈

中科大&微软:让AI真正理解一小时视频

源自小红薯:每日ComputerScience

02-05 05:16

长视频理解是AI领域的难题,常因信息碎片化导致语义断裂。中科大与微软联合提出的HAVEN框架,通过统一的结构化方法,让AI能对一小时以上的视频进行连贯推理与深度理解,为多模态研究提供了新思路。

中科大&微软:让AI真正理解一小时视频智能速览

  • 视听实体凝聚技术,解决了角色跨场景跟踪的一致性问题。

  • 构建四层分层索引,为不同粒度问题提供低成本上下文锚点。

  • 采用双阶段合并机制,显著提升视频实体识别的准确率。

  • Agentic Search推理策略,结合多工具实现目标驱动的信息检索。

  • 文本优先、视觉兜底策略,兼顾了推理效率与准确性。

中科大&微软:让AI真正理解一小时视频精华内容

HAVEN框架的成功关键在于其系统性的设计,它如何逐一攻克长视频理解中的核心障碍?

实体凝聚

长视频中,同一角色可能因换装、光影变化导致视觉外观不一致,传统方法会将其误判为不同实体。HAVEN利用说话人分离技术,将稳定的语音身份与变化的视觉形象进行绑定与融合。这种方法能有效聚合跨场景、跨时间点的同一实体,从根本上解决了实体碎片化问题,为后续的连续推理提供了基础。

分层索引

面对海量视频信息,HAVEN在离线阶段构建了一个四层结构化索引:全局摘要、场景、时间片段和实体。这种设计允许模型在面对不同问题时,能直接定位到最相关的信息层级,无需遍历全部数据。例如,查询“主角在结局时的穿着”可以直接调用实体和场景索引,极大降低了检索和在线推理的成本。

智能检索

HAVEN的在线推理部分采用了一种Agentic Search机制,模拟人类“思考-行动-观察”的循环。模型会先思考问题,然后选择最合适的工具,如场景浏览、文本检索或视觉检索,在获得结果后进行观察并调整下一步行动。这种多工具协作、逐步收敛的策略,使其能够处理需要多步推理的复杂问题,而不是简单的一问一答。

效率策略

视觉模型计算成本高昂,HAVEN对此采用了“文本优先、视觉兜底”的高效策略。系统会优先使用低成本的文本嵌入和关键词检索来定位信息。只有当文本信息不足以回答问题时,才会调用成本更高的视觉模型进行精细分析。这种设计确保了系统在保证高准确率的同时,也能具备可观的推理效率。

HAVEN框架通过结构化与智能化,为AI长视频理解树立了新标杆。它不仅提升了技术指标,更展现了将复杂问题拆解解决的系统化思路。未来,这种方案有望在视频摘要、内容审核等领域发挥巨大作用,你认为它还能应用在哪里?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章