复旦提出的VideoLoom模型,通过创新的SlowFast视觉token策略与MLLM-SAM2统一架构,有效解决了视频理解中长期存在的时空割裂问题。该模型不仅刷新了多项时空定位任务的SOTA指标,还配套推出了数据集与评估基准,为视频多模态领域的研究提供了新的工具和思路。
智能速览
VideoLoom是一个统一视频时空理解的多模态大模型框架。
采用SlowFast视觉token平衡时间覆盖与空间精度。
通过[SEG]连接MLLM与SAM2实现端到端时空定位。
构建了包含8.7k视频段和精细标注的LoomData数据集。
提出LoomBench评估基准,更全面衡量时空联合理解能力。
在ReVOS等多项任务上显著刷新了SOTA指标。
精华内容
VideoLoom的核心突破在于,它并非简单叠加时间或空间模型,而是构建了一个真正统一的框架,让语言推理与视觉分割无缝协作,从根源上提升了视频理解的深度。
双路视觉Token
模型采用SlowFast视觉Token策略来处理视频信息。Fast Tokens对整段视频进行高频采样,最多可达128帧,但单帧Token密度较低,其目标是捕捉全局动作和时间动态。与之相对,Slow Tokens仅针对极少数关键帧进行高密度、高分辨率采样,用于提取精细的空间细节。这种双轨并行的设计,使模型在固定的计算预算内,能够同时兼顾长时序推理与短瞬间的精确定位,解决了传统方法难以平衡时空信息的难题。
端到端架构
VideoLoom的架构核心是InternVL3与SAM2的深度集成。为了实现时空理解的统一,模型引入了特殊的[SEG]作为中介桥梁。当大型语言模型(LLM)识别到涉及空间定位的指令时,会生成[SEG]标记,该标记的隐藏状态随后被投射为目标嵌入,并直接作为提示输入SAM2解码器。这种端到端的连接方式,使得模型能够将通过语言推理出的时序上下文,直接转化为精确到像素的物体分割轨迹,实现了从“看懂”到“指认”的跨越。
全新评测基准
为了更客观地评估模型的“时空联合理解”能力,研究团队推出了包含1400多个问答对的LoomBench评估基准。该基准的创新之处在于,除了传统的“何时”和“何地”问题,还设计了“联合问题”。这类问题要求模型先通过时间推理锁定动作发生的具体时段,再在该时段内进行空间定位,有效避免了单一维度评估的局限性。同时,针对查询片段在视频中占比较小的情况,提出了双向前景J&F指标,仅在目标时空区间内计算精度,使评估结果更为真实可信。
VideoLoom不仅是一个性能优越的模型,更是一套推动视频理解领域发展的完整解决方案。它通过统一架构、新数据集和评测基准,为后续研究指明了方向。未来,这种时空联合的理解范式,将如何影响视频搜索、内容创作乃至人机交互,值得持续关注。