Google DeepMind的一项新研究,利用其Veo 3模型,揭示了视频模型作为通用视觉问题解决者的惊人潜力。该研究提出“Chain-of-Frame”概念,将推理过程嵌入视频帧的连续变化中,成功实现了多种视觉任务的零样本学习,这或许是计算机视觉领域“GPT时刻”的前兆。
智能速览
谷歌Veo 3模型展现通用视觉任务的零样本能力。
视觉推理或可由视频帧序列的“Chain-of-Frame”实现。
通过自然语言指令直接驱动视觉任务,交互更自然。
视频模型的先验知识为解决图像问题提供了新范式。
该研究为计算机视觉领域的“GPT时刻”带来了希望。
精华内容
将推理能力引入视觉模型一直是AI领域的重大挑战。谷歌的研究提出,视频模型中帧与帧之间的连续变化,可能正是实现视觉推理的关键所在。
视觉推理的困境
语言模型的推理能力,得益于文本天然的序列结构。但图像是静态的,缺乏这种时间维度上的“思考过程”,导致传统的思维链技术难以直接套用。这便是视觉模型在推理能力上长期停滞不前的核心原因之一。去年虽有尝试将扩散模型采样过程类比为推理,但并非最终解法。
视频模型的新解
谷歌的研究另辟蹊径,认为视频才是视觉推理的理想载体。其提出的“Chain-of-Frame”概念,将推理过程类比为视频帧之间像素在时间上的连续变化。这一思路为此前用视频生成模型解决图像编辑任务的工作提供了理论支持,并将其扩展到了更通用的视觉场景。
Veo 3的通用能力
基于Veo 3模型,谷歌通过自然语言指令,实现了包括边缘提取、图像修复、超分辨率乃至解迷宫等多种视觉任务的零样本处理。这种高度统一的处理方式,类似于大型语言模型,预示着一个通用视觉模型的诞生。其交互方式也更贴近人类习惯,使用命令式指令而非描述性文本。
视觉GPT时刻将至?
尽管当前任务精度尚有提升空间,但其展现出的通用性令人振奋。这让人联想到早期语言模型的状况,其评价体系和工程生态都需要时间迭代。这项研究证明了“大一统视觉模型”的可行性,或许计算机视觉的“GPT时刻”确实即将到来,为AI发展开启了全新想象空间。
谷歌这项研究不仅展示了Veo 3模型的强大潜力,更重要的是为视觉模型的未来发展指明了方向。以视频为载体的“Chain-of-Frame”推理范式,或将开启一个全新的AI视觉时代。当精度问题逐步解决,一个真正通用的视觉模型会带来怎样的变革?