当大模型还在比拼“看图说话”时,复旦团队已将赛道推进至“听声看画预测未来”。这项研究首次系统评估了AI基于音视频的推理能力,揭示了当前顶尖模型在此项任务上的普遍短板,并指出了音频信息的关键作用,为多模态发展提供了新方向。
智能速览
复旦团队发布首个评估多模态模型未来预测能力的基准
最强模型Gemini 1.5 Flash的准确率仅为64.8%
研究首次强调了音频信息在未来推理中的关键价值
提出的OFF训练策略能有效提升模型的预测表现
当前基准存在数据规模小、多选题形式局限等问题
精华内容
这项研究不仅是一场对AI未来预测能力的摸底考试,更揭示了多模态模型发展的新方向。让我们深入看看,这场“AI预言家”大考究竟考了什么,又暴露了哪些关键问题。
未来预言大考
复旦大学MOSS团队联合新加坡国立大学推出了FutureOmni基准,专门用于评估多模态大模型“预测未来”的能力。该基准包含919个视频和1034道精心设计的问题,要求模型根据视频前半段的音画信息,推理出接下来可能发生的情节,完成从感知到推理的跨越。
顶尖模型翻车
研究测试了包括Gemini 1.5 Flash、GPT-4o在内的20个主流模型。结果显示,表现最好的Gemini 1.5 Flash准确率也只有64.8%,仅比随机猜测好一些。这表明,即使是当前最顶尖的AI,在基于动态音视频进行未来预测这一复杂任务上,能力依然非常有限。
音频信息成关键
此次研究的核心亮点之一,是首次通过量化实验强调了音频在未来推理中的关键作用。过去的研究多聚焦于视觉信息,但实验证明,像玻璃破碎声、关门声等音频线索,对于预测即将发生的事件至关重要,其贡献不容忽视。
提升新路径
为提升模型的预测能力,研究团队提出了一种名为OFF(Oppositional Fine-tuning)的训练策略,并构建了一个包含7K样本的辅助数据集。通过这种针对性的训练,模型在FutureOmni基准上的表现得到了显著提升,为后续优化提供了有效的方法论。
基准的局限
尽管意义重大,但FutureOmni基准也存在一些局限性。例如,919个视频的数据规模相对偏小,可能不足以覆盖所有复杂场景。同时,采用多选题的形式进行评估,也可能无法完全捕捉和量化模型真正的推理能力,存在低估模型潜力的可能。
FutureOmni基准的出现,为多模态大模型的发展树立了新标杆,也揭示了从感知到推理的巨大鸿沟。音频信息的价值被重新发现,未来模型该如何更好地融合多感官信息来理解世界动态?这将是下一个激动人心的挑战。