张大妈

邱锡鹏挂帅!看视频猜剧情,AI预言家集体翻车

源自小红薯:SOTA炼丹

01-31 20:01

当大模型还在比拼“看图说话”时,复旦团队已将赛道推进至“听声看画预测未来”。这项研究首次系统评估了AI基于音视频的推理能力,揭示了当前顶尖模型在此项任务上的普遍短板,并指出了音频信息的关键作用,为多模态发展提供了新方向。

邱锡鹏挂帅!看视频猜剧情,AI预言家集体翻车智能速览

  • 复旦团队发布首个评估多模态模型未来预测能力的基准

  • 最强模型Gemini 1.5 Flash的准确率仅为64.8%

  • 研究首次强调了音频信息在未来推理中的关键价值

  • 提出的OFF训练策略能有效提升模型的预测表现

  • 当前基准存在数据规模小、多选题形式局限等问题

邱锡鹏挂帅!看视频猜剧情,AI预言家集体翻车精华内容

这项研究不仅是一场对AI未来预测能力的摸底考试,更揭示了多模态模型发展的新方向。让我们深入看看,这场“AI预言家”大考究竟考了什么,又暴露了哪些关键问题。

未来预言大考

复旦大学MOSS团队联合新加坡国立大学推出了FutureOmni基准,专门用于评估多模态大模型“预测未来”的能力。该基准包含919个视频和1034道精心设计的问题,要求模型根据视频前半段的音画信息,推理出接下来可能发生的情节,完成从感知到推理的跨越。

顶尖模型翻车

研究测试了包括Gemini 1.5 Flash、GPT-4o在内的20个主流模型。结果显示,表现最好的Gemini 1.5 Flash准确率也只有64.8%,仅比随机猜测好一些。这表明,即使是当前最顶尖的AI,在基于动态音视频进行未来预测这一复杂任务上,能力依然非常有限。

音频信息成关键

此次研究的核心亮点之一,是首次通过量化实验强调了音频在未来推理中的关键作用。过去的研究多聚焦于视觉信息,但实验证明,像玻璃破碎声、关门声等音频线索,对于预测即将发生的事件至关重要,其贡献不容忽视。

提升新路径

为提升模型的预测能力,研究团队提出了一种名为OFF(Oppositional Fine-tuning)的训练策略,并构建了一个包含7K样本的辅助数据集。通过这种针对性的训练,模型在FutureOmni基准上的表现得到了显著提升,为后续优化提供了有效的方法论。

基准的局限

尽管意义重大,但FutureOmni基准也存在一些局限性。例如,919个视频的数据规模相对偏小,可能不足以覆盖所有复杂场景。同时,采用多选题的形式进行评估,也可能无法完全捕捉和量化模型真正的推理能力,存在低估模型潜力的可能。

FutureOmni基准的出现,为多模态大模型的发展树立了新标杆,也揭示了从感知到推理的巨大鸿沟。音频信息的价值被重新发现,未来模型该如何更好地融合多感官信息来理解世界动态?这将是下一个激动人心的挑战。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章