三天三个新模型都说“能看视频”,但AI长视频问答仍然是开盲盒:坑在抽帧,活儿照这三档分

源自172位全网作者

07:39

9月8日到10日,三天之内,多模态圈连着放了三个"视频输入"。9月8日,小米技术放出MiMo Desktop桌面客户端的开放邀测,同时推出MiMo-X-Pro-Preview与MiMo-X-Flash-Preview两款新模型的Preview版。9月9日,蚂蚁百灵发布Ling-3.0-flash-VL,总参数124B、单次推理只激活5.5B,官方口径是"原生支持图文与视频输入"。微博知乎

9月10日,DeepSeek正式发布V4.1 Flash,把"原生多模态视觉理解"装进新架构家族里最小的这个模型,官方称其智能水平全面超越了包括自家上一代旗舰在内的一众主流前沿模型。换代动作也很干脆:9月14日起,V4 Pro的请求将全部路由到Flash、按后者的价格计费。知乎知乎

三天三家,同时强调"原生",这是今年少见的场面。对靠"让AI替我看视频"干活的人——网课记笔记、会议记录整理、短视频素材粗筛、监控事件回查——第一反应通常是:换上新模型,把上个月没跑通的活重跑一遍。

先别急。同一周,社区侧流传着另外两份内容:知乎上有一个提问,问多模态大模型已经能识别和描述视频,为什么仍然缺乏可靠的时序感知能力,高赞回答拿了14次赞同、评论区7条跟帖。小红书上一篇被收藏28次的论文解读说得更直白——Video-LLM大概率都被"均匀抽帧"过,面对密集重复动作或长视频,传统按时间抽帧就像开盲盒,极易漏掉关键的高频动作边界,算力没少花,细节全丢失。知乎小红书

官方说"能看",一线用户说"找不到"。两句话可能都是真的,坑不在模型参数,在视频喂进模型之前的那一步:抽帧。

为什么它不是"看电影",而是"翻相册"

现在主流做法,是把视频均匀切出若干帧,当成几十张图一次性塞给模型。那条14赞的知乎回答有个很准的比喻:人的时间感靠内置"节拍器",模型天生没有这个节拍器,而我们喂视频时恨不得它一秒钟看完30分钟,它根本建立不起"时间"观念。知乎

具体到干活,就是三个坑:

  1. 高频动作容易漏。跳绳、舞步、手工步骤、体育教学,关键动作恰好落在两帧之间时,模型就是"没看见",但它会自信地编给你。

  2. "什么时候、先后顺序"答不准。帧是均匀切的,时间戳常常没喂进去。模型擅长"画面里有什么",不擅长"出现在第几秒"。

  3. 越看越长、越看越差。上海人工智能实验室等四家机构做的OST-Bench专测"移步换景"式的在线时空理解:主流模型准确率随探索步数持续下降,说明现有范式根本不适应长时序的在线设定;推理不动时,模型倾向于只看当前画面就地猜测,论文把这种现象称为"时空推理捷径";就算喂5万条数据微调让分数普涨10个点以上,真正复杂的时空推理仍然过不了50%线。36氪

最扎眼的反证在创作者那边:视频生成越热的这一年,知乎上反而越多"模型越强、我越依赖分镜"的帖子——AI视频模型越强,创作者反而越来越觉得分镜重要。如果模型的时间感知足够可靠,为什么还要人把故事拆成镜头再喂给它。知乎

那张44.8分的跑分表:解法离你的API还有多远

好消息是,这周已经有人演示了"补上这个坑长什么样、差多少"。

开源项目LLaVA-OneVision-2改了抽帧逻辑:不再按时间轴均匀抽,而是引入Codec-stream tokenization,让Token密度紧跟码流比特率和运动残差、跳过冗余帧——GOP分区、运动-残差打分、画布打包,哪里在动、哪里信息密度高,token就给哪里。在它自建的"高频动作定位"测试JumpScore上,这款8B模型拿到74.9 mAP,同规模的Qwen3-VL-8B只有30.1,差了44.8分;18项视频任务平均62.5对58.2,空间推理CrossPoint更是暴涨35分。小红书

提醒一句:JumpScore是他们自建基准,比的是8B级开源模型,这个分不能直接平移到闭源旗舰。但它证明了一件事——"看了找不到"的问题,多数不在模型脑子,而在喂给脑子之前的抽帧太糙。

另一条路线是本周流传的Mage-VL解读:视觉编码器换成"锚定帧+预测帧",看运动向量和残差能量,只对变化大、信息量高的区域做编码,视觉token直接降了75%以上;再加双系统——轻量的事件门控先判断"现在该不该开口",真到该说的时候才让因果解码器生成内容。说白了,它开始教模型的不只是"看到什么",而是"什么时候说话"。知乎

但这两个工作都还停在论文和开源8B级别,没进上面那三家的正式API或邀测入口。所以短期判断可以收得很紧:宣传里"支持视频输入"是真的,"看得懂"有折扣,"时序感知"未验证。

现在怎么干:白名单、黑名单照抄

给不能耽误的活,按本周信息量分三档:

  • 可以马上用:低时序密度视频的"有没有X"检索(网课PPT、会议白板、测评画面)、图文问答、几分钟内视频的梗概提炼、素材初筛。这些任务不要求模型懂时间,新模型降价后的成本也确实香。

  • 要用但得配人肉workaround:密集动作步骤提取、长视频事件点回查、一切"第几秒发生"的问题。三个便宜手法:分段喂(单段不超过5分钟,先问再汇总);给送进模型的帧人工带上时间戳或写进提示词;关键结论要求模型引用具体画面内容,人工抽查。

  • 暂时别交给它:安防研判、事故归因、动作矫正这类"谁先谁后、第几秒"就是全部意义的场景。模型"就地猜测"的偏好,恰好会在这些地方以最有代价的方式暴露。

值得继续盯的三个信号:厂商会不会把码流引导抽帧做进官方API;JumpScore这类"高频动作定位"测试会不会出现在新模型的官方跑分里;Mage-VL式的流式模型从论文走进产品要多久。这三个兑现之前,把"原生多模态"当成"看了就等于懂了",就是用厂商的发布会替你做了验收测试。

这轮"原生看视频"混战的本质是:所有模型都交卷了"看得见",但"时序感知"这张卷子还没人正式批改。卷子没印出来之前,活儿还得干——白名单直接用,workaround照着抄,黑名单留给下一代模型。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章