把图拿掉还能答对7成:这周三项研究,扒掉了多模态大模型的"视力"

源自5位全网作者

09:45

先做一道题:给你几张同一个房间的多视角照片,请回答——蓝色椅面的办公椅右边是什么?

A. 单人沙发以及旁边的一张小桌子;B. 摆着微波炉的桌子;C. 小厨房;D. 蓝色垃圾桶。

这是今天(8月19日)AI科技评论文章里的一道视觉考题。Qwen2.5-VL-7B稳稳选对A,LLaVA-OneVision-8B却选了D。按惯例,我们大概会把锅甩给"模型空间推理不行,左右不分"。但中山大学团队给模型做了一次"脑部CT":把LLaVA推理时的中间隐藏层特征提取出来,渲染成3D点云图——结果让人意外:在那张作为关键参照物的"小桌子",在模型脑海的三维世界里压根不存在。不是方向搞混了,是这个物体它根本没"看见"。知乎

这项叫SpatialSV的研究,是这周值得聊的三件事之一。而三件事串起来,指向同一个扎心的问题:你天天用来识图、问视频的多模态大模型,可能真的没在"看"。

把图拿掉还能答对7成:这周三项研究,扒掉了多模态大模型的

李飞飞团队的狠招:悄悄把图拿掉

其实今年5月,斯坦福李飞飞团队就投过一颗炸弹,而这周它又在社区里热了一轮——B站一条《李飞飞新论文:AI正在假装"看见"》的解读视频播放量超过6万,标题很直白:“圈内炸开锅,圈外一无所知”。哔哩哔哩

实验思路简单到有点狠:悄悄把图拿掉,只给模型文字题干。

结果:GPT-5、Gemini、Claude这些前沿多模态模型,在60%-90%的情况下,依然自信满满地输出详细的视觉描述和诊断结论。知乎按社区对这项研究的解读,无图模式下模型平均保留了70%-80%的原始准确率——也就是说,图片带来的真实增益,可能只有20%-30%。

更离谱的是配套实验:一个30亿参数的纯文本小模型,从没见过一张X光片,只拿X光问答的文本数据训练,就在胸部X光问答里赢了所有视觉大模型,平均分还高出人类放射科医生10个百分点。

这不是小模型突然开窍,而是考题本身漏题。“患者年龄、病史、症状描述"这些题干信息,和诊断结果之间存在强统计关联——模型根本不用看片,只要学会"题干→答案分布"这条捷径。研究团队进一步用清洗方法剔掉"没图也能答对的题"后,三大医学评测基准有74%-77%的题目被移除,模型的真实视觉成绩从60多分跌到15%-23%。知乎过去两年我们看到的一部分多模态"SOTA突破”,考的很可能不是看图,而是文本推理。

这里多说一句:8月16日量子位发布的李飞飞最新访谈里,她还在反复强调同一件事——“视觉是智能的基石”。量子位她着急是有原因的。

杨立昆的论文,被标题党带偏了

同一时间,杨立昆(LeCun)参与的ICLR 2026论文《From Tokens to Thoughts》在知乎掀起大讨论,一条高赞回答的浏览量冲到281万。知乎但"AI连鸟是什么都不懂"这类标题,把研究本身带偏了。

实验其实做得很细:拿心理学里几十年前的人类概念分类实验,和40多个语言模型内部的embedding做对比。人类认知里,知更鸟是"典型的鸟",企鹅没那么典型——模型内部这些词表示之间的距离,和人类的典型性判断像不像?

结果分两层。第一层,大模型很会分大类:"鸟、家具、水果"这些类别,所有受测模型内部的聚类都和人类类别明显对应,全部高于随机水平。第二层,类别内部出现分歧:多数模型内部距离与"哪个更像一只典型的鸟"的人类判断,相关性低于0.15。

所以这篇论文能证明的,是"LLM组织概念的方式不像人"——它们倾向形成更适合统计压缩的表示;它证明不了的,是"LLM内部没有任何意义"。这两句话差距很大,但标题党只保留第一句。

反证同样扎实:只喂黑白棋落子序列训练的Othello-GPT,内部能被解码出当前棋盘状态,人为篡改这个内部表示,模型的下一步落子会跟着变;针对Llama 2的研究发现,模型内部存在稳定编码地理经纬度和时间年代的方向。模型不是鹦鹉,它确实在预测下一个词的过程中,被逼着建起了一些内部世界结构。

三项研究串起来,其实是一句话

把三件事放在一起看,线索其实很清晰:

  • 李飞飞团队证明:当答案能从文字里猜出来时,模型可以完全不看图;

  • 杨立昆证明:模型的概念组织为"统计压缩"服务,和人类靠感知、行动、身体经验堆出来的概念系统不是一回事;

  • SpatialSV证明:一旦问题猜不出来——比如跨视角的空间关系——模型内部的3D表征哪里坍塌,它就错在哪里。8个主流多模态模型都服从同一个规律:内部几何还原越差,空间问答准确率越低。

一句话总结:现在的多模态大模型,很多时候是"先会猜,顺便会看"。文本先验能覆盖的地方,它显得无所不能;文本先验够不着的地方,才是它真实视力的边界。

把图拿掉还能答对7成:这周三项研究,扒掉了多模态大模型的

普通人怎么用?这份边界清单可以存一下

先说结论:多模态不是不能用,是要分清场景。

可以放心交给它的:

  • 截图、票据、文档里提取文字这类任务,答案就写在像素里,文本猜不出来,模型必须真看,靠谱程度高;

  • 描述图片内容、视频摘要、认花认菜认地标这类日常识别,配合常识够用;

  • 题干信息很全的问答——但你现在知道了,它可能主要在读题,不是在看图。

要多留一层心眼的:

  • 精确空间判断:桌面上的左右关系、数清楚画面里有几个人几只杯子。这是内部3D表征最容易坍塌的灾区;

  • 医疗、合同、质检这类高利害决策。李飞飞团队的研究里有个细节值得所有人警惕:远程医疗场景下,哪怕图片因网络问题没传上去,模型也不会报错,而是继续输出一份"专业诊断"——这种静默失败,必须有人工复核兜底;

  • 训练数据里少见的新奇细节和反常识组合,文本先验帮不上忙的地方,正是容易翻车的地方。

接下来值得盯的三个信号

  1. "去污染"评测会不会成为新标配。B-Clean这类清洗方法正在挤掉榜单水分,以后看到多模态跑分,不妨先问一句:把图拿掉,它还能答多少?

  2. 空间智能这条技术路线。SpatialSV证明了训练时注入显式几何约束有效——用开源3D模型自动生成监督信号,砍掉一半人工标注,就能把空间能力拉回接近全量标注的水平。知乎这也是李飞飞从V-JEPA到World Labs一路押注的方向。

  3. 模型厂商的回应。会不会有人把"无图测试"做成公开的透明度指标,值得观察。

把图拿掉还能答对7成:这周三项研究,扒掉了多模态大模型的

最后留一句能当谈资的话:多模态大模型不是瞎子,但它的视力,远没有它的口才显示的那么好。下次再有人吹"AI看图比人强",你可以反问一句:把图拿掉再测一次,它敢吗?

(注:文中李飞飞团队研究的具体数字来自社区对该研究的解读文章,原始论文口径以斯坦福团队发布为准;模型表现会随版本更新变化,结论对应2026年8月的现状。)

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章