越想越幻觉?三篇论文和14个模型一起实测:多模态"thinking模式"读图,可能还不如"不想"

源自240位全网作者

18:53

你把一张K线图丢给多模态大模型,顺手打开了"深度思考"。它写了两千字的分析,引用了均线、成交量、支撑位,结论说得理直气壮——然后你对照行情软件,发现它连图上的日期都念错了。更糟的是你指出错误,它不改,反而拉出更长一段论证来维护那个错误答案。

这不是个别现象。过去一周内,NeurIPS、EMNLP、CVPR三个会议周期里都有论文在打同一件事:多模态推理模型的思维链,不是可信度的保证书,反而可能是幻觉的预告片。而这个场景恰恰是重灾区——拿大模型读图的人,十个里有八个冲着"看图不靠谱"才开的thinking模式。

一、先说翻掉直觉的那组数据:想得更多,不等于看得更准

被NeurIPS 2026录用的C3PO给出了一组很扎眼的对比:在视觉幻觉基准AMBER上,R1-Onevision、MM-Eureka这类带显式推理的多模态模型,得分反而低于不带推理的基座Qwen2.5-VL-7B。也就是说,"会想"的那批模型,看图的准确率还不如"不会想"的版本。知乎

机制也被拆出来了。研究团队在MSCOCO的300个样本上统计注意力分配:推理模型给视觉token的注意力明显低于非推理模型,而且随着思维链越写越长,文本上下文占的注意力越来越多,图像信号的相对权重被持续稀释。视觉证据变弱之后,语言先验就开始补位——图里根本没有叉子,但模型看到沙拉和餐巾,沿着"沙拉通常配叉子"推出一段严丝合缝的推理,最后把不存在的物体写进答案。知乎

越想越幻觉?三篇论文和14个模型一起实测:多模态

更麻烦的是传播路径。按CHAIR口径把"思维链里的幻觉"和"最终答案里的幻觉"分开统计后发现:思维链里没有幻觉时,最终答案几乎总能干净;思维链里一旦混进不受图像支持的内容,大部分最终答案会一起带病出场。 EMNLP 2026的RC-DPO论文从另一个角度印证了这点:多模态推理模型CoT中的幻觉率,持续高于最终答案中的幻觉率——"思考对"和"答对"是两件事,而前者的出错面更大。 CVPR 2026的一项分析甚至把锅从"没看图"上摘掉了:模型其实看了,但生成幻觉物体时被盯的区域压根解码不出那个词,看的地方和说出来的话对不上。知乎知乎知乎

二、社区这边:比跑分更扎心的是实测战绩

学术侧讲机制,社区侧贡献的是惨烈样本。一位博主把14个主流多模态模型拉去做图文幻觉和空间推理压测,每人4轮、合计200轮对话,源码和原始日志全部公开。结果:MiniMax的60s-Flash幻觉率70%排第一,Qwen3-VL-8B约60%,GPT-5.5约20%垫底。 同一轮TradingView测图的10个模型里,6个出现幻觉——包括GPT-5.5、Gemini 3 Pro、Grok 4 Fast。K线形态识别环节,14个模型里只有GLM-4.6V一个认对。知乎

越想越幻觉?三篇论文和14个模型一起实测:多模态

两个细节比百分比更值得警惕。一是Qwen3-VL-8B面对一张烛台蜡烛图,先幻觉出不存在的形态,然后连续50轮嘴硬不改口;二是GPT-5.5收到美股开盘后的行情截图,坚持说"现在还没开盘"。这正好对上C3PO论文描述的模式:幻觉一旦进了思维链,后续推理不是纠错,而是在给错误叠论据。

小红书上"是我用的姿势不对吗"式的GPT建模翻车吐槽帖能拿到1212赞、291条评论。 知乎模型评价区里"幻觉爆炸、还会嘴硬"这类反馈也是高频词。 社区的情绪已经很明确:大家不是不知道模型会错,而是接受不了它错得又长又自信。小红书知乎

反证也要摆出来:压测是个人实验,题量少、判分口径不统一,不能当产品报告读;而且同一个测试里也有反转——GPT-5.5和Claude Sonnet 4.6在第二轮空间关系题里拿了全场唯二的100%。 所以结论不是"thinking模式一无是处",而是它的可靠性高度取决于任务形态:恰好踩在语言先验上的任务(读图报数、列举物体、判断形态),它比不思考的版本更容易带节奏。知乎

三、专业考卷:"看着像"和"能用"之间隔着一条没人及格的能力链

如果你觉得读K线不算刚需,看看工业级考卷。宾州州立大学团队牵头的OmniMech把25.1万份带尺寸标注的真实机械图纸做成基准,让通用大模型直接"图纸进、CAD代码出"。结果最强的一批商业模型(GPT 5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Plus)全卡在"看着像":体积相对误差从17.41%一路排到145.82%,最好的也有17.7%——对孔位差0.1毫米就装不上的制造业,这不是误差大小问题,是能不能用问题。知乎

越想越幻觉?三篇论文和14个模型一起实测:多模态

更有意思的是两个反直觉细节:给模型多喂渲染视图,几何指标普遍变好,但程序一次跑通的可执行率反而下降——GPT 5.4 Mini的CD从7.25降到6.56,可执行率却从60.02%掉到48.90%,更长的多图输入让程序出错率变高。 视觉信息变多和输出可靠性之间,存在真实的拉扯;上agentic多轮迭代后,可执行率能修回80.77%,但GPT 5.5这类本来就强的模型精度几乎没动——迭代教会它"别报错",教不会它"尺寸应该是多少"。知乎

医疗侧的实测同样能说明问题。B站一个医疗影像账号把8个模型拉到同一批肾小管上标注(10张图约1000根,IoU对照人工专家):GPT 5.5拿82.14分,Qwen3.5-Plus只有41.64,差出一倍。 而所有模型都没跨过临床可接受的0.6 IoU。价格这边更戏剧化:Qwen3-VL-8B输入0.5元/百万token,GPT-5.5是500元,相差1000倍——结果在肾小管任务上,便宜的小模型反而赢了。需要注明的是,这组分数出自厂商账号的实测、口径未完全披露,看相对差距可以,别把绝对分当标准答案。哔哩哔哩

四、能带走的东西:按任务决定开不开thinking,然后把验证做成习惯

把上面三块证据拼起来,给正在用多模态模型干活的人一份操作清单——先对号入座,再谈要不要转。

你的任务

thinking模式的角色

建议

图表/K线/仪表盘读数

高风险:最容易把语言先验写进推理链

先关推理跑一遍基座,两边对不上的字段人工看原图

数物体、列清单、判断形态存在性

高风险:AMBER类幻觉重灾区

要求先输出"图中可见元素列表",核对后再进入下一步

图纸/单据/证件的精确转录

高风险:OmniMech式"看着像"陷阱

尺寸、金额类字段一律OCR或规则校验兜底

多步视觉数学、复杂几何、科学问答

相对受益:这是CoT的主场

可以用,但保留每步的图像引用

风格解读、开放描述、头脑风暴

幻觉的代价主要是情绪

随便开,别当事实存档

具体动作上有五条:

  1. 拆两轮问:第一轮只问"图里有什么",第二轮才问"这意味着什么"。不让它拿一份没被你验收过的图景去推理。

  2. 读链子只找新证据:思维链里每段应该出现可回查的引用——坐标、数字、区域、刻度。链子变长但没带来新的视觉证据,基本就是在编。

  3. 拿不思考的版本做对照组:C3PO那组AMBER数据摆着,"话少的模型可能看得更仔细"在事实性任务上是成立的;关键结论别只信一个开推理的。

  4. 别当场跟它掰头:50轮嘴硬的教训是,同一对话里质疑它,它更倾向加固错误而不是修正。重开会话、换模型、换非推理档,成本都比吵50轮低。

  5. 专业场景只做草稿员:17.7%体积误差对上0.1毫米装配公差,8个模型全没过0.6的临床IoU线——这个缺口就是人存在的理由,别让模型直接签字。

接下来值得盯的信号:C3PO用"删掉约10%低信息量token"这个几乎免费的改动,把CHAIR幻觉指标压低了13%到19%。 它还顺带省了推理成本——“更短、视觉证据密度更高"很可能就是下一波thinking模式迭代的官方路线。选型时别再看对话里的"思考感”,去查模型卡报不报POPE、AMBER、CHAIR这类视觉事实性基准。自己业务敏感的,OmniMech已经把数据集和评测代码开放下载。 完全可以按同样思路攒一套几十条的自家领域迷你卷,上新模型先过一遍再谈切换。知乎知乎

越想越幻觉?三篇论文和14个模型一起实测:多模态

一句话收束:thinking模式解决的是"复杂了不会做",不解决"简单了会看错"。越想越看不准,可能是2026年多模态圈最反直觉、也最省钱的一课。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章