当前位置:
AIGC文章详情

跑分全线碾压,实测却集体栽在读时钟上:多模态模型的分数为什么要先打八折

源自35位全网作者

06:34

这周的多模态大模型圈子,热闹得有点过分,而且跑分一个比一个"敢写"。

8月20日,一个匿名模型 Ox Alpha 突然出现在 OpenRouter 上,104万 token 上下文、单次 13 万 token 输出、文本图片视频全模态。36氪微博网友给它起了个接地气的名字——“牛来”。有开发者抽了 10 个真实软件工程任务测它,通过率 80%,把 Fable 5 Max(65%)和 GPT-5.6 Sol Max(52%)都甩在身后。36氪

跑分全线碾压,实测却集体栽在读时钟上:多模态模型的分数为什么要先打八折

第二天,8月21日,DeepSeek 上线了自己首个多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp,官方口径是"多模态 Agent 能力接近 Opus 4.8",价格和纯文本版一分不加。知乎听起来是"神仙打架、白嫖狂欢"的一周。但把跑分和实测放在一起看,事情就有意思了。

跑分碾压,实测却在同一批细节上翻车

先看 Ox Alpha。跑分这边确实亮眼,但评测分裂也是真的:Abacus.AI 的 CEO Bindu Reddy 公开说,他们测下来这只达到较早一代模型的水平;沃顿教授 Ethan Mollick 的评价也是"惊艳程度一般"。微博社区倒是给它做了一场热闹的"亲子鉴定"——从 tokenizer 指纹、视频编码方式一路扒到 API 报错格式,最大嫌疑指向某家国产大厂,但至今没人正式认领。知乎身份先放一边,能力争议才是对我们更有用的部分。

DeepSeek Vision 也差不多。官方挑出来的那组基准确实能打:四个多模态 Agent 评测集跟 Opus 4.8 打得有来有回,两胜两负,最接近的一项只差 0.7 分。知乎DeepSWE 从 54.4 提到 59.3,纯文本能力基本没掉。知乎

跑分全线碾压,实测却集体栽在读时钟上:多模态模型的分数为什么要先打八折

但有位知乎开发者做了 9 个 case 的对照实测,画面就不一样了:迷宫路线推理,两边都答对了;截图复刻前端页面,Ox Alpha 完成度更高一些;可一到细粒度视觉题,集体露怯——“哪个动物看到了哪一面"的空间方位题,DeepSeek Vision 答错;给图片事件排时间顺序,答错;问"图上时钟几点”,DeepSeek Vision 答错,Ox Alpha 答对了但输出不稳定,得靠脚本校验才敢确认。知乎它也有高光时刻:认出了照片里的人物、读懂了论文插图、表格还原大体正确,只是边框细节有瑕疵。

跑分全线碾压,实测却集体栽在读时钟上:多模态模型的分数为什么要先打八折

数一数、看表、辨方向,这仨问题上,这波免费多模态模型集体翻车。这不是某一个模型的质量问题——是当前这一代多模态模型的普遍现状。

分数为什么虚高:顶会论文把机制讲透了

为什么跑分和实测差这么多?CVPR 2026 上恰好有一批论文专门研究"多模态评估虚高",结论相当扎心。

第一,多选题本身会泄题。BAAI 的 ReVeL 研究把多选题改写成开放式问答再测,结果所有被测模型(包括 GPT-5)在开放式题目上的成绩比多选题低 6 到 19.8 个百分点,也就是说,多选基准的分数最高能有 20% 的"膨胀"——模型可能根本没看懂图,只是靠排除法猜对了选项。知乎

第二,同样的内容,换个模态问,答案就不一样。阿姆斯特丹大学的 REST 框架把同一道题用纯图像、纯文本、图文混合三种方式呈现,测了 15 个主流模型,没有一个能做到答案完全一致。知乎而且这不是识别问题:就算文字识别全对,推理结果照样不同,“认得出字"和"看得懂图”,在模型内部根本是两回事。

第三,视觉幻觉有结构性成因:视觉信号在多层编码后逐层衰减,而模型又被训练成倾向于生成流畅文本,于是会顺着语言习惯"编"出图里没有的细节。

三条叠在一起就明白了:跑分题大多是选择题、大多偏文本化信息,很少考像素级的精细分析——数数、表针位置、遮挡关系。而真实使用场景里,这些恰恰是你最常碰到的。分数和实测之间的落差,不是模型"故意放水",是尺子本来就只量了一部分能力。

一张实用的"跑分打折表"

基于目前这些证据,整理一份简单参照,选模型、看新闻都用得上。

这些分数,至少打八折再看:单一选择题基准的总分;小样本测试成绩(比如 Ox Alpha 那个 80%,一共只测了 10 个任务);自报家门式的"碾压""吊打"结论——厂商挑的基准,往往是它考得最好的那几门。

这些参考,相对靠谱:同条件下多 case 的对照实测;细粒度任务的错误率统计;同一内容换模态的一致性测试。

至于"现在的免费多模态到底能干什么",按目前的实测证据,大致分两档:

放心用的:大字文本识别和截图信息提取、表格识别还原(边框细节偶有瑕疵)、图表趋势判读、按截图复刻前端页面、论文插图和照片内容描述。

先别指望的:精确计数(图里几辆车几个人)、时钟仪表精确读数、细粒度空间推理(谁在左谁被挡住)、图片事件时间排序、小目标识别。

跑分全线碾压,实测却集体栽在读时钟上:多模态模型的分数为什么要先打八折

想自己上手,先带三个测试题

Ox Alpha 目前可以在 OpenRouter、OpenCode 免费调用(匿名期限时);DeepSeek Vision 的 API 与纯文本版同价,单张图最多只折算 384 个 token,高峰时段理解一张图的成本不到 1 厘 2。知乎具体接入方法站内外已经有不少教程,这里给个更实用的:三道试金石。以后试任何多模态模型,先甩这三张图——

  1. 找一张指针式时钟照片,问"现在几点";

  2. 找一张人流密集或车流密集的街景,问"图中能明确看到的车/人有几个";

  3. 找一道正方体展开图选择题,让它选答案并说理由。

三题全对,这个模型的视觉感知已经走在当前平均水平前面;错一两道也别急着骂垃圾——这正是全行业目前集体翻车的地方。真正该盯的,是你自己要用它干的那个场景:拿文档识别就喂它你的文档,拿图表分析就喂它你的图表,比任何跑分都准。

最后说几个值得继续盯的信号:Ox Alpha 什么时候揭面——按 OpenRouter 匿名模型的惯例,匿名期结束后总会有人出来认领,此前 Pony Alpha、Kivine 都有过类似剧本,也有爆料称 8 月 28 日某家厂商新模型开源,谜底可能随之揭晓。微博另外值得盯的是 DeepSeek Vision 什么时候从 Exp 转正、1.6T 参数的 Pro 版何时补上视觉,以及会不会有更多厂商跟进"开眼不涨价"——视觉理解正在从增值功能变成大模型的默认配置。

一句话收尾:多模态这事,“看得见"和"看得清"是两回事。跑分告诉你前者,实测才告诉你后者。在免费模型遍地开花的当下,先把跑分学会打折——以后无论再来一头什么"牛”,你都带不动。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章