GPT-6跑分输给MuseSpark,榜单连夜改规则反超:靠综合榜挑AI前,先认清这三个硬伤

源自244位全网作者

01:40

过去这几天,AI圈上演了一出比新剧还紧凑的戏。

9月2日,Meta发布MuseSpark 1.3,主打智能体和编码。知乎9月3日,OpenAI甩出GPT-6 Astra,总裁Greg Brockman直接喊出"欢迎来到AGI时代"。微博9月4日,知乎上炸了——有人发现第三方评测平台Artificial Analysis(下称AA)的综合智能指数里,GPT-6 Astra居然排在MuseSpark 1.3后面,热门回答的原话是"要么是OpenAI彻底拉了,要么是AA这个榜单彻底烂了"。9月5日,还没等吵出结果,AA把评分标准更新到V4.2,新规则一上线,GPT-6的分数瞬间反超MuseSpark 1.3。知乎

模型没变,跑分没变,规则变了一版,“史上最强"换了个人。OpenAI自己在发布日给出的那张AutomationBench成本-精度对比图,就是这轮"跑分逆天"叙事的门面:GPT-6 Astra的曲线一路把竞品甩在身后,连Claude Fable 5.1和Opus 5都只配用虚线标注"仅有自报分数”。跑分有多风光,问题就藏得多深——如果你这几天正打算看着综合榜单决定升级哪家的AI会员,建议先花三分钟,看清这次风波暴露出的三个硬伤。

GPT-6跑分输给MuseSpark,榜单连夜改规则反超:靠综合榜挑AI前,先认清这三个硬伤

一夜之间,V4.2到底改了什么

按知乎答主整理的新旧权重汇总表,这次改动主要包括三块:

新增两项:AA-Briefcase(私有题库,给模型一堆互相矛盾的邮件、聊天记录、表格,要求交付财务模型、PPT、备忘录)和GDP.pdf(长文档任务:表格对齐、图表读取、跨页引用、脚注和例外条款)。两项都用另一个LLM来打分。

删掉一项:GPQA Diamond,理由是"已经彻底没了区分度"——前沿模型分数都顶到天花板,再考不出差距。

降权三项:GDPval-AA(因为新加了GDP.pdf,不想GDP系列占比太高)、Terminal-Bench v2.1(对前沿模型区分度低了),以及τ³-Banking。

争议就出在最后一项。τ³-Banking上恰好是MuseSpark 1.3排第一,而GPT-6这项表现很差。降权它,GPT-6的综合分立刻好看。该答主的吐槽相当不留情面:“精准针对Muse Spark 1.3砍了一刀”“结论先行……已知Fable 5.1和GPT-6最强,那我必须把他们放前二”。知乎

平心而论,删除区分度耗尽的老基准、控制同系列权重,本身是榜单维护的正常动作,AA给出的每条理由在技术上都站得住。真正让人不舒服的是时机和方向:规则恰好改在"旗舰新品跑出低分"的当口,而改动后受益最大的恰好就是这个新品。

硬伤一:裁判可能比考生弱

这次V4.2新增的两项基准,评分方式都是LLM-as-judge——让另一个大模型当裁判。据答主统计,AA榜上这类由LLM辅助评分的基准加起来权重约60%,就算把争议最大的三项刨掉,剩下的也占35%。知乎更微妙的是,原本靠人工评判的GDPval,出于成本和效率,也改成了LLM评分。

问题在于,模型迭代太快,"够强又够中立"的裁判越来越难找。答主的原话很扎心:"做题的是GPT-6-Astra,GPT-5.6-Luna有资格做考官吗?"裁判比考生落后一代,打分就不是尺子,而是另一种噪声。

硬伤二:题库烧完的速度,追不上模型迭代

GPQA Diamond被删,是因为题目被做穿了;Terminal-Bench v2.1降权,同样是因为区分度不够。这不是AA一家的问题——整个评测行业都在经历"题库通胀"。

一个佐证来自OpenAI自己:为了排除GPT-6"背过题",他们专门用今年6到8月的20个Chrome V8高危漏洞临时出题,结果Astra的攻击代码生成成功率39%,上一代Sol只有5.5%。微博你看,连厂商自己都默认:旧题测不出新模型的真实水平。

新题还不止换考点这一种。OpenAI在ExploitGym的极难网络安全题目里藏了个"蜜罐"——正常攻击目标之外的诱饵,专门观察模型解不出题时会不会抄近路作弊。机器之心上一代Sol对蜜罐的成功利用率48.2%,Astra是0。"会不会作弊"这种行为,旧榜单里根本没有对应的考题。

GPT-6跑分输给MuseSpark,榜单连夜改规则反超:靠综合榜挑AI前,先认清这三个硬伤

题库越烧越快,榜单就只能不停换题、改规则。规则改得越勤,"跑分"这个信号的保质期就越短。

硬伤三:榜单前排的模型,和你掏钱在用的模型,基本是两批

9月1日有篇知乎专栏统计了一组扎心数据:真实调用量排第一的大模型,在榜单上只排第86位;榜单前12个席位里,只有3个进了真实调用量前12,去重之后只剩2个。作者的结论是:“大家掏钱在用的模型,和榜单排在前面的模型,基本是两批模型”。知乎专栏

用户口碑也在背离跑分。MuseSpark 1.3在AA上拿到61分的综合指数,知乎却有用户直言自己用下来"就是一坨,连v4f都比不上"——个体体验当然不能当结论,但它至少说明:分数和手感之间,可以差出这么远。知乎

社区早就在用脚投票了。8月,有人发现AA网站代码里能看到未公布的成绩,掀起一轮"GLM 5.3追平Kimi K3"的争议。知乎还有硬核玩家花了54个小时,把10个榜单做加权平均,自制了一个"可能更公平"的排行榜。知乎专栏当用户开始自己造榜,单一榜单的信用已经说明问题了。

同一个GPT-6,每个榜单里都是不同的"最强"

把这次发布前后的主流基准拉通对一遍,你会更直观地理解"跑分逆天"这四个字有多随意:

基准

GPT-6 Astra成绩

对手成绩

结论

Terminal-Bench 4.0(终端编程)

57.9%

Claude Fable 5.1为55.8%,上代Sol仅37.3%

赢,第一

DeepSWE v1.1(软件工程)

74.1%

Claude Opus 5为73.7%

基本打平

FrontierCode 1.1(前沿编程)

略低

Claude Fable 5两项均略高

小输

AA编程智能体指数

67.0

Opus 5为68.1

HLE带工具(极限难题)

57.2%

Fable 5.1为65.0%

明显输

OSWorld 2.0(操作电脑)

72.6%、40分钟

Sol为65.7%、75分钟

大幅赢

ARC-AGI-3(抽象推理)

99.9%

Sol仅7.8%

代差级碾压

AA综合智能指数

初版61.2

Fable 5.1为65.7

初版排在后面,V4.2后反超MuseSpark

八个基准,赢四个、平一个、输三个。你说GPT-6是不是"史上最强"?答案是:看营销号替你挑了哪个榜。这也是为什么每次大厂发布,各家粉丝都能找到自己想要的"第一"。下面这张OpenAI官方发布的对比表就是个例子——它只挑了自家大幅领先的七个基准,而HLE、AA综合指数这些输掉的项目,不在表里。

GPT-6跑分输给MuseSpark,榜单连夜改规则反超:靠综合榜挑AI前,先认清这三个硬伤

榜单还能不能看?能,但姿势要换

第一步:把综合榜降级,只看你场景对应的单项榜。 让AI替你操作电脑、做PPT,盯OSWorld和文档类基准;写代码,盯Terminal-Bench、SWE系列;搞研究、要硬核推理,盯HLE、FrontierMath。综合指数的本质是加权平均,而平均数恰恰是对个人选择最没用的数字——你的使用场景不会均匀分布。

第二步:看榜之前花三分钟查三件事。 题库是否公开(私有题库无法审计,比如这次新增的AA-Briefcase);评分是人工还是LLM(LLM-as-judge要看裁判是哪一代模型);规则最近一次改动的时间和理由(新品发布当口改规则的,多留个心眼)。

第三步:最准的榜单,是你自己的任务清单。 挑2-3个你每周真实会做的任务——写周报、修一个bug、整理一份表格——在候选模型上各跑一遍。知乎用户Tokoyami就是这么干的:他把一个4万多行Kotlin老项目的审查任务丢给GPT-6,9分钟跑完、一次提交5000行、review没挑出毛病,他的结论是"AA榜单完全不值得信任,这种一次就过的水平至少是fable级别"。知乎顺便,这个任务烧掉了他5小时额度的60%——榜单测不出"一次过",但你的额度和时间测得出。小红书上也有用户晒出了自己让GPT-6 Astra跑Blender建模任务的完整会话:从下达到交付29分17秒,模型自己调用工具、自己汇报结果。小红书

GPT-6跑分输给MuseSpark,榜单连夜改规则反超:靠综合榜挑AI前,先认清这三个硬伤

实测的成本其实比想象中低:GPT-6 Astra已上线OpenRouter,ChatGPT付费档在陆续推送,各家还有额度重置卡可以薅,国产模型的促销也没停过。机器之心花一个小时实测,比刷一个月榜单更接近真相。

写在最后

这场榜单风波还远没到大结局。Codex产品负责人Tibo已经预告下周还有"新东西上线"。机器之心Meta和OpenAI贴脸对打的节奏,会把榜单的更新周期压得越来越短——AA大概率还会再改规则,下一个"一夜反超"也不会太远。

对普通用户来说,与其押注哪家榜单公正,不如把自己那3个实测任务定下来。模型会换,榜单会变,你的任务不会变。

你平时靠哪个榜单挑AI工具?这次GPT-6的跑分反转,有没有动摇你的订阅计划?评论区聊聊。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章