过去这几天,AI圈上演了一出比新剧还紧凑的戏。
9月2日,Meta发布MuseSpark 1.3,主打智能体和编码。知乎9月3日,OpenAI甩出GPT-6 Astra,总裁Greg Brockman直接喊出"欢迎来到AGI时代"。微博9月4日,知乎上炸了——有人发现第三方评测平台Artificial Analysis(下称AA)的综合智能指数里,GPT-6 Astra居然排在MuseSpark 1.3后面,热门回答的原话是"要么是OpenAI彻底拉了,要么是AA这个榜单彻底烂了"。9月5日,还没等吵出结果,AA把评分标准更新到V4.2,新规则一上线,GPT-6的分数瞬间反超MuseSpark 1.3。知乎
模型没变,跑分没变,规则变了一版,“史上最强"换了个人。OpenAI自己在发布日给出的那张AutomationBench成本-精度对比图,就是这轮"跑分逆天"叙事的门面:GPT-6 Astra的曲线一路把竞品甩在身后,连Claude Fable 5.1和Opus 5都只配用虚线标注"仅有自报分数”。跑分有多风光,问题就藏得多深——如果你这几天正打算看着综合榜单决定升级哪家的AI会员,建议先花三分钟,看清这次风波暴露出的三个硬伤。

一夜之间,V4.2到底改了什么
按知乎答主整理的新旧权重汇总表,这次改动主要包括三块:
新增两项:AA-Briefcase(私有题库,给模型一堆互相矛盾的邮件、聊天记录、表格,要求交付财务模型、PPT、备忘录)和GDP.pdf(长文档任务:表格对齐、图表读取、跨页引用、脚注和例外条款)。两项都用另一个LLM来打分。
删掉一项:GPQA Diamond,理由是"已经彻底没了区分度"——前沿模型分数都顶到天花板,再考不出差距。
降权三项:GDPval-AA(因为新加了GDP.pdf,不想GDP系列占比太高)、Terminal-Bench v2.1(对前沿模型区分度低了),以及τ³-Banking。
争议就出在最后一项。τ³-Banking上恰好是MuseSpark 1.3排第一,而GPT-6这项表现很差。降权它,GPT-6的综合分立刻好看。该答主的吐槽相当不留情面:“精准针对Muse Spark 1.3砍了一刀”“结论先行……已知Fable 5.1和GPT-6最强,那我必须把他们放前二”。知乎
平心而论,删除区分度耗尽的老基准、控制同系列权重,本身是榜单维护的正常动作,AA给出的每条理由在技术上都站得住。真正让人不舒服的是时机和方向:规则恰好改在"旗舰新品跑出低分"的当口,而改动后受益最大的恰好就是这个新品。
硬伤一:裁判可能比考生弱
这次V4.2新增的两项基准,评分方式都是LLM-as-judge——让另一个大模型当裁判。据答主统计,AA榜上这类由LLM辅助评分的基准加起来权重约60%,就算把争议最大的三项刨掉,剩下的也占35%。知乎更微妙的是,原本靠人工评判的GDPval,出于成本和效率,也改成了LLM评分。
问题在于,模型迭代太快,"够强又够中立"的裁判越来越难找。答主的原话很扎心:"做题的是GPT-6-Astra,GPT-5.6-Luna有资格做考官吗?"裁判比考生落后一代,打分就不是尺子,而是另一种噪声。
硬伤二:题库烧完的速度,追不上模型迭代
GPQA Diamond被删,是因为题目被做穿了;Terminal-Bench v2.1降权,同样是因为区分度不够。这不是AA一家的问题——整个评测行业都在经历"题库通胀"。
一个佐证来自OpenAI自己:为了排除GPT-6"背过题",他们专门用今年6到8月的20个Chrome V8高危漏洞临时出题,结果Astra的攻击代码生成成功率39%,上一代Sol只有5.5%。微博你看,连厂商自己都默认:旧题测不出新模型的真实水平。
新题还不止换考点这一种。OpenAI在ExploitGym的极难网络安全题目里藏了个"蜜罐"——正常攻击目标之外的诱饵,专门观察模型解不出题时会不会抄近路作弊。机器之心上一代Sol对蜜罐的成功利用率48.2%,Astra是0。"会不会作弊"这种行为,旧榜单里根本没有对应的考题。

题库越烧越快,榜单就只能不停换题、改规则。规则改得越勤,"跑分"这个信号的保质期就越短。
硬伤三:榜单前排的模型,和你掏钱在用的模型,基本是两批
9月1日有篇知乎专栏统计了一组扎心数据:真实调用量排第一的大模型,在榜单上只排第86位;榜单前12个席位里,只有3个进了真实调用量前12,去重之后只剩2个。作者的结论是:“大家掏钱在用的模型,和榜单排在前面的模型,基本是两批模型”。知乎专栏
用户口碑也在背离跑分。MuseSpark 1.3在AA上拿到61分的综合指数,知乎却有用户直言自己用下来"就是一坨,连v4f都比不上"——个体体验当然不能当结论,但它至少说明:分数和手感之间,可以差出这么远。知乎
社区早就在用脚投票了。8月,有人发现AA网站代码里能看到未公布的成绩,掀起一轮"GLM 5.3追平Kimi K3"的争议。知乎还有硬核玩家花了54个小时,把10个榜单做加权平均,自制了一个"可能更公平"的排行榜。知乎专栏当用户开始自己造榜,单一榜单的信用已经说明问题了。
同一个GPT-6,每个榜单里都是不同的"最强"
把这次发布前后的主流基准拉通对一遍,你会更直观地理解"跑分逆天"这四个字有多随意:
基准 | GPT-6 Astra成绩 | 对手成绩 | 结论 |
|---|---|---|---|
Terminal-Bench 4.0(终端编程) | 57.9% | Claude Fable 5.1为55.8%,上代Sol仅37.3% | 赢,第一 |
DeepSWE v1.1(软件工程) | 74.1% | Claude Opus 5为73.7% | 基本打平 |
FrontierCode 1.1(前沿编程) | 略低 | Claude Fable 5两项均略高 | 小输 |
AA编程智能体指数 | 67.0 | Opus 5为68.1 | 输 |
HLE带工具(极限难题) | 57.2% | Fable 5.1为65.0% | 明显输 |
OSWorld 2.0(操作电脑) | 72.6%、40分钟 | Sol为65.7%、75分钟 | 大幅赢 |
ARC-AGI-3(抽象推理) | 99.9% | Sol仅7.8% | 代差级碾压 |
AA综合智能指数 | 初版61.2 | Fable 5.1为65.7 | 初版排在后面,V4.2后反超MuseSpark |
八个基准,赢四个、平一个、输三个。你说GPT-6是不是"史上最强"?答案是:看营销号替你挑了哪个榜。这也是为什么每次大厂发布,各家粉丝都能找到自己想要的"第一"。下面这张OpenAI官方发布的对比表就是个例子——它只挑了自家大幅领先的七个基准,而HLE、AA综合指数这些输掉的项目,不在表里。

榜单还能不能看?能,但姿势要换
第一步:把综合榜降级,只看你场景对应的单项榜。 让AI替你操作电脑、做PPT,盯OSWorld和文档类基准;写代码,盯Terminal-Bench、SWE系列;搞研究、要硬核推理,盯HLE、FrontierMath。综合指数的本质是加权平均,而平均数恰恰是对个人选择最没用的数字——你的使用场景不会均匀分布。
第二步:看榜之前花三分钟查三件事。 题库是否公开(私有题库无法审计,比如这次新增的AA-Briefcase);评分是人工还是LLM(LLM-as-judge要看裁判是哪一代模型);规则最近一次改动的时间和理由(新品发布当口改规则的,多留个心眼)。
第三步:最准的榜单,是你自己的任务清单。 挑2-3个你每周真实会做的任务——写周报、修一个bug、整理一份表格——在候选模型上各跑一遍。知乎用户Tokoyami就是这么干的:他把一个4万多行Kotlin老项目的审查任务丢给GPT-6,9分钟跑完、一次提交5000行、review没挑出毛病,他的结论是"AA榜单完全不值得信任,这种一次就过的水平至少是fable级别"。知乎顺便,这个任务烧掉了他5小时额度的60%——榜单测不出"一次过",但你的额度和时间测得出。小红书上也有用户晒出了自己让GPT-6 Astra跑Blender建模任务的完整会话:从下达到交付29分17秒,模型自己调用工具、自己汇报结果。小红书

实测的成本其实比想象中低:GPT-6 Astra已上线OpenRouter,ChatGPT付费档在陆续推送,各家还有额度重置卡可以薅,国产模型的促销也没停过。机器之心花一个小时实测,比刷一个月榜单更接近真相。
写在最后
这场榜单风波还远没到大结局。Codex产品负责人Tibo已经预告下周还有"新东西上线"。机器之心Meta和OpenAI贴脸对打的节奏,会把榜单的更新周期压得越来越短——AA大概率还会再改规则,下一个"一夜反超"也不会太远。
对普通用户来说,与其押注哪家榜单公正,不如把自己那3个实测任务定下来。模型会换,榜单会变,你的任务不会变。
你平时靠哪个榜单挑AI工具?这次GPT-6的跑分反转,有没有动摇你的订阅计划?评论区聊聊。