这周的大模型圈,三件事撞在了一起。
9月22日凌晨,小米开源 MiMo-V2.6 系列;中午雷军发帖晒出成绩:AA(Artificial Analysis)智能指数开源模型第一、所有模型并列第六,2401 个赞、309 条评论。同一天,马斯克这边放出了预告近两个月的 Grok 4.7;还是这一天,Anthropic 发布 Opus 5.5。9月28日,一张被马斯克批示"赞同"的全球大模型梯度榜又开始在中文互联网刷屏。微博
而在知乎那条"如何评价小米 MiMo V2.6 登上AA开源榜第一名"的 97 条评论里,是另一个现场——
有人在评论区总结得直接:ds 霸榜第一是能力强、斩杀线,小米霸榜第一则是刷分、野榜、作弊。 有人建议先观望,毕竟小米"跑分没输过、体验没赢过"的老印象还在。更扎心的是拿了 76 个赞的中转群实况:群里一般优先用 GPT/CC,拉完了就换 DeepSeek/GLM,mimo 是什么,没人用过。知乎知乎
看起来互相矛盾,其实都是真的。这正是大模型世界每轮发布季都会重演、但每轮都有人当真的场面:榜单第一和"查无此人"可以同时成立。真正有用的反应不是在"赢了"和"野榜"里二选一,而是先搞明白:每张榜量的是现实的哪一面,以及那个"便宜 29 倍"到底对谁成立。
先把硬账摆出来:这次登顶是有实底的
按可核实的公开数据(AA 同口径,9月22-28日区间):
智能水平:MiMo-V2.6-Pro 的 AA Intelligence Index 得分 46,国产第一、全球开源第一,落后 GPT-5.6 Sol 1 分,与 Grok 4.7 持平,超过了 Kimi K3 和 Qwen3.8 Max。知乎
任务成本:MiMo-V2.6-Pro 每 Intelligence Index 任务成本约 0.13 美元,整轮评估花了 206.66 美元;Grok 4.7 在 xhigh 档单任务 3.74 美元、整轮 4967.35 美元——差出近 29 倍;high 档 2.73 美元,也是 21 倍。36氪
规格:Pro/Flash 全系原生全模态,支持最大 128K 输出。 MiMoDesktop 给 Pro 配了 UltraSpeed 模式,最高 20 倍输出速度,上下文做到 1M(同期 Grok 4.7 是 500K)。
生态信号:上一代 MiMo-V2.5 上线两个月在 OpenRouter 调用量涨约 616%,7 月登上周榜月榜第一,那周单周调用量 10.5 万亿 token、环比再增 12%,前五全是中国模型。 从 2026 年 6 月起,中国模型的调用量份额已超过美国模型。微博

这轮不只是"国产模型又拿第一"。同一天发 Opus 5.5 的 Anthropic,把典型工作负载成本降了 40%、输出速度提了 30% 以上、cache read 价格砍了 60%。 这和 MiMo 的低价登顶指向同一个变化:行业价值锚正从"能力上限"挪向"单位智能成本",AA 那个被央视《经济半小时》报道引用过的"高智能·低成本最优象限",业内已经管它叫斩杀线:掉到线以下的模型,要么提能力,要么降价。知乎
"第一"有三种口径,你看到的榜只量了一面
9 月头两周,五家厂商发了六个旗舰。发布季一到,榜单就成了流量密码,而同一批模型,三份主流榜单给出三个"第一"——每一个都真,也都不能直接当选型依据:
AA 智能指数:固定基准评测,聚合数学、科学、编程、多步推理等十项基准,分数可复现、没有真人情绪。但它的口径会变——9 月 4 日 AA 把指数从 v4.1 升到 v4.2,调了任务组成和权重,Claude Fable 5.1 的账面分从报道时的 66 掉到 57。模型一行没动,账面掉 9 分;转发标题不管这些,"暴跌 9 分"比"口径调整"有流量得多。知乎
LMArena:众包盲测,402 个模型、28 家厂商、累计 1180 万次真人匿名投票。可信度来自真人,毛病也来自真人——名次一半是模型水平,一半是曝光时长。9 月 13 日快照里,排第一的 fable-5 攒了两个多月、30.1K 张票;9 月 2 日刚发的 fable-5.1-max 只有 5.8K 票,压在第五。发布第一天去读榜,读到的是别人两个月的投票积累。
OpenRouter 调用榜:量的是中转站和开发者的真实用量。口径问题是:闭源模型的调用大多走官网,不过中转站,所以开源模型在榜上天然占优——和盲测榜的声望逻辑正好相反。知乎
名次差不是感觉,是实打实的:Kimi K3 在 AA 排第 8,到 LMArena 掉到第 17;GLM-5.3 从第 9 掉到第 19;Qwen3.8-Max 在 AA 勉强挂住第 10,在 LMArena 前 20 里干脆找不到。就算只看这轮发布季的新模型,换一张"近 30 天新增大模型得分"的榜,坐第一的又是 Kimi K3(1382 分),MiMo-V2.6-Pro 以 1338 分紧随其后。"某某模型全球前十"这种标题,先问一句哪个榜、哪个快照,再决定信几成。知乎

还有第四个维度最容易被忽略:速度。9 月 24 日 Speed 榜的结论是"AI 最快的不是最强的,最强的几乎最慢"。 Grok 4.7 xhigh 每秒只处理 39 个词元,就是最直接的注脚。 对蹲在屏幕前等回复的你,"46 分持平"可能根本不重要,秒出才重要。知乎36氪
29 倍的差价是不是真的,取决于你的任务组合
标价页上的单价,不等于你实际花的钱。每任务成本的正确公式是:单价 × 每任务平均输出 token ÷ 一次通过率。
AA 的数据就是最好的反例教材:Grok 4.7 和 MiMo 同分却贵近 29 倍,贵的不只是单价,是"话多"加"慢"——它跑评估时生成了 2.4 亿个 token,而中位数只有 9400 万,属于"非常冗长"级别。36氪

但别以为开源低价就免交话税。知乎有评测拿逻辑测试对照 Pro/Flash 的 128K 最大输出:MiMo-V2.6-Pro 有多达 59% 的任务超出最大长度、测不出可比分数,Flash 也有很高比例超限;两者平均 token 消耗 89K 和 91K,超过了 DeepSeek V4.1 Flash。 也就是说,MiMo 的便宜建立在"单价低、多数任务一次过"上;换成超长推理类任务,多出来的 token 还是你买单。29 倍是真实的,但那是 AA 评估任务组合上的均值——你的任务组合得自己重跑一遍才算数。知乎
该放的放完了,反证也得放:确实有"刷分、野榜"的质疑声音,但目前没有可核实的实锤;可核实的反面信号是同一问题下的另一条评论:国内主流平台还没接入,三个月内看看别家是否接入,不接入就只能说是应用厂家在投票。 要不要换,最终看接入平台数和 OpenRouter 周调用量这两条曲线,这种观望口径本身就是最务实的验证窗口。知乎
所以,谁该动,谁可以再等等
值得优先试迁移的人:Agent 和编码的重度调用者——模型进了生产环境,调用就从偶发行为变成持续运行的基础设施账单,对每任务成本最敏感的就是这类人;需要 1M 长上下文和多模态的场景;以及打算拿开源权重自部署的。V2.6 这一代补的正是 Agent 短板:补齐后综合能力进了同期中位区间,同时保持便宜和快——这就是上面这些人群要的组合。
可以再观望的人:以闲聊和日常问答为主的轻度用户——盲测榜上的"声望"(GPT/CC 的对话手感)恰恰是 AA 固定基准测不出来的项;还有被特定工具生态深度绑定的人,中转群、订阅号池迁移一步都是真实成本,"没人用过 mimo"对你就是生态现状。
换之前三步自查:
从你自己的真实任务池里抽 10 个(编码、长文档、多模态各放几个),用免费额度或低价档跑一遍,看通过率和总 token 数,别只看单价;
查常用平台的接入列表,而不是发布会新闻;
看榜单数据时先认快照日期和口径版本(v4.2 起不可与旧版直比),并且看分项不看总分——同一个 AA 榜里,Fable 5.1 与 GPT-6 Astra 总分只差 2 分,分项却换了天下:WebDev 编码分项 Astra 高 35 分排第一,DeepSWE 工程任务通过率 74%,Fable 5.1 干脆未上榜。 只读总分就迁移的编码团队,会直接迁反。知乎

接下来盯什么
这次登顶不是终点:MiMo-V3 采用新架构、提前放出核心 HySparse2 论文的讨论已经开起来了。 MiMoCode 发行版"被曝包含打包代码"的争议还在扯皮。 OpenRouter 周调用榜是最快反映真实投票的信号;而 AA/LMArena 下一次口径调整,又会把所有人的账面名次重洗一遍——今天被马斯克"批示赞同"的梯度榜,下周一样会换。知乎知乎微博
从 V2.5 到 V2.6 隔了五个月,这次是把短板补上的五个月:RL 训练直播里晒出的那条 step 性能曲线背后,是 1505k 训练样本、156.4B token 和 347 万美元的训练投入——便宜不是从天上掉下来的。

效率竞赛每往前滚一轮,为旧声望继续掏溢价的人就尴尬一轮。榜单越来越多、第一名换得越来越快,不掏错钱的唯一姿势是把榜单当提问材料而不是答案:看到"开源第一"和"查无此人"同屏,先问哪个榜、哪个快照、谁的任务组合——然后,用你自己的 10 个任务去回答它。