调用量第一的模型,榜单排第86:把两张表摆在一起之后,生产选型先别跟着名次走

源自166位全网作者

05:19

8月26日,智谱正式认领了被全网猜了8天的匿名模型「牛来」,真身是发布即开源的GLM-5.3-Flash。知乎匿名测试那几天,它上线OpenRouter首日冲上榜首、刷新单日tokens用量纪录,还终结了DeepSeek在OpenCode连续56天的霸榜。量子位

而就在昨天,知乎上另一篇帖子把这场热闹翻了个面:作者把LMArena榜单和OpenRouter的真实token消耗放在一起对了一遍,结论是大家掏钱在用的模型,和榜单排在前面的模型,基本是两批模型。知乎如果你每天在调用大模型API,账单从几百块到几万块,这篇就是写给你们的:选生产模型时,哪些数字能信,账到底该怎么算。

榜单前十二,只有两个在真实调用里也排前十二

先看数据,全部是可复现的公开数字。OpenRouter是目前公开数据最全的模型聚合网关,2026年8月10日那一周,平台总消耗75.3万亿token,覆盖48个模型。真实消耗高度集中:前两名合计34.5%,前五名52.3%,前十二名72.3%,而这十二个模型在LMArena文本总榜上的名次散落在第10到第102位之间。反过来看榜单,文本总榜前十二依次是claude-fable-5、一串Claude Opus各effort档、muse-spark系列、gemini-3.7-flash、kimi-k3-max,进了真实调用量前十二的只有Claude Opus 5和Kimi K3两个模型,Opus 5自己的真实份额也只有3.54%;而真实调用量第一名——一个模型吃掉平台21.25%的token——在榜单上排第86。知乎

先别急着站队。「榜单全是假的」和「调用量才代表实力」都不对:榜单被投票行为带偏,调用量榜会被免费流量喂出来——「牛来」匿名测试期免费,冲榜水分多大,官方认领前没人知道;聚合网关的订阅套餐和直连API计费又是两回事。正确姿势是把两张表当交叉验证,换谁信都不如两边都查。

看榜单的三层坑:榜单没骗人,引用的人把误差条剪掉了

第一层,把名次当成精确实力。LMArena每个模型除了Elo分,还给了95%置信区间和名次区间,就印在页面上,只是大部分引用的人把误差条剪掉了,只留下那个序数。前三十名里,投票数最少3257、最多99182,差30倍——用三千票估出来的分和用九万票估出来的分放在同一列比大小,本身就不成立。Cohere、AI2、普林斯顿、斯坦福四家合著的《The Leaderboard Illusion》基于238个模型、280万场对战,核心建议就是:头部十到三十分的Elo差距通常落在噪声范围内,要「Elo+置信区间+投票数」三个数一起看。知乎「第4名比第5名强」这句话在数据上是说不出来的——但它每天都在被写进选型报告和公众号标题。

第二层,不说哪张榜。Arena一共11个竞技场、29张榜,光代码类就有12张:全栈、前端、React、数据应用、游戏、仿真。知乎真实调用量的大头恰恰是代码和Agent任务,用文本总榜的名次去解释代码场景的调用量,是拿错了尺子。

第三层,同一个模型名挂着不同的东西。effort档、preview版、带脚手架的版本,在榜上都是独立的行,核数据要核到条目一级,不是模型名一级。知乎用错榜的成本比用错模型还高——因为你会以为自己有数据支撑。

榜单不替你算账,账单会

为什么大家不用榜单前列的模型?一半原因在价格。按一个典型业务量算账:100万token/天、输入输出比3:1、跑一年,国内取厂商官网第一阶梯价、海外取Artificial Analysis美元价折算,最贵的是最便宜的57倍。最扎心的一组对比是Opus 5智能分63.1、DeepSeek V4 Flash 51.8,差11.3分,价格差15倍——在绝大多数任务上,多花十五倍的钱换那11分,算不过来。知乎但「同等能力选最便宜」也要小心:GLM-5.2(52.6分)和DeepSeek V4 Pro(53.2分)能力几乎一样、年成本也几乎一样(0.47万对0.49万),这才叫同等能力可比;拿Flash档跟Opus比「便宜15倍」是跨档位比,不成立。

更要紧的是,标价算出来的年成本和账单上的数字通常不是一个数,有两项影响是几十个百分点级别的。一是缓存命中价:重复的输入前缀按大幅折扣计费,DeepSeek的缓存价曾低至标价的1/30、GLM-5.2是1/4,「哪个更便宜」的结论会随缓存命中率翻转——system prompt很长的应用和每次输入都不一样的应用,最优选型可能根本不是同一个模型。知乎注意8月17日调价之后这笔账要重算:调价后缓存折扣明显收窄,开发者实测「缓存活不过一小时」,成了社区吐槽最狠的一条。知乎二是峰谷定价:DeepSeek非高峰时段(北京时间9:00–12:00、14:00–18:00之外)减半计费,8月22日进一步调整,周末全天统一按低谷价收费。知乎如果你的业务有批量离线任务——夜间跑数据清洗、生成摘要、批量打标——把任务调度到非高峰,账单直接砍一半,跟换模型是同一个收益量级,但不用改一行prompt、不用重新评估效果。反过来,实时对话业务拿不到这个折扣,标价就是真实价。「哪个模型最便宜」这个问题,脱离了缓存命中率和调用时间分布,是问不出答案的。

8月的价目表,变得比榜单快

这个月真正的变量其实是价格。8月13日DeepSeek无预告上线V4-Pro正式版,同时宣布API调价,8月17日0时起采用峰谷定价,高峰时段V4 Pro输出价格最高达27元/百万tokens、部分输入价格涨幅最高约12倍——第一次把「模型也能涨价」摆上台面。知乎同一天,OpenCode Go套餐的Flash模型调用额度直接削减94%,订阅池跟着一并收紧。知乎

另一头是集体降本。阿里8月3日发Qwen3.8-Max,2.4万亿参数、千问系列首次开源Max级旗舰权重,官方称推理成本降至行业约1/8;8月26日的Qwen3.8-Flash每token只激活6B。知乎智谱GLM-5.3-Flash的定价是GLM-5.3的1/10、限时折扣1/20、约为Opus 4.8的1/40,低于DeepSeek V4 Flash,还全跑在国产卡上。量子位8月28日腾讯混元Hy4 preview开源,总参数770B、上下文突破100万token、Apache 2.0协议全量开放;9月1日Qwen3-VL-Rerank又降一刀。

市场用脚投票的结果:上周全球大模型总调用量113万亿Token、环比增长21.11%,中国55.16万亿、连续18周超过美国居首,智谱GLM-5.3-Flash以15.7万亿Token登顶;再往前一周,央视报道OpenRouter调用量榜单前五全部由中国企业研发。微博央视财经竞争正在从「谁的榜单名次高」切换到「谁的单位token便宜、谁交付稳」——对开发者这是好事也是坏事:可选项前所未有的多,但迁移成本和回归测试成本成了新的隐形账。

一张能直接抄走的选型清单

别再问「X模型排第几」,改走这五步。第一步,先确认在看哪张榜并核到条目一级:业务是写代码就别看文本总榜,用错榜的成本比用错模型还高。第二步,看名次必须连置信区间和投票数一起看,投票少于一万的行只当参考,你要的判断是「它是否稳定在前10」,不是「今天第4还是第5」。第三步,用真实调用量交叉验证,但先查「免费窗口」,匿名冲榜的水分留到收费之后再看。第四步,成本按你自己的缓存命中率、调用时段、实时/批量分布算三个场景,批量任务先调调度、再谈换模型。第五步,拿业务里的真实任务攒一百道题做私有评测集——8月知乎上较真的作者不止一位:有人周末做了个自己认可的AI大模型排行榜,免费开放给大家一起玩;有人把8月的几份榜单并排看完,结论是「只信属于你自己的那张卷子」。知乎知乎别人的考卷测不出你的场景。

继续观察这几个信号:DeepSeek调价后的能力与性价比实测(已有开发者用第三方检测站盯「降智」波动);GLM-5.3-Flash免费期结束后还能不能留在调用量榜首;更多厂商会不会跟进峰谷定价;以及被视为Qwen4雏形的Qwen3.8-Flash-Next的生态跟进速度。

榜单量的是「投票的人更喜欢哪次回答」,账单记录的是「哪个模型真的在干活」,两个都过关的,才值得你为它改代码。这个月你的AI账单里,哪个模型吃掉的token最多?它的榜单名次又是多少?评论区来对个账。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章