降价80%,又贵50倍:OpenAI把开发者钱包赢回来了
上周,OpenRouter 上的一项数据翻了面:开发者花在 OpenAI 模型上的钱,两年半来第一次超过 Anthropic。
赢下这一周的头号功臣,不是跑得最多的那个模型,而是全站最贵的那个。
这篇不谈谁更强,只讲这笔账是怎么翻过来的,以及它对你的 API 预算意味着什么。

账单翻面的一周
数据来自 OpenRouter 9 月 15 日发布的一组统计,统计窗口是 9 月 7 日到 13 日。
在这两家公司合计的支出里,GPT-6 Astra 拿下约 19%,排第一;Anthropic 的 Claude Opus 5 以 16% 排在第二;OpenAI 的 GPT-5.6 Sol 和 GPT-5.6 Luna 各约 10%。
再往下是 Claude Sonnet 5 的 7%、Claude Fable 5.1 的 6%。
同一组数据里,OpenAI 在这两家合计支出中的占比越过了 50%(注意,这个比例的分母只是这两家,不是整站份额)。OpenRouter 方面表示,上一次 OpenAI 在周支出上领先 Anthropic 是 2024 年 2 月 26 日,距今正好两年半。
这一周值得写,不是因为第一名的位置换了,而是因为换的方式有点反直觉。
Astra 是 9 月 4 日才发布的模型,满打满算跑了一个完整周。它的定价是输入 10 美元、输出 50 美元(每百万 token),缓存读写另行计费。作为对比,同门的 GPT-5.6 Sol 是输入 5 美元、输出 30 美元,发布时官方口径就明确说 Astra 比上一代更贵。
一个刚发布一周、还比自家上一代贵一倍的模型,把两年的榜首拉了下来。
钱包榜和用量榜,是两张不一样的榜
如果把统计口径从"花了多少钱"换成"跑了多少 token",冠军立刻换人。
GPT-5.6 Luna 在 token 量上领先很多。它在 7 月 9 日发布,7 月 30 日官方把价格砍了 80%,降到输入 0.2 美元、输出 1.2 美元(每百万 token),配 105 万 token 的上下文窗口。这个价位能撑起分类、批处理、轻量 Agent 这类跑量的活。
于是出现了一个很少被讲清楚的现象。
Astra 的输入价比 Luna 贵 50 倍,输出价贵约 42 倍。这意味着 Astra 只要被用几次,账单就能冲到很前面,而不需要 Luna 那样的调用量。
按 token 算,Luna 赢;按钱算,Astra 赢。这不是矛盾,是两家公司同时在打两个市场:一个卖稀缺能力,一个卖单位成本。
三个价位摆在一起,结构更清楚(均为每百万 token,美元):
Astra:输入 10,输出 50,缓存读写另计;
GPT-5.6 Sol:输入 5,输出 30;
GPT-5.6 Luna:输入 0.2,输出 1.2,上下文窗口 105 万 token。
三家输出价都约等于输入价的 5 到 6 倍,这个比例没变。变的是量级:最贵和最便宜之间隔了 50 倍。
所以"最贵的模型拿了最大份额"这件事,一半来自能力,一半来自算术。同样一个稍大的重构任务,用 Luna 跑可能要拆成多轮、反复追问,过程中上下文越滚越长;用 Astra 跑,可能一两轮就收敛。账单最后落在哪边,取决于返工次数,而不是单价乘 token 这么简单。
还有一个隐形成本藏在长会话里。多家厂商的缓存读写是单独计费的,会话越长、缓存命中越多,这部分的占比就越显眼。这也是为什么现在聊模型成本,只看输入输出单价已经没有意义。
OpenRouter 自己也在排名说明里提醒过:token 量不等于请求数、不等于花费、不等于质量,更不等于完成了多少活。各家模型的话痨程度、缓存行为、分词方式都不一样,不同厂商的 token 直接比也不严谨。
这一周不是突然发生的
把时间线拉长看,OpenAI 的这波反弹有前情。
夏天那轮降价之后,OpenRouter 上的用量涨得很快;更关键的是,折扣结束后,相当一部分用户没有走。开发者一旦把某个模型的输出格式、重试逻辑、评测脚本都适配好了,换模型的成本就摆在那里。便宜的那几周,不只是买到了量,还买到了工作流里的一层习惯。
然后是 9 月 4 日 Astra 上线。9 月 7 日到 13 日,正好是它第一个完整周。
这里要留个心眼:新模型发布的第一周,评测、迁移、A/B 对比会扎堆。这一周的数据证明了 Astra 把注意力变成了真实计费,但还不能证明这些负载会在第三周、第四周留在这。要分清"上线周的试用量"和"留下来的生产量",至少得看一个月的曲线。
藏在后面的一环:支出本身正在变成路由信号
这是大多数人看这组数据时会漏掉的一层。
8 月 10 日,OpenRouter 把自家的 Auto 路由器(openrouter/auto)改了一版。新版的路由逻辑是这样的:
先用一个轻量分类器,把每条 prompt 归到约 30 种任务类型里,比如代码调试、多步 Agent 规划、知识问答、数学、客服、研究报告;
再按任务类型,去看过去 7 天里社区在这个任务上把钱实际花给了哪些模型,按这个花销份额排序;
然后套 cost_tier 档位,从 low 到 max 共五档,低档挑性价比,高档挑能力上限;
多轮会话会做粘性处理,同一段代码的连续修改尽量留在同一个模型上,避免中途换人;
分类或排名出问题时,回退到一组默认模型,不让请求失败。
官方博客的说法是,这套路由背后是每周超过 55 万亿 token 的真实消费数据。
它的含义很直接:在这个平台上,支出份额不只是一张记分牌,它还是路由器选模型时的输入之一。被更多人付费使用的模型,更容易被自动选给下一个人。这是聚合的、匿名化的、按任务类型分开统计的信号,官方也没有留出人工干预的口子,但"花销影响分配"这个机制确实存在。
一个榜单如果同时是分配机制,那它就会比普通榜单走得更快。
选对档位,分数和账单一起动
官方给过一组对照,正好说明"花多少钱"和"干成多少活"之间的距离。他们拿五个域做测试:MMLU Pro 测知识,τ³-bench Banking 测智能体,WideSearch 测搜索,DSQA 测研究,SWE-Atlas QnA 测编码。
在新版省钱的默认档上,知识类分数从 86.6% 掉到 85.2%,搜索从 53.1% 涨到 61.6%,研究从 43.2% 涨到 62.9%,编码持平。同一档准确率下,知识类的花费从 393.34 美元降到 140.93 美元。
切到 max 档之后,编码域的分数从 2.4% 直接跳到 60.7%,智能体域从 7.2% 跳到 31.6%。
代价是编码域的花费从 205.52 美元涨到 1325.08 美元。旧版看起来"省钱",是因为它在这类任务上直接退回到一组又便宜又弱的模型。
这组数据的意义不在分数本身,而在于它把选择权的价格标了出来:同一批 prompt,选对模型档位,能同时改分数和改账单。过去这件事靠开发者的经验和直觉,现在靠全市场的付费行为来投票。
Anthropic 的问题不是模型弱,是筹码分散
把它归成"谁赢了谁输了"没什么意思,更值得看的是两家的产品结构。
Anthropic 这一周有三个模型进榜:Opus 5 拿 16%,Sonnet 5 拿 7%,Fable 5.1 拿 6%,加起来约 29%。
OpenAI 这边是 Astra 19% 加上 Sol、Luna 各 10%,结构上更集中,价差也拉得更开:最贵和便宜的一档差了 50 倍。
同一时间,行业里另一个方向也在成型:贵的模型负责规划和判断,便宜的模型负责执行和批量。Devin 新上的 Fusion 就是这么做的,主模型控场、执行交给更便宜的模型,官方给出的基准成本下降约四成;同期发布的 SWE-2 号称在某个编码基准上追平 Fable 5.1,成本低 64%;Sakana 的 Fugu Max 也在讲跨模型动态路由,成本是同级模型的几分之一。
这些产品讲的都是同一件事:别把整条链路绑在一个模型上。
单一模型忠诚度,正在被"什么时候用贵的、什么时候用便宜的"这套账取代。
还要补一句口径上的事:这类榜单反映的是开发者与中小团队聚集的多模型分发平台。大企业客户走的是直连合同、集中采购、数据合规那一套流程,这部分流量根本不会出现在榜上。所以份额变化先说明的是开发者侧的偏好迁移,不能直接推到大客户那边。
对采购的人来说,这也意味着可以换个问法。别问"哪家模型最强",改问"这条链路上哪一段必须用贵的、哪一段换个便宜的不会出事"。这个问题有具体答案,而且答案会随任务类型变。
冷水:这是一家平台一周的数据
有几个边界必须说清楚,否则这组数字很容易被读成别的东西。
它统计的只是经过 OpenRouter 分发的流量,既不包括用户直接调各家的 API,也不包括订阅业务,更不等于两家公司的收入排名。
它也不覆盖客户设为私有的请求。token 统计用的是各家上游厂商自己的分词器,跨厂商直接比较有偏差。钱包份额天然偏向贵模型:一个单价 50 美元的模型,干同样的活,账单就是比 0.2 美元的模型高。
所以这份数据的正确读法是:它说明开发者在多模型平台上,愿意为硬任务掏钱,而且愿意掏得比过去多。它不能说明谁整体更强,也不能说明这周之后格局就定了。
一周的数据是新闻,一个季度的数据才是结论。
这对你的钱意味着什么
如果你在用 API 跑东西,这组数据能落成三个问题。
第一,这个活返工一次的代价高吗?高,比如改线上代码、写要交付的方案,就用贵的那个。低,比如打标签、清洗、摘要,便宜模型的性价比基本没法打。
第二,这个活能拆分吗?能拆就把规划和执行分开,让贵的模型定方向、便宜的模型干重复劳动,这是目前最省的一条路。
第三,你算的是单价还是总价?单价 0.2 美元不代表便宜,如果它多试三次才成,总账单可能反超。真正该统计的是"完成一个任务的成本",把重试、失败、缓存读写都算进去。
缓存要单独提一句:多家厂商的缓存读写是单独计费的,长上下文会话里,这部分经常比生成部分还显眼。
落到具体操作上,有三个旋钮值得现在就拧一次。
第一个是成本档。走 Auto 路由的话,请求里可以传 cost_tier,从 low 到 max 五档,低档挑性价比、高档挑能力上限。同一批 prompt 换个档位,分数和账单都会动,值得各跑一遍再定。
第二个是会话粘性。多轮任务带上 session_id,路由器会尽量让同一个会话留在同一个模型上,只要它还排在前列。这件事直接影响成本,因为中途换模型会把输入缓存全部作废,长会话里这笔浪费不小。
第三个是白名单。如果你的场景有合规或数据落地要求,可以用 allowed_models 把候选限制在自己的可选范围内,路由会在这批模型里挑,不会绕出去。
顺带一个容易被忽略的细节:这套路由本身不额外收费,账单按最终选中的那个模型的标准价算,选了哪个模型也会写在返回结果和调用记录里。把记录翻出来看一眼自己的模型分布,往往比看任何榜单都更有用。
下次再看到有人拿榜单争论"谁最强",你可以多问一句:按钱算,还是按量算?
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
