昨晚(8月26日),大模型圈一个晚上挤进来三份价格表。智谱上线并开源 GLM-5.3-Flash,顺手认领了霸榜一周的匿名模型;阿里通义发布 Qwen3.8-Flash,把输入价打到每百万 Tokens 1 元;OpenAI 则刚开启这个月的第二轮"限时促销"。降价当然值得高兴,但这轮价格战里有三个特别容易混淆的口径,直接决定你接下来怎么花钱,我先把它们拎出来说清楚。
先说昨晚最有戏剧性的一幕:霸榜一周的"牛来",认领了。
如果你这两天刷过 OpenRouter 或 OpenCode 的榜单,大概率见过一个没贴任何品牌标签的匿名模型 Ox-Alpha,中文社区给它起了个接地气的名字——“牛来”。8月26日晚上,智谱官宣这就是 GLM-5.3-Flash:总参数 320B、激活参数只有 18B,是 GLM-5 系列第一个原生多模态模型。IT之家
它的成绩单是带着流量来的。OpenRouter 官方榜单上,Ox Alpha 一周吃掉 23.2 万亿 token,断层第一,榜二 DeepSeek V4 Flash 0731 只有 11.6 万亿,正好被它翻倍。知乎 DeepSeek 连续 56 天的霸榜纪录就此终结;而在开发者平台 OpenCode 上,Ox Alpha 的累计消耗达到 44 万亿 token,同样是断层第一。

更值得说的是算力来源。智谱的说法是,发布前以匿名模型 Ox-Alpha(中文社区称作牛来)在 OpenCode 和 OpenRouter 上进行了大规模测试,为的是收集广泛、专业的用户反馈,而这些请求流量全部由国产芯片提供算力支持。微博 换句话说,这波让海外社区集体"猜爹"的流量洪峰,是被国产算力稳稳接住的。
第一条细则:刷屏的"1/40",是限时折扣口径。
"定价是 Opus 4.8 的四十分之一"这个数字传播最广,但翻到智谱 BigModel 官方定价页你会发现,它是三层价格叠出来的:GLM-5.3 挂的是 1M 上下文、输入 8 元、输出 28 元(每百万 token);GLM-5.3-Flash 的原价相当于打了一折;而大家转发的,是限时 5 折之后的价格——输入 0.4 元(原价 0.8 元)、输出 1.4 元(原价 2.8 元)、缓存命中 0.115 元(原价 0.23 元)。知乎

智谱官方口径其实写得很严谨:定价为 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20,为 Opus 4.8 的 1/40。IT之家 所以这条细则很简单:1/40 是按限时折扣算的,折扣没有公布截止时间,结束后价格会回到"1/10"档。按原价口径它依旧明显便宜,但做预算时别把 0.4 元当成永久价。
这个价差落到真实账单上是什么量级?同样生成 100 万 token 的回答,Claude Fable 5 要 355 元,GLM-5.3-Flash 只要 1.4 元。知乎 253 倍的差距,已经超出了"性价比"的日常讨论范围。
第二条细则:训练成本降九成,和你能拿到的价格是两本账。
同一晚发布的 Qwen3.8-Flash 是多模态 MoE 模型:主模型参数量 125B,额外配备 51B 的 N-gram Embedding,每 token 只激活 6B 参数,原生支持 262,144 tokens 上下文,还能通过 YaRN 扩展到 1M。IT之家

价格是这次的主菜:每百万 Tokens 输入 1 元、输出 3 元,最低至 DeepSeek-V4-Flash 的 1/3;而它的训练成本较上一代 Qwen3.7-Plus 骤降近 90%。知乎
这就是第二条容易混淆的细则:训练成本降 90%,说的是厂商训练这个模型花的钱只有上一代的九分之一,它解释的是通义为什么敢把价格压到这个位置;而你实际支付的,是每百万 Tokens 输入 1 元、输出 3 元的推理价——同一个"降"字,在宣传里指成本,在账单里才是价格。还有一个口径细节:这个价格是 DeepSeek-V4-Flash 闲时价格的 2/3、忙时价格的 1/3,并不是无条件全时段的 1/3。模型权重已于 26 日 23 点在 Hugging Face 和 ModelScope 开源,官方还透了个底:这套 Next 新架构,是 Qwen4 的雏形。
第三条细则:OpenAI 的降价,只降到开发者这一侧。
把视线拉回大洋对岸。OpenAI 宣布,要对前沿模型 GPT-5.6 Sol 进行"限时促销",部分服务价格下调逾 20%,这已是 OpenAI 近一个月内的第二轮大幅降价——7 月底,同系列的 GPT-5.6 Luna 价格刚被下调了 80%。微博
但这条细则和国内两家的降价完全不同:这次降价的对象是 API 和积分计划的调用价格,而且只限接下来的三个月;平时花钱买的 Pro、Plus 还有 Business 订阅号,额度一丁点都没变,这波福利纯粹是给开发者的。如果你是订阅会员,这次海外价格战跟你的账单没有直接关系。
至于为什么降,《金融时报》的分析很"扎心"——客户正在转向中国公司提供的开源大模型,美国大模型公司"不得不"降价。微博
这轮价格战,对你到底意味着什么
如果你是 API 重度用户,真正的折扣藏在缓存命中价里。Agent 工作流里大部分输入是可复用的重复前缀,OpenCode 全平台 96% 的输入 token 走的是缓存,Ox Alpha 自身的缓存命中率也有 93%。知乎 按 0.115 元的缓存命中价算,真实使用成本会在已经很低的标价上再打一层折——这也是限时免费一周就烧掉千万级推理成本,厂商依然敢放量的底气。

如果你是订阅用户,看清两家降价的路径差异:OpenAI 的降价绕开了订阅档,智谱和通义则把优惠直接铺进了订阅和办公场景——智谱的 GLM Coding Plan 分 Lite、Pro、Max 三档,还藏了个小心思:非高峰时段的调用只消耗一半积分,周末全天算非高峰。白天用它干活,夜里让它跑长任务,一份钱当两份花。
最后给三个值得继续盯的信号。一是 GLM-5.3-Flash 限时折扣的截止时间,折扣一停,口径就从 1/20 回到 1/10;二是 GPT-5.6 Sol 三个月促销期结束后是否续价,这决定海外这轮降价是趋势还是促销;三是 Next 架构的 Qwen4 什么时候来——通义已经明说,这次放出来的开源权重就是交给社区检验的雏形。大模型降价当然是好事,但把细则看清楚,便宜才花得明白。