8月26日晚上,国产大模型圈罕见地撞了车:智谱和阿里千问在同一晚分别开源了 GLM-5.3-Flash 和 Qwen3.8-Flash,再加上此前一周刚把峰谷计价铺开的 DeepSeek,社区这几天吵得最凶的问题只有一个——这三家到底谁更便宜。
吵了三天没有统一答案,其实一点也不奇怪。我把知乎、微博上针锋相对的几篇帖子和官方口径都翻了一遍,先说结论:「谁更便宜」没有统一答案,因为每个人的缓存命中率、跑的时段、输出占比都不一样,而这三样恰好是这轮价格战里最容易被忽略的计价变量。下面把账拆开算给你看。
先把三家的价目对齐
GLM-5.3-Flash:320B 总参数、18B 激活,是 GLM-5 系列第一个原生多模态模型。智谱官方口径很直接:Artificial Analysis 综合智能指数 57 分,与 Claude Opus 4.8 持平,定价是 GLM-5.3 的 1/10、Opus 4.8 的 1/40。微博有知乎博主把这句话翻译得更直白:你之前按奢侈品价格省着用的那种智力,现在按民用电价供电。知乎

人民币定价有两个版本在流传,这也是争吵的源头之一。开发者实测帖里写的是每百万 Token 输入 0.8 元、输出 2.8 元。知乎微博上流传的官方价目则是输入 0.4 元、输出 1.4 元。微博两个数字都对:0.8/2.8 是原价,0.4/1.4 是限时五折后的到手价——官方 Z.ai API 五折,为期两周,且官方明确折扣同样适用于第三方模型聚合商。知乎比价之前,先确认自己拿的是哪个价,能省掉一半争吵。
顺便交代一下身世:这个模型发布前以匿名身份在 OpenRouter 上跑了一周,中文社区管它叫「牛来」,当周就成了平台最受欢迎的模型,处理的 token 量是第二名的 2.3 倍,而且全部跑在国产 AI 芯片上。知乎

同夜的 Qwen3.8-Flash 走的是另一条路线:多模态 MoE 架构,总参数 125B、实际激活只有 6B,API 定价每百万 Token 输入 1 元、输出 3 元,官方口径是 Claude Opus 4.6 成本的 3%、最低可到 DeepSeek V4 Flash 忙时价的 1/3。知乎
有一个容易被忽略的细节:这次在魔搭和 Hugging Face 开源的是预训练基座权重 Qwen3.8-Flash-Next,完整对齐能力以 API 为准,想把开源权重直接当生产力用的,先想清楚这一点。知乎
这场价格战的第三位选手其实先动的手:上周价格落地后,DeepSeek V4 系列开始峰谷计价,高峰时段的单任务成本从 0.027 美元升至 0.11 美元,能力不变,价格翻了四倍。知乎
两派之争:一派甩跑分,一派甩公式
正方开场就是跑分。有博主把 14 项 benchmark 逐一对比,GLM-5.3-Flash 跟 DeepSeek-V4 对打,赢了 11 项。知乎
拆开看,Coding 端几乎打平,Agentic 端开始拉开,到了视觉端就是碾压,六项全赢,最大差距约 40%;AutomationBench 直接赢 10 分,GDPval 赢了近 100 分。知乎
再看 Artificial Analysis 那张著名的「斩杀线」图:GLM-5.3-Flash 的红点落在 0.045 美元、57 分的位置,直接卡在最左侧的前沿线上,DeepSeek V4 Flash 在它右上角——贵一倍,还低 6 分。知乎
反方不认跑分,直接甩公式。知乎博主「括弧kh」把两家的价格拆成缓存命中率和输出占比的函数,逐项去求临界点,开篇第一句就是:不要被官网价格诈骗了,GLM 能否斩杀 DeepSeek,还得看缓存命中怎么样。知乎
他的太长不读结论是:在编程任务中,不论峰时谷时,DeepSeek 仍然更具性价比;GLM 半价期间适合做 DeepSeek 峰时的替代,原价之后则只适合作为 DeepSeek Pro 在峰时的平替。知乎
反方还补了一刀,直指正方最常用的那张图:在 AA 的测试环境下,DeepSeek 发挥不出缓存命中的长处,所以无论 AA 怎么测,GLM 看起来都更便宜,这是数学上注定的。知乎
两派其实都没说谎——他们只是代入了不同的缓存命中率。
决定账单的三个变量
变量一:缓存命中率,权重最大的那一个。反方算账的核心就是它。DeepSeek 的低价建立在高缓存命中上:有开发者算过一笔账,在生产环境找到并修复一个 bug,总成本 0.88 元,缓存命中率高达 99.8%。知乎但那是生产环境的理想值,如果你 Vibe Coding 时连 80% 的缓存命中率都不到,反方博主的建议很直接:你该换个 Harness 了。知乎翻译一下:缓存命中率低的人,DeepSeek 的账面便宜兑不了现,反而更适合价格结构简单的 GLM 半价。

变量二:峰谷时段。DeepSeek 闲时半价、周末全天谷价之后,「什么时候跑」本身就成了计价变量:空闲时段价格为高峰时段的一半,可以半夜跑,也可以周末跑。知乎同一个模型,白天给甲方赶工和夜里跑批处理,账单能差出一倍。
变量三:输出占比和轮次。输出 token 的单价普遍是输入的好几倍,而不同模型「干活习惯」不一样:有实测博主提醒,5.3 会通过多尝试增加轮次来提升准确性,跟 DeepSeek 往 99% 打的缓存相比,价格差没有想象中大。知乎标称单价乘以你的真实用量结构,才是你的单价。
跑分之外:真实上手的落差

纸面数据和真实体验之间,社区实测给出了几个值得注意的落差。
有博主用经典的 HTML 指令遵循测试让三家 Flash 同场竞技,最后的结论简单直接:glm>deepseek>qwen。知乎
同一位博主的总评是:glm-5.3-flash 是真的能斩杀 DeepSeek V4 Flash,表现完全不像一个 Flash 档模型,除了输出速度比较慢之外,找不到任何一点缺点。知乎
专业工作流上 GLM 的分数也顶:GDPval-AA v2 拿到 1773 分,是全部对比模型里最高的,包括 Opus 4.8 和 GPT-5.6 Terra。知乎
免费额度要省着用。有测试发现,一个复杂的 HTML 任务基本消耗了千问办公一天赠送的所有额度。知乎智谱面向未订阅用户发放的 GLM Coding Plan 7 天体验卡,每张赠送 2000 积分。知乎免费额度适合试水,不适合直接进生产排期。
按你的用法选,而不是按榜单选

把三个变量套回自己的用法,答案其实很清楚:
规律批量、缓存命中率高、任务能挪到夜里或周末:DeepSeek V4 Flash 的闲时价格仍然是最便宜的一档,反方博主的公式结论对你成立。
白天峰时刚需、缓存命中率一般:GLM-5.3-Flash 的两周半价窗口就是为你准备的,半价期内它相当于 DeepSeek 峰时的平替,窗口结束前值得把重度任务先跑一轮。
长上下文、高命中、追求吞吐:Qwen3.8-Flash 在高缓存命中的真实业务场景下,速度最高能提升 8 倍。知乎
视觉驱动的编码、专业文档工作流:这是 GLM 的强项区间,视觉基准六项全赢和 GDPval 第一都指向它。
不想猜的话,实测博主已经给出了最稳的路径:把两个模型放到同一个环境做 A/B test 跑一周,让账单说话。知乎
最后提个醒:两个坑和三个信号
第一个坑是渠道价差。同一个模型在不同渠道挂的价格能差出好几倍,贵的不一定是官方,便宜的也不一定是第三方。知乎
最反直觉的一条:阿里云百炼和硅基流动这两个聚合渠道,转卖 DeepSeek V4 Pro 的价格比 DeepSeek 官方直连贵了快 3.8 倍,「聚合平台更便宜」的直觉直接被推翻。知乎
第二个坑是套餐口径。按量 API 与 Token Plan 并不相通,后者还受额度、并发和公平使用规则影响,不能简单折成每百万 Token 去比价。知乎
值得继续盯的三个信号:一是两周半价结束后,原价 GLM-5.3-Flash 在社区里的真实口碑;二是被压到斩杀线里的 DeepSeek 会不会拿出新动作;三是国产模型的价格带还在往上走,Kimi K3 已经被视为中国 AI 从成本效率竞争进入定价权竞争的节点。知乎
这轮价格战真正的意义,不是谁把谁打下桌,而是「按自己的用法算账」第一次变得这么重要。你的缓存命中率,就是你的答案。