8月26日晚上,国产大模型圈出了两条消息。智谱上线并开源了GLM-5.3-Flash(320B-A18B)。微信公众号同时,官方认领了此前一周在OpenCode和OpenRouter上屠榜的匿名模型Ox-Alpha——中文社区叫它"牛来"——就是智谱刚刚发布即开源的GLM-5.3 Flash,还是5系列里首个原生多模态的那种。知乎同一晚,千问也发布了Qwen3.8-Flash,"低价高质大模型"的价格战正式开打。
但先别急着上车,有几笔账值得算清楚。这次牌价确实惊人,可实际能省多少,完全取决于你怎么用。这篇写给拿大模型写代码、接进自己服务里的人,把缓存、冗长、渠道三笔账算明白。
一、先澄清一个误区:Flash不是"缩水版"
很多人看到"Flash"就默认是旗舰蒸馏降级,这次恰恰相反:GLM-5.3-Flash并不是GLM-5.3的缩水版本,而是一套重新预训练的新基座。知乎它总参数320B,激活只有18B,1M上下文,原生支持文本、图片、视频,能力反超参数翻倍以上的上一代GLM-5.2,在Artificial Analysis综合智能指数里拿到57分,与Claude Opus 4.8持平,进入全球前沿区间。
跑分方面,六项编程与Agent评测里,GLM-5.3-Flash全面超过上一代GLM-5.2,DeepSWE v1.1上63.4对46.2。在自研Z.ai Code Bench体感评估中,最高档位与Opus 4.8几乎打平(29.0 vs. 29.5)。Z.ai官方文档不过这是智谱自家基准,跨厂商对比还是要等第三方实测多起来再下结论。

最有说服力的证据其实来自匿名测试期。正式发布前,它在OpenRouter上一周烧出23.2万亿token的消耗,大约是历史上所有模型单期消耗纪录(历史第二好成绩)的2.6倍。知乎在OpenCode上直接登顶总榜,终结了DeepSeek连续56天霸榜的纪录。知乎这些都是真实开发者的生产流量,可信度比任何自研跑分都高。
二、为什么能这么便宜:架构降本,不是价格战放血
它的总参数量与GLM-4.5相当(355B对320B),但激活参数从32B降到18B、层数从92减到45,几乎减半,而且是首个采用稀疏注意力加线性注意力混合架构的开源前沿模型。相较于GLM-5.3,注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。微信公众号这才是它敢卖到十分之一价格的底气:架构层面的降本,不是烧钱补贴。

官方对短板也没藏着:在所有对比模型里,GLM-5.3-Flash的KV缓存大小仍略高于Kimi-K3和DeepSeek-V4-Flash,官方原话把这列为后续优化方向。智谱开放平台文档官方文档里还有一张1M长上下文口径下的架构效率对比,长上下文恰恰是编程Agent最烧钱的部分,这张图更值得细看。

三、第零笔账:牌价怎么看
官方口径一句话:定价为GLM-5.3的1/10,限时折扣内为1/20,为Opus 4.8的1/40。微信公众号落到国内BigModel开放平台的人民币牌价,每百万token输入0.8元、输出2.8元、缓存命中0.23元,限时5折后输入0.4元、输出1.4元、缓存命中0.115元。知乎1M上下文、最大输出128K,全模态都包含在内。
把同期开卖的三款"Flash"级模型放进一张表(单位:元/百万token):
模型 | 输入 | 输出 | 缓存命中输入 |
|---|---|---|---|
GLM-5.3-Flash(限时5折) | 0.4 | 1.4 | 0.115 |
DeepSeek-V4-Flash | 1.5(空闲)/3(高峰) | 4.5(空闲)/9(高峰) | 0.05(空闲)/0.1(高峰) |
Qwen3.8-Flash | 1 | 3 | 未单独公布 |
看表要盯住三点。第一,GLM-5.3-Flash的输出价格是三者里最低的,这是它最大的优势。第二,DeepSeek是峰谷两段计价,工作日9:00-12:00和14:00-18:00算高峰,空闲时段价格为高峰时段价格的一半。DeepSeek官方文档第三,同一晚千问Qwen3.8-Flash以输入1元、输出3元入场,官方口径训练成本只有上代的1/9。微博还有一个细节:GLM-5.3-Flash缓存命中单价0.115元,其实比DeepSeek空闲档的0.05元贵,这就引出下一笔账。
四、第一笔账:缓存账——编程的大头在缓存
智谱官方发布视频下的高赞评论很直白:看清楚缓存价格,编程大头在缓存。哔哩哔哩评论里还说,同样的任务DeepSeek命中率能到98%,GLM不到95%。这个数字没有得到官方证实,但它指向的问题是真实的。
为什么缓存这么关键?编程Agent场景里,每一轮对话都会把整个项目上下文重新作为输入发送,其中绝大部分是可以命中缓存的重复前缀。社区里被反复引用的说法是:Agent工作流里约96%的输入都是可缓存命中的重复前缀。
按这个算:命中率真有96%的话,GLM-5.3-Flash的实际输入成本约等于0.96×0.115+0.04×0.4≈0.13元/百万token,比0.8元的牌价又便宜了约84%。这就是"越用越便宜"的来源。
但这笔账对命中率极度敏感:掉到90%,有效输入价就涨到约0.18元,依然便宜,方向却完全相反。同一评论区也有人直接贴出自己的消耗:十分钟蹬了三块钱(API直接接入,不是codingplan),命中率99。哔哩哔哩所以别只盯单价,大上下文乘多轮对话,绝对成本照样会堆得很快。评论里还有人提醒,DeepSeek真正便宜的不止单价,还有硬盘缓存——睡一觉起来继续命中。这一点GLM能不能跟上,目前还是问号。
五、第二笔账:冗长账——单价便宜不等于总价便宜
知乎上有个容易被忽略的实测信号:输出看起来非常冗长,实际使用成本会比预想的高,这点大家要注意。知乎输出冗长意味着同一个任务要烧更多output token,单价优势会被冗长系数稀释。如果完成同一任务比别的模型多花30%输出,实际输出价格就从1.4元被推到约1.8元。这一点在对比表里看不出来,只能拿自己的工作流试。
另一个教训关于可靠性。有开发者在B站反馈,处理web后端时已经明确告知模型用服务器的UTC时区,它还是把代码按Mac的北京时间改了,差点出事故。哔哩哔哩便宜模型的时代来了,但code review这道工序省不掉。
六、第三笔账:渠道账——同一个模型,四种上车方式
实际花多少钱,跟从哪个入口进关系很大,四条路先摆清楚:
想白嫖试用:GLM-5.3-Flash 已全量上线 GLM Coding Plan ,原生多模态,额度翻 3 倍。智谱开放平台文档官方同步把它接入了ZCode等编码平台,每天限量发放10,000张体验卡,API也同步开放。
重度写代码:订阅Coding Plan,Lite/Pro/Max三档,非高峰时段调用只消耗50%的标准积分,周末全天都算非高峰。Z.ai官方文档白天轻度用、夜里跑长任务,一份钱能当两份花。但注意输出冗长会加速消耗积分,Lite不够用就要考虑升档或转API。
用量小或想灵活:直接走API。知乎已经有人前排提醒:请直接使用官方api,不要购买套餐。知乎逻辑是折扣期内API定价只有GLM-5.3的1/20,而且文本、图片、视频全模态支持,比同价位的DeepSeek-V4-Flash适用面更宽。
折腾党:MIT协议开源,权重已放出,KTransformers等推理框架跟进适配很快。但提醒一句,320B不是消费级显卡能装下的,除非有研究、部署或微调需求,别为了省钱自部署,账算不过来。

七、接下来值得盯的信号
价格回归节点:这次5折持续到2026年9月9日24:00。Z.ai官方文档之后如果恢复输入0.8元、输出2.8元,本文所有账单都要重算。
缓存命中率与缓存持久性:这是目前和DeepSeek争议最大的点,官方后续是否优化,直接决定编程场景的真实成本。
国产芯片的服务稳定性:这次流量全部由国产芯片集群承接,官方口径端到端服务性能提升3倍、硬件效率和单token成本达到主流NVIDIA GPU水平,高峰下的延迟和排队表现,接下来才是真正的考验。
同档位对手:Qwen3.8-Flash同晚入场,DeepSeek-V4-Flash还在,Flash级的价格战才刚开始。
一句话结论
对写代码的人来说,GLM-5.3-Flash是当下前沿级模型里性价比最高的选择之一。我的建议是:先用体验卡试手感,再趁5折窗口用API按量计费,在自己项目里测两个数——缓存命中率和输出冗长度,这两个数决定它对你是否真的比DeepSeek路线便宜。对开源党,这个MIT协议加混合注意力架构的模型,本身就值得研究。