昨晚十点,智谱摊牌了:霸榜OpenRouter一周、刷出平台调用量纪录的匿名模型「OxAlpha」(中文社区叫它「牛来」),真身就是GLM-5.3-Flash,当天发布即开源——MIT协议、320B总参数只激活18B、1M上下文、GLM-5系列首个原生多模态模型,推理全部跑在国产芯片上。知乎
宣传口径很猛:Artificial Analysis智能指数已经拿下57分,放眼全球已然步入前沿之列,与Claude Opus 4.8得分持平。知乎
价格口号更猛:限时折扣价是GLM-5.3的1/20、Opus 4.8的1/40。知乎
但今天AI编程圈最热闹的,不是它多强,而是怎么买——知乎上已经吵成了两派。
两笔账,算出两个相反的结论
在知乎问题「怎么看GLM-5.3-Flash发布,有什么值得关注的?」下面,高赞回答开门见山:glm 5.3 flash请直接使用官方api,不要购买套餐。知乎
答主的逻辑不复杂:目前可购买的v3套餐,抵扣系数仅为5.3的三分之一,118元的套餐只能买每周3亿不到的词元,还是在非高峰情况下,而api折扣是二十分之一,对比下来套餐显得毫无诚意——原话很冲:智谱的coding plan就是这么的抽象,能被自家的api斩杀。知乎

但评论区马上有人反算。
有人指出他的口径问题:这个2.92(亿)是非高峰、95%缓存命中的周token,月token要乘4,让GPT算了一下,plan还是比api便宜的。知乎另一派则押注ZCode:里面有150%额度和闲时算力重置卡,还能混用GLM-5.3,认为在ZCode里用远比API划算。有评论算了一笔账:ZCode里120块一个月最少有8.5亿token,全部高峰期的情况下。

你看,两派都不是乱说,只是前提不一样。
真正分歧的,是三个数字
两笔账其实能对上是三个变量在起作用:
第一,缓存命中率。API的缓存命中价极低:限时5折期间,缓存命中仅0.115元/百万token。知乎coding agent场景天然有大量重复上下文,缓存命中率高的人,API实际单价远低于牌价;反之,任务多以新上下文为主的话,优势会明显缩水。

第二,高峰时段占比。套餐额度在高峰和非高峰的折算不一样:官方设计是非高峰时段的调用只消耗一半积分,周末全天算非高峰。知乎如果你只能晚上写代码,白天额度用不掉,套餐的实际单价就上去了。
第三,也是最现实的一个:你到底能用掉多少额度。高赞答主在评论区回复套餐党时只说了一句:前提是能用完啊,这个对额度多的模型来说其实不容易。知乎
顺手把散落在各处的价格信息拉一张表(截至8月27日,具体以官网为准):
渠道 | 价格(每百万token) | 备注 |
|---|---|---|
国内API牌价 | 输入0.8元 / 输出2.8元 | B站UP主实测整理 |
国内API限时5折 | 输入0.4元 / 输出1.4元,缓存命中0.115元 | 两周折扣期 |
Z.ai海外站牌价 | 输入0.15美元 / 输出0.50美元 / 缓存0.03美元 | 美元计价 |
Coding Plan | 社区口径各档位118元至500元,Lite档每周约1.4亿token | 各档抵扣系数不同,以官网为准 |
对比:Qwen3.8-Flash | 输入1元 / 输出3元 | |
对比:DeepSeek-V4-Flash | 闲时输入1.5元 / 输出4.5元,高峰翻倍,缓存命中输入0.05元 |
至于「1/40的Opus 4.8价格」这句口号,得加上三个前提听:它对标的是Artificial Analysis智能指数的单一得分(官方口径是「持平」),是牌价对牌价,还是理想用法下的账单。任何一个前提变了,这句口号都要打折。
三个宣传页不会写的成本放大器
第一批上手的人,已经踩出了一些坑:
一是输出冗长。有拿到内测资格的知乎用户提醒:输出看起来非常冗长,实际使用成本会比预想的高。知乎同样的任务,输出token更多,账单自然更厚。
二是缓存价占比不低。评论区点赞很高的吐槽很直接:API价格输入输出搞得比V4F低,然后大头缓存价比峰谷还高。知乎重度coding agent的账单里缓存占大头,这一项必须单独算。
三是体验不等于跑分。B站UP主的实测结论分歧很大。
有人说后端表现扎实,但前端和深度推理差点意思。B站
有人栽在细节上:明确要求用服务器的UTC时区,模型却把代码改成了北京时间,差点出事故。B站
还有人拿它写游戏,最后鼠标还是无法控制瞄准,结论是可能不太适合做游戏。B站
甚至有UP主同任务实测算账,结论是Qwen3.8-Flash比GLM-5.3-Flash便宜2.78倍、快1.96倍。B站「新性价比之王」不等于「所有场景最便宜」。
三种人,三条路
轻中度使用(每天几个任务、月账单100元以内):直接走官方API,吃满限时5折,按量付费最灵活,不存在浪费额度。顺带说个小坑:评论区有人问,怎么获取官网API,我用各种ai搜都是plan源。知乎官方入口在BigModel开放平台和Z.ai的产品页里,别走第三方转售渠道。
重度使用(每天跑agent数小时、月消耗200元以上):Coding Plan或ZCode可能更便宜,但别急着续订,社区口径里Lite档每周额度大概只有1.4亿token。知乎先用API跑一周,摸清自己的缓存命中率和高峰占比,再对照套餐额度和抵扣系数决定。「能不能用完」这个问题,只有你自己答得上来。

自部署与企业场景:权重已上HuggingFace,MIT协议,KTransformers社区也第一时间做了适配。但注意,320B的总参数即使只激活18B,也不是普通工作站能吞下的体量,动手前先确认硬件门槛。
最后提醒一句:如果你的项目处在「错不起」的阶段,别把主力全押给新模型。跑分与真实工程错误率之间的差距还没抹平,主力模型留给关键任务,新模型先在次要任务上磨合。
接下来两周值得盯的信号
限时5折到期后,API是否恢复牌价——这直接决定「API派」的账还成不成立;
智谱会不会调整套餐抵扣系数和额度——社区已经有「毫无诚意」的声音,官方可能重新平衡API和套餐;
竞品跟不跟——DeepSeek刚涨完价、Qwen3.8-Flash刚上线,Flash这一档的价格战才刚开始;
第三方实测样本继续累积后,前端、长任务、多模态编程的结论是否收敛。
GLM-5.3-Flash最大的意义,是把前沿能力的价格拉到了能当「日常消耗品」用的档位。但账单是你自己的——切换之前,先把缓存命中率、峰谷占比、月消耗量这三个数字摸清楚。这三个数字清楚了,性价比才是真的。