当前位置:
AIGC文章详情

智谱GLM-5.3-Flash官宣:5折API和Coding Plan到底选哪个?两派算账算不到一起,差的三个数字全在你自己的使用习惯里

源自96位全网作者

08:44

昨晚十点,智谱摊牌了:霸榜OpenRouter一周、刷出平台调用量纪录的匿名模型「OxAlpha」(中文社区叫它「牛来」),真身就是GLM-5.3-Flash,当天发布即开源——MIT协议、320B总参数只激活18B、1M上下文、GLM-5系列首个原生多模态模型,推理全部跑在国产芯片上。知乎

宣传口径很猛:Artificial Analysis智能指数已经拿下57分,放眼全球已然步入前沿之列,与Claude Opus 4.8得分持平。知乎

价格口号更猛:限时折扣价是GLM-5.3的1/20、Opus 4.8的1/40。知乎

但今天AI编程圈最热闹的,不是它多强,而是怎么买——知乎上已经吵成了两派。

两笔账,算出两个相反的结论

在知乎问题「怎么看GLM-5.3-Flash发布,有什么值得关注的?」下面,高赞回答开门见山:glm 5.3 flash请直接使用官方api,不要购买套餐。知乎

答主的逻辑不复杂:目前可购买的v3套餐,抵扣系数仅为5.3的三分之一,118元的套餐只能买每周3亿不到的词元,还是在非高峰情况下,而api折扣是二十分之一,对比下来套餐显得毫无诚意——原话很冲:智谱的coding plan就是这么的抽象,能被自家的api斩杀。知乎

智谱GLM-5.3-Flash官宣:5折API和Coding Plan到底选哪个?两派算账算不到一起,差的三个数字全在你自己的使用习惯里

但评论区马上有人反算。

有人指出他的口径问题:这个2.92(亿)是非高峰、95%缓存命中的周token,月token要乘4,让GPT算了一下,plan还是比api便宜的。知乎另一派则押注ZCode:里面有150%额度和闲时算力重置卡,还能混用GLM-5.3,认为在ZCode里用远比API划算。有评论算了一笔账:ZCode里120块一个月最少有8.5亿token,全部高峰期的情况下。

智谱GLM-5.3-Flash官宣:5折API和Coding Plan到底选哪个?两派算账算不到一起,差的三个数字全在你自己的使用习惯里

你看,两派都不是乱说,只是前提不一样。

真正分歧的,是三个数字

两笔账其实能对上是三个变量在起作用:

第一,缓存命中率。API的缓存命中价极低:限时5折期间,缓存命中仅0.115元/百万token。知乎coding agent场景天然有大量重复上下文,缓存命中率高的人,API实际单价远低于牌价;反之,任务多以新上下文为主的话,优势会明显缩水。

智谱GLM-5.3-Flash官宣:5折API和Coding Plan到底选哪个?两派算账算不到一起,差的三个数字全在你自己的使用习惯里

第二,高峰时段占比。套餐额度在高峰和非高峰的折算不一样:官方设计是非高峰时段的调用只消耗一半积分,周末全天算非高峰。知乎如果你只能晚上写代码,白天额度用不掉,套餐的实际单价就上去了。

第三,也是最现实的一个:你到底能用掉多少额度。高赞答主在评论区回复套餐党时只说了一句:前提是能用完啊,这个对额度多的模型来说其实不容易。知乎

顺手把散落在各处的价格信息拉一张表(截至8月27日,具体以官网为准):

渠道

价格(每百万token)

备注

国内API牌价

输入0.8元 / 输出2.8元

B站UP主实测整理

国内API限时5折

输入0.4元 / 输出1.4元,缓存命中0.115元

两周折扣期

Z.ai海外站牌价

输入0.15美元 / 输出0.50美元 / 缓存0.03美元

美元计价

Coding Plan

社区口径各档位118元至500元,Lite档每周约1.4亿token

各档抵扣系数不同,以官网为准

对比:Qwen3.8-Flash

输入1元 / 输出3元

对比:DeepSeek-V4-Flash

闲时输入1.5元 / 输出4.5元,高峰翻倍,缓存命中输入0.05元

至于「1/40的Opus 4.8价格」这句口号,得加上三个前提听:它对标的是Artificial Analysis智能指数的单一得分(官方口径是「持平」),是牌价对牌价,还是理想用法下的账单。任何一个前提变了,这句口号都要打折。

三个宣传页不会写的成本放大器

第一批上手的人,已经踩出了一些坑:

一是输出冗长。有拿到内测资格的知乎用户提醒:输出看起来非常冗长,实际使用成本会比预想的高。知乎同样的任务,输出token更多,账单自然更厚。

二是缓存价占比不低。评论区点赞很高的吐槽很直接:API价格输入输出搞得比V4F低,然后大头缓存价比峰谷还高。知乎重度coding agent的账单里缓存占大头,这一项必须单独算。

三是体验不等于跑分。B站UP主的实测结论分歧很大。

有人说后端表现扎实,但前端和深度推理差点意思。B站

有人栽在细节上:明确要求用服务器的UTC时区,模型却把代码改成了北京时间,差点出事故。B站

还有人拿它写游戏,最后鼠标还是无法控制瞄准,结论是可能不太适合做游戏。B站

甚至有UP主同任务实测算账,结论是Qwen3.8-Flash比GLM-5.3-Flash便宜2.78倍、快1.96倍。B站「新性价比之王」不等于「所有场景最便宜」。

三种人,三条路

轻中度使用(每天几个任务、月账单100元以内):直接走官方API,吃满限时5折,按量付费最灵活,不存在浪费额度。顺带说个小坑:评论区有人问,怎么获取官网API,我用各种ai搜都是plan源。知乎官方入口在BigModel开放平台和Z.ai的产品页里,别走第三方转售渠道。

重度使用(每天跑agent数小时、月消耗200元以上):Coding Plan或ZCode可能更便宜,但别急着续订,社区口径里Lite档每周额度大概只有1.4亿token。知乎先用API跑一周,摸清自己的缓存命中率和高峰占比,再对照套餐额度和抵扣系数决定。「能不能用完」这个问题,只有你自己答得上来。

智谱GLM-5.3-Flash官宣:5折API和Coding Plan到底选哪个?两派算账算不到一起,差的三个数字全在你自己的使用习惯里

自部署与企业场景:权重已上HuggingFace,MIT协议,KTransformers社区也第一时间做了适配。但注意,320B的总参数即使只激活18B,也不是普通工作站能吞下的体量,动手前先确认硬件门槛。

最后提醒一句:如果你的项目处在「错不起」的阶段,别把主力全押给新模型。跑分与真实工程错误率之间的差距还没抹平,主力模型留给关键任务,新模型先在次要任务上磨合。

接下来两周值得盯的信号

  1. 限时5折到期后,API是否恢复牌价——这直接决定「API派」的账还成不成立;

  2. 智谱会不会调整套餐抵扣系数和额度——社区已经有「毫无诚意」的声音,官方可能重新平衡API和套餐;

  3. 竞品跟不跟——DeepSeek刚涨完价、Qwen3.8-Flash刚上线,Flash这一档的价格战才刚开始;

  4. 第三方实测样本继续累积后,前端、长任务、多模态编程的结论是否收敛。

GLM-5.3-Flash最大的意义,是把前沿能力的价格拉到了能当「日常消耗品」用的档位。但账单是你自己的——切换之前,先把缓存命中率、峰谷占比、月消耗量这三个数字摸清楚。这三个数字清楚了,性价比才是真的。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章