昨天(8月14日),智谱发布了GLM-5.3。知乎这周的节奏相当卷——同一周里,DeepSeek也发布了首款Agent产品DeepSeek Harness正式版。微博Gemini、Grok同样有新动作,这周称得上是编程模型的混战周。
但GLM-5.3的落地方式有点特别:开源权重要推迟两周,API也还没开放,眼下唯一能用上它的地方只有一个——GLM Coding Plan订阅套餐,官方编程工具ZCode同步可用。小红书
所以对每天用coding Agent干活的人来说,这不是条看看就完的热点新闻,而是一个具体的决策题:要不要换5.3,Coding Plan还续不续,新用户要不要上车。下面分两部分说清楚:模型到底有多强,套餐账单怎么算。
一、GLM-5.3到底强在哪?先看官方对比表,再看社区实测
先摆三个事实:
基座没换。GLM-5.3沿用了和5.2相同的基座,总参数744B、激活40B,全部提升来自后训练。知乎官方把这条路线叫post-training scaling(后训练规模化):长程任务环境扩到数十倍,用SAO做长程任务强化学习,用IndexShare管理长上下文。说白了,不是造更大的脑子,而是把同一个脑子练得更狠。
编程提升确实猛。官方自建评测比5.2提升约50%,Terminal-Bench 3.0从4.6涨到28.3。知乎AutomationBench和GDPval两项也排在官方对比表前列。
有天花板。官方对比表里(对比对象包括Kimi K3、DeepSeek V4 Pro、Qwen3.8-Max、Claude Opus 4.8、Fable 5、GPT-5.6 Sol),GLM-5.3整体强于Claude Opus 4.8,接近Fable 5和GPT-5.6 Sol。知乎但在高难终端任务和高难编程上,仍落后于后两者。

比官方数字更值得看的,是社区第一天的实测。综合知乎、B站、小红书评论区的反馈,共识和分歧都很明显。
好评的共识:长程任务和长代码理解明显变强,评论区有用户说长程任务一遍过。小红书代码风格更保守、不疯狂输出幻觉,也有用户觉得代码质量比DeepSeek更高,写编译器这类硬活也有人跑通了。
吐槽的共识:小需求差别感知不大,速度慢,token消耗猛——有用户让它开发一个小项目,一下午烧了170M tokens还在初期阶段。小红书
再提醒一句:网上有些实测视频宣称全面打赢Fable 5,样本和评分规则并没有公开(比如X上的KingBench 3),可以当热度看,做决策还是以上面的公开基准为准。
规格上也有变化:1M上下文、最大输出128K,思考强度分low、high、max三档,注意这次没有关闭思考的选项。小红书这个细节会怎么影响账单,后面说。
二、一个被很多人忽略的细节:它因为学会了攻击,开源推迟了两周
GLM-5.3有个特别值得说的点:涌现的网络安全能力。官方评测给了两组数字——CyberGym(漏洞发现与验证)从5.2的77.2%升到84.5%,ExploitBench(漏洞利用)从24.4%升到54.4%,翻了一倍还多,但仍低于Fable 5和GPT-5.6 Sol。知乎

翻译成人话:经过大规模长程Agent训练后,模型自己学会了发现孤立漏洞、组织利用链步骤,这些是没人专门教过的能力。智谱的处理方式,是把安全评估和模型加固放在权重发布之前,开源推迟两周。知乎
对消费者来说,这有两层意思值得消化:
第一,这其实是长程Agent能力真的变强的侧面证明,代码审计、漏洞定位、补丁验证这类活,可能会变得真正可用。
第二,眼下只有Coding Plan订阅用户用得上它,API没开、权重没放,这也是我们接下来必须算账的原因。
三、重点来了:Coding Plan的账单和踩坑史
先把GLM Coding Plan这一个多月的动作捋一捋,一共三件大事:
涨价+改积分制。7月31日全线开售同步全线涨价:Pro涨幅最大,Max价格涨了用量少了,计费从token改成积分,周六日高峰期计费取消。小红书
老套餐迁移。v1老用户八月中续费升级v2,之后v1套餐就没有了;注意v1只有五小时限额、没有周限额,一次五小时限额约等于v2周额度的20%,续费会送两个月新套餐;v2老用户续费价格和内容不变。小红书
额度重置。8月11日ZCode迎来升级,所有GLM Coding Plan用户的使用额度重置了一遍。小红书
那新的积分制到底值多少?有动手的用户实测,折算率约为108.77积分/M tokens,照此计算lite套餐1万分全量使用,空闲时段大约能用92M tokens。小红书

问题在于,这个名义额度遇上GLM-5.3会打折扣。原因有两个:长程任务本来就是token消耗大户,而5.3这次又不能关闭思考,max档思考烧得更多。评论区已经有活生生的例子:v2 Max老用户两小时跑掉了五小时限额的60%。小红书换句话说,换了5.3之后,你套餐的实际工作量大概率比想象中少,要按自己的任务类型重新估算。
比账单更要紧的,是踩坑史。4月以来,社区里对Coding Plan的投诉主要集中在两类:
一类是风控封号。有用户平时只跑两个agent并发,半夜几个cron定时任务连续触发rate limit后,第二天整个账号直接被封。小红书还有用户的遭遇是直接被ban 30天,直呼买了有风险。小红书

另一类是算力波动和售后。被封用户的工单一个礼拜没人回,最后退款也只退了没用的额度,已用部分不退。小红书GLM-5.1发布那阵,算力一度严重紧张,官方搞过限时退款。小红书最紧俏的时候,买Coding Plan还得抢购,得想办法让购买按钮能够按下去。小红书社区里甚至有说法称,闲鱼上老号套餐被炒出高价(传闻,未证实,侧面说明老套餐额度被认为稀缺)。
当然也有好消息:8月初有买到手的用户反馈,虽然涨价了,但最近很丝滑、变快了。小红书涨价之后的体验,确实在变好。
四、分人群结论
把模型表现和套餐状况放在一起,给五条参考判断:
v1老用户:八月中续费升级是最后的窗口。如果你看重老额度逻辑(五小时限额、无周限额),先续费锁定赠送的两个月,升级v2后再观察;错过这个窗口,v1就没有了。
v2订阅用户:续费价格不变,别急着换档。先用重置的额度把5.3跑在自己常用任务上,看一周积分消耗曲线,再决定下次续什么档。
新用户:从小档位开始测积分折算率,不要一上来就预购长期。你主要做小需求、简单脚本的话,5.3的提升感知不大;做大仓库重构、长程调试、终端自动化,值得一试。
多并发、定时任务重度用户:先做风控自查——降低并发、避开峰时跑高频定时任务、保留使用记录、不预购年费。社区里的封号案例,基本都踩在这几个点上。
本地部署党和Claude/Fable用户:744B的权重消费级显卡跑不动,开源还要等两周,API未开放,不用等。正在用Fable 5做高难任务的,也不必全换,更现实的做法是混用:高频长程任务交给GLM省成本,高难任务留给Fable。
五、避坑自查清单和后续信号
上车前,先把这四件事过一遍:
查套餐版本:你是v1还是v2?续费日期在哪一天?剩余额度多少?
测积分折算率:跑一次自己的常用任务,记录积分消耗,换算成月成本。
查使用姿势:有多agent并发或cron定时任务的,先降并发,观察是否触发限流。
不预购长期:涨价和规则变动频繁的情况下,月付、季付比年付更稳妥。
接下来还有几个信号值得持续盯:模型API什么时候开放(第三方工具会陆续跟进接入);两周后权重是否如期放出、安全加固结果如何;八月中之后v1迁移的收尾情况;官方风控规则会不会透明化。
最后一句话总结:GLM-5.3的模型能力,可能是这次发布里最不用担心的部分,真正需要你算清楚的,是那份套餐账单。