昨晚智谱发布了 GLM-5.3,今早订阅群里聊得最多的就是同一件事:换,还是不换?这次推送节奏确实快,8 月 14 日当天,GLM-5.3 已经在 GLM Coding Plan 全量上线,ZCode 也能用,连 TRAE 中国版的内置模型都 Day 0 接入了;而网页端和公开 API 都还是"近期上线"。知乎微博也就是说,订阅用户先吃新版,其他人还得等一等。不过换之前,有两笔账要先算清楚,不然额度和接入配置变了你可能都没察觉。
值得兴奋的部分:基座没换,能力跳了一档
GLM-5.3 最反常识的地方在于:它和 GLM-5.2 共用同一个基座模型(官方口径是 743B 参数基座),全部提升来自后训练阶段的大规模强化学习。微博官方给的发布姿态相当激进:Z.ai CodeBench 编程能力比 5.2 提升 50%,部分高难度任务超越 Claude Opus 4.8,"性能比肩 Fable 5"的宣传语也直接放了出来。微博
官方编程基准图看得很直观:Terminal Bench 3.0 上 GLM-5.2 只有 4.6 分,5.3 一下跳到 28.3,但前面还站着 Fable 5 的 33.7 和 GPT-5.6 Sol 的 34.6;DeepSWE、HLE w/ Tools 也是同样的格局——5.3 在开源阵营里领跑,却还没翻过闭源前沿那道墙。科技博主宝玉发布当天的判断也正是这句:开源阵营最强,但离闭源前沿还有距离。可以兴奋,别把营销话术当结论吞下去。

这次还有一个意外惊喜是网络安全能力的"涌现":官方披露 GLM-5.3 在真实代码库中已累计识别 2436 个漏洞,CyberGym 上 84.5 分直接拿了整张基准图的最高项,超过了 Fable 5 和 GPT-5.6 Sol。微博不过 ExploitBench、ExploitGym 这两项上,闭源模型仍明显领先,安全能力是"长出来了",不是"毕业了"。

第一笔账:思考被"强制开机",默认还是最高档
真正容易被忽略的是调用侧的变化:GLM-5.3 的思考功能始终启用,不能再关掉,thinking.type 只接受 enabled;reasoning_effort 分 low、high、max 三档,默认 max。知乎翻译一下:不管任务需不需要深思,它都会先想一遍再说话。
好消息是,官方披露的 Token 效率数据里,max 档下 5.3 的准确率比 5.2 高(34.5% 对 23.4%),平均输出反而更短(约 75K 对约 96K)——走弯路少了,返工也少了。知乎坏消息是,"思考关不掉"意味着每次调用的消耗下限抬高了,尤其积分制改版后额度本就偏紧的用户,建议切换头两天盯着点消耗速度。

官方那张"推理档位 vs 输出消耗"图把这件事画得很清楚:蓝色 GLM-5.3 曲线只有 low、high、max 三个点,5.2 还保留的 Non-Thinking 点没了;它的 max 档准确率逼近 Fable 5 的 high 档,输出消耗却更收敛。这个设计本质是用"强制深思"换完成率,订阅用户要为此付出的则是额度。
第二笔账:旧配置直接改模型 ID 会报错
如果你是拿 GLM 接第三方 harness 或者自己调用的,要注意:旧配置里带"禁用思考"的写法,把模型 ID 改成 glm-5.3 之后请求会直接失败,必须按新参数重写。知乎博主"AI编程实验室"给的迁移姿势比较稳:先换成满足新版本的最小配置,复杂编程任务再往 max 提档,同时保留一个 low 档回归位,质量和延迟比过之后再决定要不要全量切。这套建议值得直接抄作业。
谁该换,谁该等
把这两天的讨论汇总一下,按人群拆:Coding Plan 存量订阅用户,切换不用额外付钱(走额度),可以直接体验,建议先 low 档跑两天,和 5.2 比一比完成率、返工次数,再决定要不要全量上 max;已经有小红书用户晒出 5.3 接 Claude Code 之后"曾经一周的成果,如今1小时达成,全程无干预还能自测",但这是单人体验,参考即可。小红书等公开 API 的用户不用急,届时还要适配强制思考,不如等正式上线和社区第一波踩坑反馈;权重开源官方口径也是"即将",想本地跑的等权重真正落地再动。DeepSeek V4 Pro、Kimi K3 的用户,目前知乎对比帖里的主流看法是:V4 Pro 涨价后仍留有一点性价比,5.3 性能更强但配 Coding Plan 可能略贵,K3 则有点久、定价不便宜。知乎三家没有绝对胜负,看你任务更看重完成质量、token 成本还是生态适配。

把官方九项基准摆一起看,差异更清楚:5.3 对 5.2 是全面领先,对 Kimi K3 多数项领先,CyberGym 甚至拿了全图最高;但 Terminal Bench 3.0、DeepSWE 这两项硬指标上,和 Fable 5、GPT-5.6 Sol 的差距肉眼可见。换不换,取决于你日常任务落在它的强项还是弱项上。
最后,几个继续观察的信号
一是 API 和开源权重什么时候落地,这决定现在这个切换窗口是不是"值得进";二是 Coding Plan 在积分制下还会不会再次调价,国内编程订阅这两个月正处在涨价周期里,"GLM Coding Plan 开放购买但价格涨了好几倍"的提问在知乎引发不少讨论。知乎准备续费的,不妨趁这次新版体验期算一算自己的临界消耗量。三是第三方实测:官方基准最终要落在自己仓库的真实任务上,像迁移指南说的那样,至少准备 10 个真实任务,固定任务描述、代码版本、工具权限和验收标准,比完成率、返工次数和 token 消耗,值不值自然就清楚了。
这次升级的方向无疑是好的——它证明后训练还能从同一个基座里榨出大增量。但对订阅用户来说,真正的问题从来不是"模型有多强",而是你的额度和工作流,跟不跟得上新规则。用得上,它是免费升级;用不上,它就是额度危机。