8月14日智谱发布GLM-5.3,资本市场的反应很直接:发布当天,智谱股价下跌3.6%。知乎要知道前两次发布可不是这个待遇,4月GLM-5.1发布时收盘上涨11.5%,6月GLM-5.2发布又涨了32.8%。但另一边,真正在用模型干活的程序员却在悄悄掏钱。有人API一上线,昨天就又充值了Coding Plan。知乎小红书上也有人开通后晒出账本,结论是订阅比按量计费更划算。小红书股价往下、充值往上,这个反差本身就值得聊一聊:GLM-5.3到底强在哪,以及每月118元的Coding Plan,普通开发者值不值得买。
一、还是那个底座,力气全花在"干活"上
先说清楚5.3是什么级别的升级。它没有重新训练基础模型,而是沿用GLM-5.2的基座,把资源集中投入到后训练阶段。知乎提升方向就三个:编程、长程Agent、网络安全,全是"干活型"能力,没有多模态,没有聊天花活。
干活能力的提升幅度确实不小。在考察真实代码项目处理能力的DeepSWE上,GLM-5.3从上一代的46.2%提高到66.9%;在要求模型直接操作终端、排查系统故障的Terminal-Bench 3.0上,从4.6%提到28.3%,翻了五倍多。36氪翻译一下:它更擅长接手一项完整的工程任务,自己读项目、调工具、开终端,把多步工作做完,而不是只补全几行代码。
第三方榜单也给了印证。在Artificial Analysis最新的综合智能指数里,GLM-5.3拿到60分,在这份14模型对比集内排第5。知乎同一份评测里,它和Claude Fable 5、GPT-5.6 Sol等闭源旗舰处在同一档,并与Kimi K3并列开源模型第一。知乎

二、安全能力太强,强到智谱自己踩了刹车
这次发布里最反常识的部分,是安全能力。在考验漏洞利用推理的ExploitBench上,GLM-5.3从前代的24.4%提高到54.4%,提升超过一倍;在要求从大型真实项目里定位并复现漏洞的CyberGym上,它的漏洞复现成功率达到84.5%,和Anthropic对照模型的83.8%基本打平。36氪

这直接把智谱自己吓到了。发布GLM-5.3的同时,智谱把原定的权重公开时间往后推了大约两周,理由是模型在训练中展现出了超出预期的网络安全能力,需要继续评估开放权重的风险。36氪一个长期靠开放权重吸引开发者的国产模型厂商,第一次因为模型太会找漏洞而推迟开源,这事本身就是一个很强的能力侧写。
而且这不是跑分游戏,已经有真实产出。从GLM-5.2开始,智谱联合国内多家安全机构用模型挖真实项目的漏洞,到5.3发布时,累计发现2436个漏洞,覆盖269个项目,其中1097个属于中高危问题。知乎对做安全研究和代码审计的人来说,这是5.3最有差异化的一块。
三、更强了,为什么没刷屏
既然跑分这么能打,为什么讨论度远不如前两次?原因也不复杂。现在国产旗舰都在卷编程、卷Agent,GLM-5.3提升的恰好是最拥挤的方向,而用户最期待的多模态这次又没碰,发布时间还撞上了DeepSeek V4 Pro正式版加首款Harness产品的同步开源。知乎一句话:能力提升在预期之内,又没有"人无我有"的话题点,热度自然被分走了。但对要掏钱订阅的人来说,没热度反而是好事——不用抢,慢慢试。
四、118元一个月,到底贵不贵
先看价格怎么变的。GLM Coding Plan刚推出时入门价只要20元/月,7月底全面开放购买后,Lite版涨到118元/月,同时改为积分制,设置每5小时和每周的额度上限。知乎从20元到118元,接近6倍,这是很多人犹豫的直接原因。
但贵不贵要看跟谁比、怎么用。按Artificial Analysis统计的单任务成本,GLM-5.3在同档模型里属于低成本选手;在DeepSWE榜单上,它排第3,而完成单个任务的成本是同档里最低的一档。知乎在"智能指数×单任务成本"的散点图上,它落在最具吸引力的象限里——能力够到前沿档,价格压在低位。

算一笔粗账:如果你每天高频跑Coding Agent,按量计费的Token消耗很容易在几天内就超过118元,包月反而是省钱方案;但如果你一周只用几次、每次任务不长,积分制的5小时窗口和周额度完全够用,按量甚至免费额度就能覆盖,没必要包月。另外注意一点:这次API定价和GLM-5.2持平,模型升了价没涨,对纯API用户是白捡的升级。
五、社区实测怎么说
用了几天的人反馈比较一致。有知乎作者在一周深度体验后给出判断:Kimi K3和GLM-5.3已经干到了全球第四、国产第一的位置,仅次于Claude Fable 5、Opus 5、GPT-5.6 Sol和Grok 4.6。知乎而且在前排模型里,GLM-5.3的参数量不是T级的,这意味着推理成本和部署门槛天然更低。

也有开发者拿它做安全审查实测,让它对自己的代码项目跑一轮漏洞扫描,输出的报告按严重等级列出发现的问题,严重、高危、中危、低危逐级分类。这类用法过去基本要靠专业工具加人工,现在一个订阅就能跑起来,对独立开发者和小团队是实打实的增量。吐槽的声音也有,主要集中在积分上限:连续跑长任务时容易撞到5小时窗口的额度墙,重度用户需要算好节奏。
六、谁值得买,谁该等等
直接给结论。值得买的人:每天用AI写代码、跑Agent任务超过一两小时的重度用户,尤其是已经在按量付费、每月Token账单超过百元的人,118元的Lite版大概率能回本;做代码审计、安全研究的人,5.3的安全能力是目前同价位里差异化最明显的一块。
不着急的人:轻度用户先别掏钱,现在有几个现成的免费口子。智谱正在搞第二轮一亿token免费送,活动到8月24日早上9点,赶上的话足够把5.3的真实水平试个明白。微博国家超算互联网也已上线GLM-5.3的API调用服务,免环境配置,登录就能一键调用。微博等免费额度用完,你自然知道自己是不是那个该包月的人。
后面有三件事值得持续盯:一是权重开源落地,按目前口径预计在8月28日前后,开源后社区复现、量化版本的表现会给出第二波真实口碑;二是积分规则会不会调整,社区里对峰谷计价的讨论已经在升温;三是同档对手的订阅价格,DeepSeek和Kimi的动作会直接影响118元这个定价的含金量。