8月14日,GLM-5.3发布。按开源阵营的惯例,旗舰模型发布,第一件事应该是放出权重下载链接。但这次智谱官方写得明明白白:权重要在发布两周后才开放,前提是"完成安全评估和加固"。智谱官方博客
延期原因,官方技术博客的标题直接点了出来——“GLM-5.3: Frontier Coding with Emergent Cyber Capabilities”,涌现的网络安全能力。很多自媒体转述成了"模型自学了没教过的攻击能力",这个说法其实不准确,后面细说。
一家把"开源"当招牌的模型公司,决定把自己最强模型的权重先锁起来。这事值得从头捋一遍,也值得说清楚你该不该等。
先被唱衰,再反转:发布后的24小时
发布后的第一波反应,其实不太好。因为GLM-5.3和GLM-5.2用的是同一个基座,参数规模没有冲进1T俱乐部,小红书和知乎上的第一波帖子都在喊"低于预期":“glm 5.3发布居然连1t都没到,这……”“glm5.3又低于预期?”,还有更直接的"整了半天出了个flash版"。小红书有人甚至把情绪直接挂到了股价上,喊"ZP港股直接跳水"。
转折点来得很快。当天下午,benchmark数据开始流传,全是官方技术博客里可以直接对上的数字:内部编程评测比GLM-5.2提升约50%;专门测终端和Agent编程的Terminal-Bench 3.0,从4.6分拉到28.3分;代码仓库级的DeepSWE v1.1从46.2涨到66.9;Agents’ Last Exam从23.8涨到28.5;测漏洞发现能力的CyberGym拿到84.5%。智谱官方博客

B站的实测视频里,GLM-5.3一个prompt搭出完整的3D丧尸射击游戏,还能做macOS的像素级克隆。
到晚上,风向彻底变了。当天小红书最热的一篇是"感觉模型的Coding之战,也要结束了",500多赞、200多收藏;知乎有篇热文的标题更直接:“GLM5.3慢而稳,重点感谢DeepSeek衬托”。知乎同周发布的DeepSeek V4 Pro总参数约1.6T,是GLM-5.3的两倍还多,但上手体感被不少人吐槽"粗糙、不稳定",对比之下特别显眼。
为什么纯靠后训练能拉出50%
这次智谱的技术路线值得说道。基座模型完全没动,全部提升来自后训练扩展。智谱官方博客官方博客里主要讲了三件事:
第一,长程任务环境扩展。训练环境不再是"编程练习题",而是按真实专业工作设计的生产级流程:有的任务相当于一个资深工程师干好几天的工作量,模型要和工程师用同一套环境——计算集群、存储系统、内部文档、代码库、实验结果,自己诊断瓶颈、做优化、跑实验,交付可度量的端到端提升。
第二,环境和任务批量合成。靠人手搭环境搭不了几十个,智谱做了条流水线:研究Agent从真实工作里收集任务模式,生成带多步依赖和隐藏状态的可运行长程环境,再派一个裁判Agent亲自做题,验证任务真的可解。
第三,长程Agent任务的强化学习优化。沿用并扩展了GLM-5.2引入的SAO(含压缩机制)训练方法,解决的是"模型要连续调十几次工具才能拿到一次评分"的老大难问题,让提升在长任务上站得住,而不是只在短任务上好看。
一句话总结:以前大家比的是谁的燃料多(参数、预训练数据),这次智谱证明了同一台发动机,靠调校(后训练)也能多榨出50%的动力。这也是为什么有人说,"参数军备竞赛"正在走向尾声。
真正值得盯的:网络安全能力"涨得比预期快"
先纠正一个流传很广的误读。不少文章说GLM-5.3"长出了没教过的攻击能力"——官方口径不是这样。真实过程是:智谱在后训练里主动加入了漏洞发现的数据和环境,预期是模型更会找漏洞、更会推理漏洞,这本来就是教学计划内的。
真正让他们意外的,是能力的增长速度。博客原话是"cyber capability developed faster than we expected"——随着训练规模扩大,模型不只更会识别孤立的缺陷,还开始跨多个利用阶段做推理,能形成完整漏洞利用链的连贯计划。练的是编程和漏洞发现,"打穿利用链"的能力自己长了出来,而且涨速超预期。知乎
数据层面,官方博客给了三组基准,信息量很大:
CyberGym(白盒代码里找漏洞并验证):GLM-5.3拿到84.5%,比5.2的77.2%明显提升,也超过了Mythos 5的83.8%和GPT-5.6 Sol的83.6%,是这项基准上的最好成绩。智谱官方博客
ExploitBench(真实漏洞的深度利用推理):GLM-5.3拿到54.4%,是5.2(24.4%)的两倍多——但Mythos 5和GPT-5.6 Sol分别是78.0%和76.5%,差距还很大。
ExploitGym(限时完成利用任务):两小时预算下GLM-5.3完成105个任务,5.2只有29个;但Mythos 5是181个。

《证券日报》的报道里还有个数字:发布前两周,智谱联合国内头部安全团队开展测试,发现了2404个潜在漏洞,包括1088个中高危漏洞。微博
智谱自己的总结挺坦诚——基准越靠近利用链后端,5.3相对5.2的提升越大,但和闭源前沿的差距也越大:能力增长最快的地方,恰是他们落后最多的地方。
这就是权重延期的直接原因:官方承诺两周后放出权重,前提是完成安全评估和加固(hardening)。据公开报道所见,这可能是国产开源旗舰模型第一次因为网络安全能力的增长速度而推迟开源。以前开源发布的逻辑是"越强越快放",这次变成了"越强越要先缓一缓"。连证券日报都专门评论了一句:网络安全正在成为大模型竞争的新赛场。微博
该泼的冷水也得泼
第一,50%的提升来自智谱内部编程评测(Z.ai Code Bench),属于自家尺子。公开口径里智谱也没吹满:Max档位下GLM-5.3得分34.5%,仍低于Claude Fable 5的39.5%;真正拿得出手的是High档位,31.4%超过Claude Opus 4.8的29.5%,而且输出token只用了对方的一半左右。知乎"编程开源第一"是真的,"追平闭源旗舰"还早。

第二,体验侧有明确的负面信号。小红书上有篇"感觉GLM-5.3已经不会说人话了"的帖子,评论区超过100条——楼主拿一个复杂算法优化问题试了多家模型,GLM-5.3在非编程场景下的输出不太能看。小红书这其实不难理解:一个为编程极度特化的模型,通用对话和表达能力大概率被牺牲了一部分。想拿它聊天写文案的,建议降低预期。
第三,口径混乱。比如基座参数,社区里有7400亿、7430亿、744B三个版本,官方博客干脆不提参数规模——只谈后训练,本身就是一种态度。较真的话请以官方技术博客为准。
现在怎么办:分三种人
等权重自部署的:这两周得等,急不来。等的时候盯两个信号——一是两周后放出来的是完整权重还是精简版;二是注意官方措辞里的"加固(hardening)",说明开源版大概率做过安全处理,对"利用链"类能力划了什么边界,会直接影响本地部署的可玩性。
Coding Plan / API用户:不用等。GLM-5.3已向GLM Coding Plan全量用户开放,ZCode同步上线。知乎套餐额度和价格的账前几天的文章算过了,不重复。仓库级任务和长程debug多的话,这波升级体感应该最明显——而且官方数据里还有个隐藏福利:token效率同步提升,同样的活,输出token更省。
纯看热闹的:建议记住这个事件,它很可能是个分水岭——第一次有开源旗舰模型在发布时被安全评估"卡"住了开源。如果两周后权重如期放出、表现过硬且没出安全事故,"先安全闸门、后开源"可能成为旗舰开源模型的标准动作;反过来,如果开源版能力被明显削弱,那"危险与开放如何兼顾"就是整个开源阵营都要回答的新问题。
留几个后续观察信号:具体开源时间(盯智谱官方账号)、第三方基准的独立复现数据、以及Coding Plan用户大规模使用一周后的真实口碑。到时候再看,这位"后训练之王"是不是真的名副其实。