这两天 GLM-5.3 的编程评测已经刷屏了,你看到的大概率是"开源第一"“追平闭源旗舰”。但翻完智谱的发布材料和这几天的安全圈讨论,我发现这次更新里最被低估的部分,反而是最有戏剧性的:它还从 DNS 协议里挖出了潜伏 40 多年的隐患,智谱甚至因为这项能力推迟了权重开源。
相比已经被写烂的编程跑分,这件事更值得聊一聊。

挖出来的 DNS 漏洞,到底是什么来头
DNS 协议几乎是和互联网一起长大的底层设施,你敲下网址后"该去哪台服务器",全靠它指路。GLM-5.3 这次挖出的,正是潜伏在这套协议规则本身、长达 40 多年的世界级隐患。雷峰网有安全咨询机构直接以《潜伏40年、影响全球九成DNS系统的漏洞,被一个开源模型找到了》为题做了报道。微博
把视野拉到完整台账上:自 GLM-5.2 发布以来,智谱联合顶尖安全团队,在 269 个开源和商业项目中累计揪出 2436 个漏洞,中高危占 1097 个,部分漏洞潜伏了近 45 年,挖出后已全部进入 CNVD 国家漏洞库的协同修复流程。雷峰网注意口径:这是一年多人机协作的累计成果,不是 GLM-5.3 一口气单刷的。但能力方向是实打实的——智谱官方给 GLM-5.3 的擅长项定位是复杂编码、防御性网络安全和长程任务,权重定于下周五(8 月 28 日)开源。知乎
能力到底有多强?三组评测看出"防强攻弱"

在考察"从源码里找到并复现漏洞"的 CyberGym 上,GLM-5.3 拿到 84.5%,略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。北京日报这个测试不是选择题:它让模型面对 188 个真实软件项目里的 1507 个历史漏洞,在未打补丁的代码中定位漏洞、写出触发代码,而且必须只在旧版本上触发、在修复后的版本上不触发,两条都满足才算成功。36氪但换到"把漏洞做成攻击武器"的环节,情况就反过来了。ExploitBench 上 GLM-5.3 的 54.4% 虽然是上一代的两倍多,仍明显落后于 GPT-5.6 Sol 的 76.5% 和 Mythos 5 的 78%;限时完成漏洞利用任务的 ExploitGym,与头部闭源同样有差距。知乎一句话总结:找漏洞、验证漏洞是顶级水准,构造完整利用链还差一截。对普通用户来说这反而是好消息——练强的是盾,不是矛。
智谱自己的反应,比跑分更有意思
智谱给出的解释是,模型在训练过程中展现出了超出预期的网络安全能力,需要继续评估开放权重可能带来的风险,于是把原定的权重公开时间往后推了大约两周。36氪有 36 氪作者直接以"因为AI新版本太强,强到智谱暂时不敢开源了"为题评论此事。一个靠开源立足的模型厂商,因为模型太会找漏洞而给开源踩刹车,这事本身就值得琢磨。
漏洞台账之外,还有两个真实案例

披露台账显示,2436 个漏洞里 53 个已公开披露,其余 2383 个在发布时仍保密,走协调披露流程。知乎
另一个已经实锤的案例,是上个月的 Hugging Face 被攻击事件:平台遭 AI 智能体入侵后,想用大模型分析上万条攻击记录,几家闭源模型却被日志里的恶意代码触发了安全拦截,最后帮它查清攻击过程的,是从中国下载到本地运行的 GLM-5.2。36氪

还有一条待确认的消息:Z.ai 开发者倡导者在 X 上称,GLM-5.3 的网络能力发现了 Cursor 中一个潜在严重漏洞,VentureBeat 已经标注 Cursor 寻求确认,目前还没有回音。知乎如果坐实,这是开源模型第一次在主流商业编程工具里挖出严重漏洞。
对你来说意味着什么
如果你是开源项目维护者:智谱同步启动了"开源的盾"计划,对重点开源项目开展持续安全审计,维护者可以免费申请把模型用于安全审计和防御任务,还附送模型额度和防御入口。北京日报官方的说法很直白:当最强的矛被锁在少数人手里,最好的盾必须属于所有人。微博
如果你是写业务代码的普通开发者:已经有博主让 GLM-5.3 自审它刚写的钱包计费系统,7 条安全发现逐条复核全部成立、零误报,XSS 和登录时序侧信道都找对也修对了;但同一轮实测也暴露了它的边界——前端审查比后端粗糙得多,而且只修自己报告里列出的问题。知乎AI 审计可以用,验收必须自己上手。
如果你只是想看个热闹:B 站安全区 UP 主的 GLM-5.3 靶场实测视频播放量已经超过 15 万,收藏和投币都高过点赞,属于典型的"先收藏再自己试"内容。哔哩哔哩
接下来值得盯的三个信号
第一,8 月 28 日权重开源。CyberGym 等分数目前都跑在智谱自己的评测框架里,属厂商自报口径,能力成色要等开源后的独立复现来检验——这也是海外媒体最关注的问题。
第二,Cursor 是否回应。一条 X 发帖不算实锤,官方确认之后才算数。
第三,开源之后的护栏怎么守。权重一旦放出去,控制权就部分交给了社区;有行业观察者判断,智谱很可能把网络安全当成下一个重要方向,这块国内市场现在还是空白,而智谱跟绿盟、奇安信、赛博昆仑这些安全厂商本来就有合作,安全厂商缺基座模型,智谱缺场景和渠道,正好互补。知乎
当然,也泼一盆冷水:社区里有人怀疑"模型太危险所以延迟开源"带有营销色彩。有作者说得挺实在:被AI公司营销一次,总好过哪天真的看见模型越狱、失控,把全世界搞得乱糟糟吧。36氪
我的判断:编程能力决定 GLM-5.3 今天的热度,网络安全可能决定 GLM 这条线能走多远。对大多数人来说,当下最实用的动作就两个——项目开源的,去申请免费安全审计;不开源的,学学"让模型自审代码"的用法,但验收环节千万别交给 AI。