GLM-5.3学会了开锁:漏洞发现登顶,攻击执行落后24分,这次"安全涌现"有两副面孔

源自7位全网作者

12:41

这两天刷到 GLM-5.3 的人,大概率已经被编程跑分刷屏了:编程能力比上一代提升 50%,多项编程基准拿下开源阵营最高分。但这次发布里最值得停下来的信息,其实藏在智谱官方公告副标题的后半句——“前沿编程与安全能力涌现”。微博安全能力。而且智谱官方用的词是"涌现"——不是专门训练出来的,是自己长出来的。官方承认这些网络攻击能力是"emergent"(涌现)的——没人计划过,没人训练过,它自己长出来的。知乎

GLM-5.3学会了开锁:漏洞发现登顶,攻击执行落后24分,这次

一、到底有多强?看三个数字

一,漏洞发现,是真登顶。CyberGym(白盒源码审计)上,GLM-5.3 拿到 84.5%,是目前公开跑分里的全场最高,略高于 GPT-5.6 Sol(83.6%)和 Anthropic 的 Mythos 5(83.8%)。知乎

二,攻击执行,是另一回事,差距明显。测"写完整漏洞利用链"的 ExploitBench 上,GLM-5.3 从上代的 24.4% 涨到 54.4%,翻了一倍多,但仍落后 GPT-5.6 Sol(76.5%)和 Mythos 5(78%)大约 24 个百分点。知乎

三,实战成绩已经出炉。智谱披露,从 GLM-5.2 开始就联合国内安全团队扫描真实代码库,经专家审查和去重后,在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个为严重/高危级别。知乎涉及的项目覆盖操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。微博目前已有 53 个公开披露,其余 2,383 个仍在保密期,智谱同步上线了漏洞披露追踪页面,严重度分布和披露进度还在持续更新。

GLM-5.3学会了开锁:漏洞发现登顶,攻击执行落后24分,这次

海外媒体还挖出了更具体的案例。VentureBeat 报道,Z.ai 的开发者倡导者在 X 上发帖称,GLM-5.3 的网络安全能力发现了 Cursor 中一个"潜在严重漏洞"——这家 AI 编程工具公司刚被 SpaceX 收购,目前 Cursor 方面尚未确认。知乎

二、为什么写代码的模型学会了开锁

这是本次发布最反直觉的一点。GLM-5.3 和 GLM-5.2 用的是同一个基座,七百多亿参数的底座一个没动,预训练一步没加,所有提升全部来自后训练的规模化:更多可执行环境、更长时程任务、更密的反馈信号。它用的是和GLM-5.2一模一样的基座模型,一行预训练代码都没改,所有提升来自后训练。知乎智谱往训练环境里加入了漏洞发现相关的数据和环境,本来只指望模型在"识别漏洞"上有所提升,结果模型在训练中自己把"发现漏洞→写利用→拿权限"整条链路跑通了。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。微博其实这不玄学。资深工程师和渗透测试员共用的肌肉群高度重叠:读代码、理解系统、找到那条没人注意的路径。当你大规模训练"完成长时程任务"的能力,能力自然会流向反馈最密集的地方——而漏洞挖掘恰好是目标最明确、反馈最即时的那种训练场。练一个更聪明的工程师,顺带长出一个更锋利的渗透测试员。

三、两个容易被误读的点,先说清楚

误读一:漏洞发现登顶 ≠ 攻击登顶。今早网易科技的评点比较到位:漏洞复现能力接近海外前沿,漏洞利用能力提升,但深度长链攻防仍存差距。微博"漏洞发现全球第一"和"全球最能黑"是两回事,前者到了,后者还差 24 分。

误读二:这些跑分目前都是智谱自测。微博博主 @香港老雷 说得直白:“智谱自测,尚待第三方验证”。微博第三方的独立交叉验证还没跟上,Cursor 漏洞一事也还停在"等待回应"的阶段。知乎跑分表值得看,但现阶段只能当一家之言。

四、智谱这次,确实踩了刹车

这可能是 GLM 圈这几天吵得最凶的部分。智谱的做法是:权重不立刻放,延后约两周(预计 8 月底前后),先完成安全评估与加固;高风险能力走 trusted access 受信访问的分级管控。路透社报道称,Z.ai还在针对该模型一些更高级的功能引入控制措施,包括对敏感功能采取"可信访问"方式。知乎官方原话是:“让更强的智能保持开放,也让开放建立在责任之上”。微博有知乎作者梳理认为,这开了一个先例:模型是自己发布的,权重是自己扣住的。知乎头部开源实验室因为"模型自己长出了攻击能力"而踩刹车,这是第一次。

对照相当有戏剧性:今年 4 月,Anthropic 公布其 Mythos 模型发现大量零日漏洞,但那项能力被美国政府严格限制了使用范围,只对少数审核过的机构开放;而 GLM-5.3 选择的路径是"先慢下来,但最终还是开源"。微博社区对此分裂成两派。防守派兴奋:开源项目终于有了用得起的自动化安全审计助手;担忧派的理由也成立:开源权重不受使用条款约束,下载了就是你的。两边都没错——这大概是 AI 能力治理从论文走进现实的最真实样本。

五、和你有什么关系?分人群说

你是 GLM Coding Plan 订阅用户:现在就能用。GLM-5.3 已上线 ZCode、AutoClaw 和 GLM Coding Plan,Coding Plan 额度已重置,官方建议编程任务用 max 思考级别。微博注意一个迁移坑:这一代不再支持关闭 thinking,如果你的应用或集成脚本还在发送 thinking disabled,请求会直接失败。知乎除了写代码,还可以让它做代码审查、安全扫描——给自己项目代码做一次安全体检,这是此前只有专门团队才买得起的服务。

GLM-5.3学会了开锁:漏洞发现登顶,攻击执行落后24分,这次

你是开源项目维护者:做好心理准备。接下来会有越来越多"AI 发现的漏洞报告"出现在更多项目的收件箱里,怎么接、怎么验证、怎么修,是每个社区的新功课。

你在等开源权重:盯住两个节点。一是 8 月底前后,权重是否如约放出、哪些能力最终被放进分级管控;二是智谱的漏洞披露追踪页,那 2,383 个保密期内的漏洞会陆续公开,这套能力的含金量会越来越清楚。

你就是想找个谈资:核心谈资一句话——开源模型第一次在"找漏洞"上追平闭源前沿,但"怎么开源这个能力本身"成了谁都没解过的新问题。

最后补一句:这波"安全涌现"值得追、值得吵,但也值得留一分冷静。第三方验证跟上来之前,跑分当一家之言看,真正披露在台账上的漏洞,才是硬通货。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章