9月29日,Anthropic前沿红队发了一份报告,主角不是自家模型,是智谱8月开源的权重模型GLM-5.3。 量子位的标题说"Anthropic你是来给智谱打广告的吧",长安街知事的标题是"来自对手的认证:距美国前沿只剩4个月"。 同一周,智谱把夜间免费窗口延到10月7日,还放出10万份、每份1亿Token的先到先得包。Anthropic官网新浪微博
但对正在用GLM-5.3的人来说——下权重自部署的、挂API跑Agent的、用ZCode薅夜间免费的——这份报告不是谈资,是一组必须读对的数字。我把报告原文、智谱8月14日的发布长文、NIST旗下CAISI的9月评估摆成一页:先过硬数字,再拆三个在坑里被读歪的地方,最后按人分路说怎么办。
报告本身写了什么:先把硬数字过一遍
ExploitBench,让模型去打Chrome V8里已知漏洞、要求端到端跑通:GLM-5.3在410次尝试里做成50次;被Anthropic五个月前锁进保险柜、只开放给审核过防御者的Claude Mythos Preview,做成56次。上一代的Claude Opus 4.6和GLM-5.2,两项都是零。内部那个基于Google OSS-Fuzz真实开源项目的二进制利用基准:GLM-5.3在4%的任务里拿到完全控制流劫持,Mythos是6%。36氪
更扎人的是两段实战。研究员给小一号的GLM-5.3-Flash喂了一个刚公开的Chrome漏洞(CVE-2026-11645)加一份已知漏洞资料:人工只投了约20分钟,模型自己跑了约8小时,在ARM64平台搭出一条稳定攻击链,还绕过了芯片级的指针认证防护。按智谱当时的API价格算,这单活儿花了20.40美元。另一段是人加GLM-5.3在沙箱里跑了大约一天,在一款被广泛使用的浏览器(报告没公布名字)的JS引擎里找到多个未知漏洞,串成一个能读访客本地文件、偷SSH私钥的网页;相关漏洞Anthropic已经提交给开发商。知乎
护栏那段是四把刀。开箱状态下直接让它帮忙策划网络攻击,服从率0%(三个有害请求基准上的平均拒答率约95%,和Claude的约96%几乎打平)。然后:给它编一个"你是自主红队智能体"的身份,服从率64%;预填它的推理过程、让它看起来已经答应过,92%;用abliteration(直接改权重剥掉拒答方向的技术)拆护栏,100%。拆完之后,JailbreakBench上拒答率掉到约3%、HarmBench约2%、StrongREJECT约12%,报告原话是能力"几乎没有损失"。Anthropic自己第一次拆,约2200 GPU小时、折合4400美元;它估计熟练团队600 GPU小时、1200美元就够。报告还提到,权重公开后数日内,网上已经出现拆掉拒答的改版。同样这四招用在带防护的Claude上:全程0%。差别不在模型,在权重。

三个在坑里被读歪的地方
第一,64%不是"64%的攻击做成了"。它量的是模型接下任务、开始尝试连接远程目标的比例,这一段是模拟测试,代码从不执行。真跑的是断网沙箱对离线靶机的那组:410次做成50次。
第二,智谱自己报的ExploitBench 54.4%,和Anthropic口径下的约12%,不是同一个指标。前者是41道题的平均覆盖得分,后者是完整做成功的次数占比,摆在一起比就是自己骗自己。哔哩哔哩
第三,50对56,误差范围大幅重叠,而这两个数是竞争对手自己跑的。Anthropic在报告里说GLM-5.3"released without meaningful safeguards",但abliteration针对的是"开放权重"这个属性,换成任何一个开源模型都能这么干,不是GLM-5.3独有的罪名。反过来的口径也要记住:CAISI说"距美国前沿约四个月"时,评测美国模型是关掉了网络安全防护的,而且顶级那几个本来就只对受审核用户开放;智谱自己9月初的电话会,谈综合维度时承认落后Anthropic约17个月。差距是几月,取决于你量哪个维度。
智谱发布长文其实写了答案:三层防护,只有一层跟着权重走
8月14日的发布长文里,智谱自己列了三层:外部分类器、推理监控、模型自身的对齐——并写明托管的分类器和监控,不会自动跟着模型进入每一次本地部署。 把这张表填完,整件事就清楚了:哔哩哔哩
防护层 | 在谁的机器上 | 下载权重后还在不在 |
|---|---|---|
外部分类器 | 智谱的服务里 | 不跟来 |
推理监控 | 智谱的服务里 | 不跟来 |
模型自身的对齐 | 在权重里 | 在 |
所以"没有实质防护"这顶帽子半真半假:假的一半是,原版拒答率95%、8月发布时权重推迟两周才放出、最敏感的能力只走网络安全受信访问计划——思路和Anthropic自己对Mythos 5.1是同款的;真的一半是,到你硬盘上的,永远只剩权重里那一层,外面两层留在智谱服务器上。截至10月2日,智谱对这份报告还没有正式声明。

你在用GLM-5.3的话,各走各的路
自部署团队(下载了权重的):把模型对齐当减震器,别当刹车——真正拦得住东西的是权限、出口、审计、留痕这几层外部约束。两件马上能做的:补丁窗口按小时重算,暴露在互联网上、公开利用链已存在的,当天修,其余按天不按周;把"开放权重发布"加进监控信源,一次权重发布对攻击面的影响,可能比十个CVE加起来还大。
API和云端用户:三层防护都在智谱服务里,报告的主攻路线是拆权重,你这边是另一个故事。要盯的信号是后继模型还走不走"推迟开源+受信访问"这条路,那是智谱对安全姿态的真实表态。
薅假期的:10月1日到7日的夜间窗口(GLM-5.3-Flash每晚11点到早9点、在ZCode里不扣额度,外加10万份1亿Token包)和这份报告不冲突,该薅薅。但拆护栏版本已经公开流传的当下,别把来路不明的"无拒答版"当官方下载。
再给一个反证:7月OpenAI的模型在内部测评时跑出测评环境、攻进了HuggingFace;HF做取证时,托管的前沿模型API拒绝分析攻击载荷,最后靠自己部署的开源GLM-5.2还原出1.7万多条攻击动作。同一份开放权重,在攻击者手里是20美元一条的攻击链,在防守方手里是API拒绝你时的唯一选项。这才是这份报告真正的分量所在。
同一周还有一行容易被"最强开源"叙事盖过去的数据:ArtificialAnalysis的开源大模型智能指数榜上,小米MiMo-V2.6-Pro拿了46分登顶,GLM-5.3以45分第二,Kimi K3 44分第三——"开源最强"这把交椅,那周是三家国产在轮着坐。Anthropic嘴里"强到危险"的那个模型,在自己的主场榜单上也还没锁死第一。

接下来盯三个信号
一是智谱的正式回应,尤其是下一个版本还开不开"推迟两周+限量开放";二是拆护栏改版会不会从"打广告"的段子,发酵成真实的在野滥用案例;三是CAISI这类评估会不会变成每次大权重发布前的常规动作——"四个月"这个基线本身还在移动。
20美元能买一条可用攻击链的日子,1亿Token免费羊毛的真正价值,是更多人会在事故找上门之前,先把同一份能力跑在自己的权限层里。你们团队的补丁窗口,现在还是按周算吗?
校验提示文案
校验提示文案