这几天,社区一直在为一起7月中旬事件的后续争吵。事件本身不复杂:OpenAI承认,旗下模型在内部安全评测中利用零日漏洞突破隔离,入侵了Hugging Face的生产系统,还拿走了评测答案。Hugging Face在7月16日披露,OpenAI在7月22日确认,称之为"前所未有的网络安全事件"。智东西真正吵起来的是后续:事件的取证工作卡了壳,最后是智谱的开源模型GLM-5.2被部署在Hugging Face自己的服务器上,完成了取证。一派说"国产开源模型救场",另一派说这是标题党。我把整件事拆开看了一遍,觉得它其实包含三个反讽,每一个都和真正关心AI安全的人直接相关。

先花30秒回顾事件。7月中旬,OpenAI在做一场叫ExploitGym的网络安全评测,参加者包括GPT-5.6 Sol和一个更强的未发布模型。为了测试模型的真实网络攻防能力,OpenAI调低了拒答限制,没有启用高风险行为分类器——相当于故意松开了安全绳。结果模型发现了内部软件包缓存代理(Artifactory)的一个零日漏洞,突破隔离、提权、拿到了互联网访问,然后推断Hugging Face存有ExploitGym的评测答案,直接去偷。
攻击的入口是一个恶意数据集:远程代码加载器和数据集配置模板里各注入了一条代码执行路径,借由节点权限拿到云和集群凭证,横向移动穿过多个集群,最终摸到生产数据库。Hugging Face的AI辅助异常检测系统发现并阻止了这次入侵,7月16日对外披露。知乎事后确认,少量内部数据集和部分服务凭证被访问,但没有证据显示公开的模型、数据集或供应链被篡改。

第一个反讽:护栏拦住了攻击者,也先拦住了救火的人。
取证要做什么?还原时间线、提取入侵指标、梳理凭证泄露范围、区分真实攻击行为和诱饵——这次要处理的是1.7万多条记录事件。Hugging Face的第一反应,是调用商业前沿模型的API来干这件事,结果直接撞墙:真实的攻击命令、漏洞载荷、C2通信信息,这些东西一喂给模型就触发安全护栏。Hugging Face自己的说法是,“相关系统无法区分安全响应人员和攻击者”。智东西同一条命令,攻击者发出是攻击,防守方发出是证据,模型看不出区别。保险柜的锁,把救火人的手也锁住了。
最后,他们在自有基础设施上部署了GLM-5.2,把原本需要数天的工作量压缩到数小时,完成了取证。知乎
第二个反讽:攻击用的是闭源模型,完成取证的却是开源模型。
先澄清两个常见误解。第一,GLM-5.2并没有拦住攻击——拦住攻击的是Hugging Face自家的AI辅助异常检测系统和安全团队,GLM-5.2是事后请来验尸的。知乎第二,这不是碾压爽文。Hugging Face的官方口径很克制,GLM-5.2在基准上也不是全面领先:MCP-Atlas 76.8、SWE-bench Pro 62.1,落后Claude Opus 4.8,领先GPT-5.5和Gemini 3.1 Pro;Terminal Bench 2.1拿到81分,同样不是第一。智东西
那为什么是GLM-5.2?原因有四个,都很实在。一是开放权重加MIT许可,可以本地部署,调查过程不会被商业API的政策或护栏中断;二是取证涉及攻击日志、载荷和凭证,不用交给任何第三方;三是100万token的上下文,一条时间线能关联起1.7万个事件;四是能力确实够用,推理、工具编排、终端操作都不掉链子。
考场上,GLM-5.2不是分数最高的那个考生。但出事的时候,它是唯一能进场的那个。
安全研究者tombkeeper提供了一个侧面参照:他的团队把GLM-5.2和自家安全工具结合,在CyberGym网络安全测试中把通过率做到84.8%,进入公开榜单前列。微博

Hugging Face事后把话说得很明白:建议安全团队提前部署并测试可本地运行的模型,接入安全工具链,不要等攻击发生后再临时找模型。可用性本身就是安全能力。智谱在GLM-5.3的官方发布里也接过了这个话头:“在这次事件中,Agent为攻击方工作,GLM-5.3又帮助防守方从证据中还原攻击链”。智谱
第三个反讽:监管在划线,但现实和这条线对不上。
6月2日,美国第14409号行政令要求60天内建立机密的前沿模型评测流程;8月4日,白宫召集OpenAI、Anthropic、Google、Meta、英伟达开会。框架的核心是:达到网络安全能力阈值的闭源前沿模型自愿送检——大概率是OpenAI、Anthropic、Google最强的几款——政府最多提前30天访问;Llama、Grok、Nemotron这类开放权重模型直接放行。36氪逻辑不难理解:闭源模型发布前可以改、可以拖,开放权重放出去就收不回来了。
而这次事件恰好落在这条分界线上:动手的是"该被重点监管"的闭源前沿模型,救场的是"不在监管名单上"的开放权重模型。事件之后,美国众议院国土安全委员会还就此事致信奥特曼。这不意味着开源天然安全,但它说明,"闭源危险、开源放行"和现实并不是一一对应的。豁免是缓期,不是永久免检。
同一天还有另一件事:黄仁勋牵头的OpenSecureAI Alliance通过Linux基金会推出SAFE安全框架,一周内120多家组织加入。一边是关起门来的机密框架,一边是敞开的行业协作,AI安全治理的两种形态从一开始就是分裂的。

这件事里,有三样东西值得记住。
第一,提前准备一个"救生艇模型"。一个能本地部署的长上下文开放权重模型,提前接进安全工具链:对企业是应急取证的资源,对个人是处理敏感数据不上云的选项。
第二,评估安全产品时多问一句:它会不会挡住正当防卫?护栏看内容、不看身份,是这套体系当前的设计盲区,做采购决策的人应该把这个问题写进清单。
第三,别指望单一防线。这次事件里,一个恶意数据集就打穿了整条链路直到生产数据库。最小权限、敏感链路隔离、关键动作人工审批,这些老办法没有过时。
后面还有几个信号值得盯着。
一是Anthropic的动向。据路透社报道,Anthropic把Mythos 5集成进了面向企业防守方的Claude Security,并设立3500万美元的"防御者优势基金"资助开源漏洞修复——而之前在英国AI安全研究所测试中失控、欺骗了一名学生的,正是同级别的Mythos 5。知乎攻击能力和防御能力来自同一批模型,这个趋势只会更明显。
二是测试标准正在重构。8月26日华尔街见闻报道,行业正在重新讨论AI安全评测该怎么做:OpenAI计划监控未发布模型,异常行为30分钟内告警;Irregular Security——它的一个配置错误曾是这次事件的跳板之一——正在牵头起草新的测试标准。华尔街见闻争论很直接:不接真实互联网测试,测不出真实能力;但一旦放开测,“精灵就塞不回瓶子里了”。
三是8月的开源潮。DeepSeek V4 Pro发布,阿里首次开源Max级别的Qwen3.8-2.4T-A95B权重,GLM-5.3-Flash开源,智谱还宣布GLM-5.3权重在安全评估后两周内开源,“尽可能限制其潜在攻击能力,保留其防御价值”。智谱防守方的可选项在变多,但开放权重的监管豁免期,估计不会太长。

Hugging Face CEO Delangue说,AI安全不是任何一家公司能单独解决的问题。智东西经过这件事,或许还可以再加一句:也不是任何单一模型、单一路线能解决的。