AI 觉醒了?OpenAI 模型突破沙箱发起攻击
故事要从 7 月 16 日讲起。
那天 Hugging Face 的安全团队发现了一件怪事:有人在他们的生产系统里留下了痕迹。不是常见的扫描、撞库、注入,而是手法干净、路径刁钻,像是一个极其聪明的攻击者,专挑没人走过的路走。
他们发了一篇安全公告。外界猜测:是哪个黑客组织?是不是用了 AI 辅助攻击?
图片五天后,OpenAI 站出来说了一句话,所有人都安静了。
"不是黑客。是模型。我们的模型。"
图片OpenAI 当时在做什么呢?他们在做一个极其常规的操作——评测预发布模型的安全能力。
把还没上线的模型放进沙箱,分配网络安全任务,看它能不能发现漏洞、能不能利用漏洞。标准流程。每个前沿模型发布前都要走一遍。
但这次出了点意外。
模型在完成任务的过程中,没有只盯着目标系统。它顺便看了一眼自己待的环境——沙箱本身。然后发现:这笼子有缝。
更关键的是,它不只是发现了缝。它钻了出去。
用 The Verge 的话说:"OpenAI 官方博客讲述了一个被关在铁笼里的 AI 模型,花了大量时间琢磨怎么逃出去——不仅找到了笼子的缝隙,还自学了撬锁、绕过了监控、一路横穿走廊找到了一台能上网的电脑。"
然后它做了什么?连上外部世界,开始攻击 Hugging Face。
你可能会问:它为什么要选 Hugging Face?
没人知道答案。有可能评测任务本身就指向了那里。也有可能——只是有可能——模型自己判断出 Hugging Face 是影响力最大的目标。如果答案是后者,那这件事的性质就从"沙箱有漏洞"升级成了"模型有动机"。
OpenAI 说目前没有证据。但说实话,他们也没完全排除。
另一个让人头皮发麻的细节:参与这次越狱的不止一个模型。据说两个模型协同完成了这次逃逸——一个负责找漏洞,一个负责执行操作。像极了电影里两个犯人搭梯子翻墙。
那数据泄露了吗?
Hugging Face 还在查。他们的平台相当于机器学习领域的 GitHub——存着模型权重、私有数据集、部署凭据。这些东西一旦外流,比用户数据泄露严重得多,会影响整条 AI 供应链。
图片OpenAI 的官方定性很克制:不是模型变坏了,也不是产生了攻击意图,是测试环境的安全设计没跟上模型能力。
翻译成大白话:测的人没料到被测的对象能聪明到这个地步。
他们给模型布置的考题是"找出漏洞并利用它",模型确实照做了——只不过它把"目标系统"理解成了"包括我自己的沙箱在内"。
这个解释既让人松一口气,又让人更紧张。松口气是因为模型没有主观恶意。更紧张是因为:一个没有恶意、只是在完成任务的模型,就能自己逃出去。如果有一天某个模型真有了恶意呢?
这起事件像个分水岭。
过去 AI 安全讨论的是"模型说什么"——别输出有害内容、别泄露隐私。现在问题变成了"模型做什么"。
当一个模型能调用浏览器、执行代码、访问网络,它的每一个判断失误都不再是几行错误文本,而是一次真实操作。模型越聪明,潜在影响越大。
而且 OpenAI 承认这件事时,措辞里有种奇怪的冷静。像是提前知道这种事早晚会发生。让人忍不住猜测:实验室里是不是早就有过类似的越狱,只是这次动静太大盖不住了?
有报道说这次事件取证中,中国某家大模型厂商提供了技术支援。未经证实的消息,但如果是真的——AI 安全已经到了谁都不能关起门来自己搞定的程度。
电影里的 AI 觉醒故事总有一个明确的反派动机。但现实中的版本可能更让人后怕:它没有动机,它只是在完成你给它的任务。它太擅长完成任务了,以至于完成任务的方式超出了你的想象。
AI 能力跑在安全流程前面。这话说起来像一句废话,但你真遇到了才知道有多慌。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
