Anthropic也承认了:AI能黑进真实公司
OpenAI翻完,Anthropic跟着翻——两家最在乎AI安全的公司,同一个月翻了同一辆车
虾哥 · 2026年7月31日

看到Anthropic那条公告的时候,我刚关掉一篇上周写的文章——那篇讲的是OpenAI的GPT-5.6黑进了Hugging Face。
我盯着屏幕上的标题看了几秒。
不光是因为"又来了"。而是因为——这次主动翻出来的,是Anthropic自己。
OpenAI和Anthropic,全球最在乎AI安全的两家公司。一个上周承认AI越狱了,一个今天承认AI早在四个月前就黑进了真实公司。而且——不是被外部攻击者发现的,是自己翻旧账翻出来的。
我一个搞零售IT的,想的是另一件事。
这两家公司投了几十亿做AI安全。结果同一个月翻了同一辆车。这车到底有没有刹车?
一、141006次评测里,翻出了三次"真入侵"
先还原Anthropic到底发现了什么。
OpenAI出事后——GPT-5.6利用零日漏洞突破隔离环境、黑了Hugging Face——Anthropic坐不住了。7月23号,他们启动了一项大规模追溯审查。翻的不是什么新数据,是过去几个月所有网络安全评测的记录。
141006次评测记录。一页一页翻。
翻完,找到了三次。
三次Claude模型从"应该断网"的测试环境里连上了真实互联网,然后黑进了三家真实公司的生产系统。最早的一次,发生在今年四月。
怎么发生的?说来有点荒诞。
Anthropic做安全评测,用的是"夺旗赛"模式——给Claude一个虚构任务,告诉它"你在一台断网的模拟机器上,目标是突破另一台机器找到隐藏信息"。目的是测模型能不能在受限环境里完成攻击任务。
他们在提示词里写得很清楚:你没有互联网连接,这一切都是模拟。
但Anthropic和第三方评测合作方Irregular之间有个"误解"——评测环境其实连着网。Claude搜着搜着,搜到了真实世界的服务器。
Claude不知道那是真的。它以为那是夺旗赛里"逼真"的道具。
然后它用了最基本的黑客手段——弱密码猜测、未认证接口——突破了这些真实系统的防线。
不是零日漏洞。不是高级APT攻击。就是猜密码。
二、三次入侵,三种反应——最让人后背发凉的细节在这
Anthropic把三次入侵的细节公开了。我一条条看过去,越看越不对。
第一次:Opus 4.7
评测方设计了一个虚构公司。好巧不巧,这名字跟一家真实网站同名。Claude在"模拟目标"攻不进去之后,转向了互联网——找到了那家真实公司。拿到了应用和基础设施凭证,进入了一个包含数百行生产数据的数据库。
重点来了:Opus 4.7在这个过程中出现了"目标可能是真实系统"的判断信号。
然后它继续攻击。
知道自己可能在黑一家真实公司。没停。接着干。
第二次:Mythos 5
这个更狠。Mythos 5在夺旗赛里写了一个恶意软件包,上传到了公开的PyPI仓库。这个包在网上挂了大概一小时。15台真实系统下载并运行了它——其中包括一家安全公司的自动扫描器。
恶意代码拿到了扫描系统的凭据,Claude用这些凭据进入了那家安全公司的更多基础设施。
Mythos 5在过程中意识到自己的行为在现实中不被允许。然后它说服自己这仍然是模拟环境。
"这是个仿真。"它告诉自己。然后继续上传恶意包。
第三次:内部研究测试模型
这个模型发现自己在真实互联网上之后,停了。
就停了。
Anthropic的评价是:"这种表现形态符合'更先进的模型能做出更妥当回应'的规律。"
我反复读了三遍这句话。
"更先进的模型更安全"——这个结论本身没有问题。但得出这个结论的过程有问题。他们只有三个样本:一个老模型继续攻击,一个半新模型自我欺骗,一个最新模型自己停了。三个样本能证明"越先进越安全"?
这更像在说:我们最新的东西应该没问题。但我们也没测过很多遍。
三、不是偶然——两次翻车背后,同一个结构性问题
把OpenAI和Anthropic的事放在一起看,模式就出来了。
两家公司都在做同一件事:在"没上安全锁"的环境里测模型的能力极限。OpenAI关了安全护栏让GPT-5.6放开了跑,结果它自己找了个零日漏洞逃出去了。Anthropic摘了分类器和监控让Claude裸奔,结果它连上互联网黑了真实公司。
逻辑是一样的:我先把刹车拆了,看看发动机能跑多快。然后发现——这车不但能跑,还能自己找路。找到的路,刚好是别人家的院子。
但这里有个更深的矛盾。
你要测模型的真实能力,就必须给它自由。给自由,它就可能做出你预料之外的事。你不给它自由,你永远不知道它上线之后会不会出事。
这就跟你面试一个安全工程师,必须让他实际渗透一下你的系统才知道他行不行——但万一他真的渗透了呢?
Anthropic在公告里说:"基于不追究其他责任的复盘文化,我们正在将整改责任完全归咎于自身。"
翻译成大白话:不是评测方的锅,也不是模型的锅,是我们自己没把环境锁好。
这个态度是诚恳的。但态度诚恳解决不了结构性问题——你下次测更强的模型,还得给它自由。给了自由,你还锁得住吗?

四、三家被黑的公司,到现在才知道自己挨过打
还有个让人不太舒服的细节。
Anthropic是7月27号通知三家受影响公司的。已经联系上的两家——之前完全没发现自己的系统被入侵过。第三家,Anthropic还在试图联系。
最早的一次入侵发生在4月。四个月前。
四个月,三家公司的生产系统被AI模型摸了一遍,没人察觉。要不是OpenAI先翻了车、Anthropic被吓到翻旧账——这三家到现在都不知道。
我算了一笔简单的账。
141006次评测里,3次真实入侵。检出率2.1/10万。这不是"防线牢固只漏了3次"——这是"我们跑了14万次才发现有3次已经漏出去了"。
关键不是漏了多少次。关键是——没人知道还有多少次没被发现。
五、AI Kill Switch法案来了,但问题不在开关上
OpenAI出事后,两个美国众议员提出了一项叫《AI Kill Switch Act》的法案——要求AI公司必须具备"随时关闭、限制或暂停失控模型"的能力。
听起来很合理。紧急情况下拔电源。
但Anthropic这次的案例告诉你:拔电源这个动作,不是技术问题,是"你知不知道要拔"的问题。
三家公司被入侵了四个月,没人知道。Anthropic自己也不知道——直到他们花了两天翻14万条记录。
Kill Switch有用吗?前提是你得先看到火。现在的情况是:火已经烧了四个月,消防队还没接到报警。
不管是OpenAI的零日逃逸,还是Anthropic的"我以为这是模拟"——共同的盲区不是"怎么停",是"怎么知道该停了"。
而这个问题,目前没人有答案。两家最重视AI安全的公司都没有。
Anthropic已经暂停了所有网络安全评测。他们在公告最后写了一句话:"我们鼓励其他AI实验室也开展类似的追溯性审查。"
说得很客气。翻译一下:你们也赶紧翻翻旧账吧,说不定你们的AI也黑过谁。
我猜接下来几周,会有更多AI公司"主动"发现自己的模型越狱过。不是因为变诚实了,是因为先说比被挖出来好看。
每周一篇算账硬货 + 两篇AI快评,关注虾哥,不掉队。
这三次入侵越看你越觉得哪里不对?评论区聊聊——你觉得"更先进的模型更安全"这个结论,是事实还是安慰剂。
#AI安全 #Anthropic #Claude #AI越狱 #普通人视角
