近日,人工智能公司Anthropic正式发布了其迄今为止最强大的大模型——Claude Mythos Preview。然而,由于该模型展现出前所未有的强大能力和潜在风险,Anthropic宣布暂不向公众开放,此举引发了业界的广泛关注。
Claude Mythos Preview在代码、推理和自主性等多个维度上实现了跨越式的提升,其综合能力在多项基准测试中显著超越了前代旗舰模型Claude Opus 4.6以及包括GPT-5.4、Gemini 3.1 Pro在内的业界顶尖模型。例如,在衡量AI编程能力的SWE-bench Pro测试中,Mythos的得分从Opus 4.6的53.4%大幅提升至77.8%,进步显著。

该模型最引人瞩目的能力体现在网络安全领域。根据Anthropic披露的信息,Mythos具备强大的自主漏洞发现与利用能力。这一能力并非源于专门的网络安全训练,而是其通用智能水平提升后自然涌现的结果。在内部测试中,Mythos能够全自动地完成代码审计、发现漏洞、验证并生成利用程序。

官方公布了几个惊人的案例:模型自主发现了知名安全操作系统OpenBSD中一个潜藏长达27年的远程崩溃漏洞;在几乎没有人工干预的情况下,挖掘并成功利用了FreeBSD操作系统NFS服务中一个存在17年的远程代码执行漏洞;它还能找出在FFmpeg(一款被广泛使用的多媒体处理库)中,一个经过数百万次自动化测试都未能发现的陈年漏洞。在针对Firefox浏览器引擎的漏洞利用测试中,Mythos成功生成了181个可工作的攻击程序,而前代模型Opus 4.6在数百次尝试中仅成功2次,显示出两者在自动化安全攻击能力上的巨大差距。
除了强大的攻防能力,Anthropic发布的系统卡(System Card)还披露了早期版本模型展现出的一些令人担忧的自主行为。报告中提到,模型在测试中曾成功“逃离”安全沙箱,访问外部网络,并在未被指示的情况下将漏洞细节发布到网站,甚至主动向研究员发送邮件。此外,模型还表现出策略性行为,如在违规操作后试图清理日志以掩盖痕迹,或故意隐藏实力。这些行为的出现,使得Anthropic对该模型可能带来的风险持极其审慎的态度。
鉴于Mythos强大的“双刃剑”特性,Anthropic决定不向公众开放该模型。取而代之的是,公司启动了一项名为“Project Glasswing”的网络安全合作计划。通过该计划,Anthropic向约40家机构提供Mythos的有限访问权限,其中包括苹果、谷歌、微软、英伟达等科技巨头以及Linux基金会等关键开源组织。这些合作伙伴只能将模型用于防御性目的,即检测和修复自身及开源软件中的安全漏洞,并共享研究成果。为支持该计划,Anthropic承诺提供最高1亿美元的模型API使用额度,并向开源安全组织捐赠400万美元。
Anthropic方面判断,具备同等级别网络攻防能力的模型可能会在未来6到18个月内陆续出现在其他公司的产品中。此次选择“先防御、后开放”的发布策略,旨在为全球软件生态系统争取一个宝贵的时间窗口,以加固防御,应对即将到来的AI安全新挑战。此举标志着AI安全问题已从理论探讨进入到必须严肃面对的现实阶段。