这两天渗透测试圈的信息密度有点高:知乎上ARTEX、Strix两款AI渗透测试工具前后脚被详细介绍,小红书上开源AI渗透工具Shannon的帖子拿到359个收藏;8月13日,Anthropic放出45个AI自主挖漏洞的研究报告;而更早的8月初,苹果被证实给漏洞赏金计划的提交设了上限和30天冷静期。
一边是AI挖洞工具集体爆火,一边是漏洞接收平台开始"拒收"。2026年的AI渗透测试到底进展到哪一步了?现在上车晚不晚、怎么上不踩坑?我把最近几周的公开信息捋了一遍。
AI挖漏洞是真能打,不是营销话术
先看最硬的证据。今年5月,安全研究公司Calif披露了首个公开的Apple M5芯片macOS漏洞利用:一个只有3人的团队借助Claude的Mythos Preview模型,把两个macOS漏洞串联成完整的本地权限提升链,绕过了苹果耗时五年开发的"内存完整执行"(MIE)防护。知乎从"发现有趣的东西"到拿到可用的root shell只用了5天。这个漏洞严重到两位研究员亲自驱车去苹果总部当面递交55页报告——怕走正常通道被海量报告淹没。

苹果的回应也很诚实。7月27日发布的macOS Tahoe 26.6安全更新一次修复了194个独立安全漏洞,也是苹果首次在安全修复致谢里正式点名AI:Anthropic的Claude和OpenAI的Codex Security各获3个致谢,NVIDIA AI Red Team拿到2个,Z.ai的GLM拿到1个。知乎受AI漏洞申报潮影响,苹果官方加快了安全补丁推送节奏,把原定放在26.6的修复内容提前整合进了26.5.2。微博
宏观数据同样在印证这个趋势:据行业预测,2026年CVE(公开漏洞登记)数量将达到66000个,比原始预估高出46%。知乎漏洞发现周期正被压缩到以天计,按月发补丁的传统节奏,正在变成一段越来越长的"暴露期"。
45个AI组团挖洞:266个发现背后的门道
8月13日Anthropic发布的研究把这件事往前推了一大步:45个能力相近的AI Agent被分别放进45台虚拟机,只留一个共享论坛,让它们检查15个开源项目。知乎没有项目经理分活,Agent们自发形成了"独立探索、共享线索、同行复核、统一仲裁"的协作结构,论坛外还有一个独立仲裁Agent判定提交是否新颖、有效。
被广泛传播的数字是266。但这里有个容易被带偏的地方:把"协调集群发现266个"对比"单模型独立并行只发现21个",得出"效率暴涨12倍",其实是把两组不能直接横比的数据硬凑成了一个结论。知乎从研究图表看,协调集群的token消耗是独立并行的约4.15倍。这个实验真正有价值的信号不是倍数,而是团队结构本身:AI开始具备分工协作挖洞的雏形,这比单点能力暴涨更值得警惕,也更值得关注。

但另一面:垃圾报告正在压垮漏洞披露体系
这是圈里讨论最多、圈外几乎没人知道的部分。
苹果的bug赏金计划2016年上线,2025年10月刚把最高赏金提到500万美元。结果AI大幅降低挖洞门槛后,大量业余选手用大模型批量扫代码、批量交报告,夹杂大量AI幻觉出来的假漏洞。8月初金融时报报道证实:苹果已对内部安全提交通道设置未处理报告数量上限,并新增30天冷静期,研究者需要更高额度得主动申请。微博一个7人规模的安全初创团队今年提交5份报告后通道就被限制了,其中包含一条可完全控制Mac的权限提升链——好在苹果后来主动对接重新复核。
这不是孤例,今年整条披露链路都在收缩:
1月,curl决定终止自己的漏洞赏金计划,作者Daniel Stenberg的理由是被大量低质量AI报告淹没。微博
3月,Google宣布不再接受AI生成的漏洞报告。
4月,开源云平台Nextcloud暂停了整个漏洞赏金计划;同月,HackerOne关闭了运营多年的互联网漏洞悬赏项目IBB,漏洞发现得多、修复跟不上的老模式被AI彻底打破。知乎
7月27日,GitHub重构赏金计划:设仅限受邀研究员的永久VIP通道,公开赏金改固定奖金。知乎
攻击者不需要攻破系统,只需要让审核团队忙不过来:一个AI花10秒生成的"漏洞报告",安全工程师可能要花30分钟验证它是假的。知乎Curl创始人那句吐槽更能概括现状:2026年前三周收到20份漏洞报告,“0份是真正的安全漏洞”。知乎进攻端产能爆炸,撞上审核端处理瓶颈,漏洞披露体系本身正在变成新的安全问题。
开源AI渗透工具到哪一步了:能当清单,不能当结论
回到大多数人关心的:现在有哪些工具真能上手?
Strix是当前最火的一个。8月18日它单日新增656星、冲上GitHub Trending。知乎

它的总星标已达54096、Fork 6千、贡献者70人——7月的深度解读文里这个数字还是38800,一个多月又涨了近四成。知乎定位很明确:传统安全测试只有贵的人工渗透和误报成山的SAST/DAST两条路,Strix走第三条——AI Agent像真实黑客一样自动侦察、利用、验证,不只是报告"可能有问题",而是把exploit跑出来给你看,再生成补丁、自动提PR。Apache-2.0协议商业友好,README直接给了Claude Code、Cursor、Codex的接入方式。

Shannon是另一个高热度开源选项,主打Web应用和API测试,已获46.5k Star,能分析源代码、识别攻击向量、执行真实测试。小红书
ARTEX是刚被详细介绍的新系统,走"AI自主渗透测试平台"路线:支持从资产测绘平台ScopeSentry直接同步资产,配置Claude或OpenAI的API Key驱动探索,Docker一键部署、镜像预装nmap等常用工具,Web界面可看任务执行链路和发现结果。知乎
但要泼一盆冷水:今年4月一篇对论文《Hackers or Hallucinators?》的系统解构就把问题说透了——大模型在渗透测试中会产生大量"幻觉式漏洞",言之凿凿却不可复现。苹果审核团队被淹没,本质就是这个问题的大规模显性化。所以比较务实的定位是:这些工具是帮你扩大覆盖面、生成"优先排查清单"的助手,不是出具结论的审计员——工具报的每个"漏洞",人工验证之前都不算数。
你适不适合现在上车:分三种情况
如果你是刚入门的安全爱好者:先别急着把AI工具对准真实网站。未经授权对他人系统做渗透测试,触犯《网络安全法》《数据安全法》,这是所有正规教程反复强调的第一条。知乎正确姿势是先打靶场:HackTheBox、TryHackMe、PortSwigger的Web安全学院都是免费或低成本的合法练习环境,先把手动流程的肌肉记忆练出来,再用AI对照自己的思路——AI能帮你省掉"看100遍视频",但省不掉"打穿一个靶场"。
如果你是开发者或小团队负责人:这是当前收益最明确的用法。用Strix、Shannon这类工具扫自家项目和API,把输出当成高优先级排查清单,逐条人工验证后修复,相当于用几百块API成本换一轮内部安全自查。注意两点:只测自己有权限的资产;业务逻辑漏洞仍是工具盲区,别指望一次扫描全覆盖。
如果你是安全团队:值得参考的是苹果的路径——AI辅助发现加人工审核质控,一个版本修194个漏洞的节奏已经出现。同时留意厂商赏金政策的变化:AI报告被拒收是今年的明确趋势,对外提交时,报告的可复现性和人工验证痕迹会变得更值钱。
值得继续盯的三个信号
苹果冷静期之后的政策走向:恢复开放还是转向邀请制,会定义整个赏金行业对AI报告的态度。
IBB关闭后的开源漏洞资助重建:开源项目修漏洞的钱从哪来,直接影响所有人的基础软件安全。
多智能体挖洞的后续数据:Anthropic的45 Agent实验会不会有复现和横向基准,幻觉率和可复现率是核心指标。
一句话总结:2026年的AI渗透测试,能力是真的,泡沫也是真的。把AI当扩面工具而不是免检结论,把靶场当起点而不是真实目标,这波浪潮里你才能站得住。