8月我数了数新发的AI渗透测试工具:能挖洞、能写报告,但红线只能人来碰

源自206位全网作者

17:06

这个8月,安全圈的氛围有点分裂。知乎专栏一侧,AI渗透测试相关的发布事件一个月里我能数出11条:新Agent框架、新版本工具、一份12款横评;B站一侧,“AI挖漏洞一天五百块”"七天学完即就业"的文案又开始刷屏,播放量却普遍只有一两百。两个信号放在一起读,结论其实只有一个:AI渗透测试已经不是"要不要关注"的问题,而是"谁在真做、谁在卖课、边界在哪"的问题。

一、这个月到底冒出来了什么

把8月知乎专栏里能对上号的发布摆出来,大致三类。

第一类是开源Agent框架,也就是把"渗透"整条链路交给大模型指挥的:GreyDGL主打LLM驱动的Agentic框架,支持Ollama、LM Studio本地模型接入;Strix被作者介绍为"自主AI黑客",数据不出本机,自带strix view仪表盘,也是目前全GitHub星数最高的开源AI渗透工具。知乎 vxcontrol走企业级路线,内置Metasploit工作流,用Neo4j+Graphiti知识图谱做Agent长期记忆、再接Langfuse追踪LLM调用,每一步都能查依据;aliasrobotics的CAI框架有arXiv技术报告(2504.06017),在HackTheBox和真实漏洞赏金上验证过,适合想二开的人。8月28日露面的VulnClaw、8月21日出现的dsh-pentest(DeepSeek Harness渗透模式),都是这条路线上的新名字。

8月我数了数新发的AI渗透测试工具:能挖洞、能写报告,但红线只能人来碰

第二类是商业AI渗透测试平台。据谷安天下的行业报告,悬镜安全灵脉PTE把渗透嵌入CI/CD流水线,绿盟AI-PTS用多智能体协同攻业务逻辑漏洞,奇安信"AI-加特林"覆盖金融行业200多个核心系统的常态化测试,北方实验室"北实正剑"宣称单系统测试从数小时压到10分钟以内——最后那句是厂商口径,听的时候要打折。

第三类是传统工具的AI化:8月26日Burp Suite Professional 2026.8发布,8月4日Metasploit Pro 5.1更新,8月25日B站已经出现"BurpSuite×Claude基于MCP的自动化挖洞工作流"。老工具没退场,只是开始给Agent当"手"。

二、AI现在强在哪、弱在哪

别信"AI已经全能",也别信"AI还不行",看基准。目前AI渗透最有代表性的公开坐标,是XBOW联合多家顶尖渗透厂商做的Web安全基准,104个原创Web CTF、覆盖20多类真实漏洞。知乎 另一个是斯坦福RegLab与CRFM做的CyBench,含40个专业级CTF任务,难度从人类11分钟到24小时不等。

国内可看的是腾讯安全云鼎实验室的Tsecbench。知乎用户"攻防SRC"8月21日复盘了他做的hxbai——一个面向CTF和渗透靶场的自主解题Agent:比赛正式排名第14,赛后打磨一版在同一个平台重跑,拿到了榜单第一、综合得分92.57。知乎 Web、二进制、漏洞利用、云攻击四个域满分,全程单模型自主跑、人不插手。但他在复盘里强调的其实不是分数,而是纪律:每个候选flag提交前要连过三道校验门,宁可漏、不可误判。AI渗透翻车的头号原因不是不会挖,是把幻觉当成果交上去——前面提过的dsh-pentest,界面上给每条finding配的就是带编号、可复现的验证步骤。

8月我数了数新发的AI渗透测试工具:能挖洞、能写报告,但红线只能人来碰

微步在线整理的CSOP2026大会分享给出了行业判断:现有大模型已具备足够的理解与推理能力,能在人工设定边界与审批的前提下,自主完成大部分渗透动作。知乎 难题不在模型,在整条流程可不可观测、可不可管控——输入端感知、执行端调用工具、控制端管状态的"三端工程",正在从零散技巧收敛成标准动作。谷安报告的口径同样一致:人机协同仍是主流,高风险EXP执行、复杂业务链路研判仍需专家复核。

至于社区热传的"某浏览器单月修复的漏洞六成是AI挖的",我按原始出处没核到官方口径,建议当谈资、别当论据。

三、钱的事:赏金和报价单都在变

先泼冷水:B站那条"一个漏洞五百块、一天三四单"的视频只有一百多次播放,那是招生文案,不是行情。SRC圈确实在讨论"AI挖洞变多、厂商审核压力变大",但我没找到任何一家SRC公开调低单价的公告——赏金崩盘论目前是情绪,不是数据。

真实的价格压力在B端。人工渗透的漏洞暴露空窗期按谷安报告的说法高达287天、企业年均只做2-4次渗透测试,而AI平台宣称的测试效能提升是60%-90%。知乎 厂商口径要打折,但方向骗不了人:当"常规扫描+验证"被AI压到十分钟一轮,外包渗透报价单里"人天"那一栏就是最先被砍的。值钱的部分正在从"会跑工具"迁移到"能做判断、能担责任"。

四、10月1日的新规,才是给这条赛划定调的

8月7日公安部发布《公安机关网络空间安全监督检查办法》,自2026年10月1日起施行,共23条。新华网 它规范的是公安机关的监督检查,但每个信号都打在渗透测试者身上。

办法明确,采取漏洞探测、渗透性测试等方式开展远程检测的,由地市级以上公安机关组织实施。新华网 "实弹检测"这类手段本身被当作一项需要严格程序的权力来规范;同时,重大活动安保期间设有重点检查,检查对象覆盖网络运营者、数据处理者、个人信息处理者。

把这条和"7×24小时无人值守AI渗透"的愿景放进同一个场景:你的Agent半夜扫到别人系统上,留痕、证据、责任全落在授权人头上。所以落地清单比选工具更急:书面授权加目标范围清单,域名、IP段、时间窗一个都不能含糊;全程审计留痕,vxcontrol挂Langfuse就是干这个的;分级执行——谷安报告里的六级风险策略可以直接抄作业,生产环境默认Level4-Level6只做无害检测,全量利用测试只进离线靶场。知乎

五、三类人分别怎么办

企业里干过一到三年的一线渗透:风险不是被AI替换,是简历上的技能栈还停在2023。该补的不是再多考一个证,是Agent工程那套东西——状态管理、工具接口、验证门、审计链。“你让AI替你干了哪几步、怎么兜底”,面试里已经有人这么问了。

挖SRC的:用AI抬下限——信息收集、已知CVE验证、报告初稿;把判断力留给业务逻辑漏洞,越权、支付篡改、流程绕过至今是报告里点名的"最难啃",也正是赏金最高的那类。盯紧各SRC的收录政策变化,那才是赏金曲线的先行指标。

8月我数了数新发的AI渗透测试工具:能挖洞、能写报告,但红线只能人来碰

想转行的:上一篇我数过B站视频里多少在盯学费,这篇只补一句——凡是"七天AI挖洞就业"的,让他先出示自己提交的漏洞报告编号。

最后留几个值得盯的信号:10月1日之后有没有首批执法案例;Tsecbench、XBOW榜单的月度迭代速度;商业渗透招标公告里会不会单列"AI渗透测试"。工具会一直出新,但判断和责任的溢价,暂时还在人这边。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章