最近刷知乎,看到一个挺有代表性的提问:「AI代码漏洞检测工具那么多,到底哪个靠谱?」评论区吵得挺热闹。这个领域8月突然挤满了人——OpenAI 7月底开源了 Codex Security,紧接着一堆实测文、横评文、推荐文冒出来,看得人眼花缭乱。
但对关注 CodeWhisperer 的老用户来说,这事其实不新鲜。早在2023年,CodeWhisperer 就把「安全扫描」当成免费卖点:个人版不花钱,每月还送50次扫描,SQL注入、硬编码密码这些坑,写完代码顺手就能查。知乎后来它改名 Amazon Q Developer,安全扫描这条产品线一路演化,如今成了一条完整的赛道:用 AI 给 AI 写的代码做体检。
为什么这条赛道突然火了?因为问题真的来了。
42%的代码是AI写的,三分之一的人从不审查
软件供应链平台 Cloudsmith 的报告里有个数字值得记住:使用AI工具的开发者中,42%的代码由AI生成。36氪
更麻烦的是同一份报告的另一面:超过三分之一的开发者,不会在每次部署前审查这些AI代码。36氪这组合起来就是明晃晃的风险敞口。而且AI代码的问题比「写得烂」更隐蔽:只需要在代码注释、开源文档、示例代码里掺几句看似正常的话,就能牵着主流AI代码模型的鼻子走,让它自动生成带高危漏洞的代码。知乎你让AI参考的示例,本身可能就是别人下的毒。
更扎心的案例在今年3月:知名开源扫描器 Trivy 被攻击者投毒,一款原本用来检查漏洞的安全扫描器,被换成了窃密器。知乎
它被带进 CI/CD 流水线后,读取构建环境里的令牌和密钥,为攻击者继续进入下一个项目铺路。复盘时间线显示,攻击者3月19日替换了绝大多数 trivy-action 版本标签,等恶意包进入公众视野时,攻击已经跑了好几天。

安全工具自己先沦陷,这事放在两年前没人敢想。所以现在的共识慢慢变成:AI代码可以写,但上线前必须过一道机器审查。好消息是,这道工序现在有不少免费或者低成本的方案。
免费自查清单:四类方案,各取所需
第一类:正统续作——Amazon Q Developer 内置扫描
CodeWhisperer 的直系继承者。装 IDE 插件,写代码的同时就能扫,SQL注入这类经典问题依然能抓。免费版有扫描次数限制,深度使用要上 Pro,每月19美元。适合本来就挂着 AWS Toolkit、只想「写的时候顺便防一手」的人。它的定位更像安全带,不是体检中心。
第二类:名气最大——OpenAI Codex Security
7月底,OpenAI 把 Codex Security 开源了:一个命令行工具外加一套 TypeScript 开发包,一条命令扫当前目录。亮点是 scans compare:两次扫描结果按根因对齐,分成「新增的、没修的、复发的、已解决的」,把一次性体检变成体检档案。
名气是真大,GitHub 上7月30日那天仓库已经有6100多星。哔哩哔哩但实测党给的数据要清楚:有博主故意埋了8个经典漏洞做考场,命中率6/8,算上半命中是6.5个。知乎OpenAI 官方则宣称它扫了120万次 commit、找到1万多个高危问题、误报率比传统扫描器低一半以上——官方口径,先别全信。知乎


但现实门槛也得说清楚:它需要 OpenAI 的访问权限,部分深度扫描能力还在受保护的网络后面,国内直接用不顺。开源的是壳,核心能力还在门里。哔哩哔哩
第三类:开源自部署——DeepAudit 和 Metis
这是目前对国内用户最友好的一档,因为能接国产模型甚至本地模型,代码不出自己的机器。
DeepAudit 是重武器:Docker 部署,四个 Agent 分工协作,最狠的是验证环节——它会自己写攻击脚本在沙箱里跑,跑通了才算真漏洞,跑不通的只标「疑似」不充数。有实测拿一个2万行的开源项目扫出10个发现,其中2个是验证过的真漏洞。知乎
Metis 是轻骑兵:pip install 就能装,用语法解析加一次大模型调用扫改动的文件,日常提交前跑一下刚好。有人故意埋4个漏洞测试,4个全中。
代价是你得自己配环境、自己掏模型 API 的钱(接本地模型则为零)。工具本身也支持通义千问、智谱 GLM、Kimi、豆包这些国产模型,适合动手能力强、或者公司对代码出网有红线的人。
第四类:商业平台的免费额度——MonkeyScan、Snyk Code 们
MonkeyScan 这类平台注册送免费积分,提交仓库就能扫,可以先用真实项目验证效果再决定去留;Snyk Code 更偏企业流程集成;Kolega.dev 做了公开的 RealVuln 基准测试,数据相对透明。
但要提醒一句:这类工具的横评文章里软文浓度不低。比如流传较广的一篇四款工具对比,通篇把 MonkeyScan 夸出花,给出的检出率81.4%、准确率54.2%也是厂商自测口径。知乎看这类数据,先找信源,再信结论。
三个坑,比选哪个工具更重要
第一,别迷信告警数量。扫描器最容易制造的错觉是「报得越多越厉害」。误报多了你会直接无视报告,漏报多了等于没扫。看工具先问一句:它怎么证明自己报的是真漏洞?有没有验证环节?
第二,扫之前先自查密钥。AI 漏洞扫描的本质是把代码发给大模型,硬编码的密码、数据库密码、内网地址会随代码一起发送到模型 API。知乎「查漏洞的过程泄露了密钥」这种黑色幽默,真有人遇到过。敏感项目直接选本地模型方案。
第三,来路不明的扫描器别乱装。Trivy 投毒事件的教训是:安全工具在流水线里权限极大,一旦被换包,防线就是攻击者的后门。只从官方仓库、官方渠道装,别信来路不明的「增强版」「破解版」。

到底该选哪个?
给三句大实话:
日常用 AI 写点小项目、图省事的,Q Developer 内置扫描挂着就行,零成本兜个底;
做独立产品、上线前要过一遍的,能解决网络问题就 Codex Security,解决不了就上 Metis 配个国产模型,十几分钟的事;
代码涉密、公司不让出网的,DeepAudit 加本地模型,一次性把环境搭好,后面全是零边际成本。
最后说个观察信号:这个赛道8月的热度大概率只是开始。接下来值得盯两件事——Codex Security 的权限门槛会不会放开,以及会不会有工具把「扫描+自动修复」做成一键闭环。在那之前,别裸奔上线,比选什么工具都重要。