有朋友最近问我:想在 CI 里加一道 AI 漏洞检测,是不是得上最强的大模型?
我先不直接回答,说一个 Semgrep 官方自己做的实验。结果有点反直觉,而且这两个月被社区反复消化、交叉验证之后,方向越来越清楚:在 AI 漏洞检测这件事上,脚手架(工程系统)带来的差距,经常比模型之间的差距还大。
先看结果:GLM-5.2 在 IDOR 任务上赢了
6 月底,代码安全公司 Semgrep 发了一份基准测试报告,标题就很有梗:《We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks》。任务是 IDOR(Insecure Direct Object Reference,不安全的直接对象引用)检测,数据集来自真实开源应用中的已知 IDOR 案例。
在"简单 prompt + 基础脚手架"的公平条件下,GLM-5.2 以 39% 的 F1 分数击败了 Claude Code(Opus 4.6),后者为 37%,而 Opus 4.8/4.7 只有 28%。知乎是的,开源模型赢了。而且还有一个容易被忽略的细节:同样是 Claude Code,老一点的 4.6 反而比新的 4.8/4.7 分数更高——同一个模型,脚手架和配置不同,成绩能差出一档。
但先别急着把它做成模型排行榜
Semgrep 官方把这次测试的边界说得很明白:只是一个任务(IDOR)、一个数据集、一次运行,而且不是纯粹的模型裸能力对比,是特定配置下的结果。知乎所以"GLM 赢了 Claude"不能外推成普遍结论。
但 Semgrep 其实也不是在卖模型排行榜,它真正想回答的问题是另一个:漏洞检测能力到底来自模型本身,还是来自围绕模型的工程系统?知乎这个实验给出的答案方向很明确:harness(脚手架)带来的收益,往往比模型之间的差异更大——只是这部分收益,平时被模型迭代的话题度盖住了。

为什么说这个结论值得信?七八月的三个交叉验证
只有一个官方基准测试,可能还算一面之词。但看看社区七八月做的事情,会发现大家从不同方向走到了同一点上。
7 月下旬,新的开源污点分析引擎 OpenTaint 出现,自称是"Semgrep Pro 与 CodeQL 的 AI-ready 开源替代品"。它的设计理念一句话就能概括:Agent 学习,SAST 引擎搜索。作者的原话很直白:学习昂贵且不可预测,搜索廉价且确定。知乎大模型负责把审计经验沉淀成 Semgrep 风格的 YAML 污点规则,之后由确定性引擎拿着这些规则在全仓库反复扫描。截至 7 月 23 日,项目在 GitHub 上约 113 stars,还很早期,但自荐帖已经进了阮一峰周刊。

8 月初,有博主埋了 30 个已知漏洞做四款审计工具实测:Semgrep 检出约一半,但胜在快、确定性、规则可以自己写;LLM 系工具检出率高,但依赖 API 成本、没有 CWE 映射、缺团队管理能力。知乎最后的结论也不是二选一:CI 里高频扫描交给确定性工具,深度审计放在 PR 环节,各干各的活。

还有一条高播放量的社区观点说得更直接:AI 不应该替代 Semgrep、Bandit、Trivy、依赖漏洞扫描、类型检查这些确定性工具。知乎因为 CI 流水线的作用,是每次都给出稳定的同一个答案,而不是每次给你一个不一样的答案。
你能带走什么
如果你也打算给安全扫描"加点 AI",这次基准测试的启示挺实际的:
别从"哪个模型最强"开始,先把脚手架搭起来。稳定的 prompt 模板、结构化输出(SARIF/JSON)、结果去重和 triage 流程、规则沉淀。工程不扎实,模型再强也只是给你一堆难以消费的结果。
把 Semgrep 放在确定性底座和规则容器的位置。一行 pip 装完就能跑,结果确定可复现,社区版自带 2800+ 条规则,一套规则语法覆盖 30+ 语言。AI 最好的角色不是替代它,而是把学到的模式写成规则,让它反复执行。
别指望任何工具检出所有问题。Semgrep 官方的设计哲学就是"愿意用漏报换简洁性和更少误报"。业务逻辑类漏洞,AI 和 SAST 都搞不定,最后一道防线还是人的判断。
算一笔成本账。让大模型每次都重新读全仓库,token 像水表一样转;而规则是一次性的知识沉淀,之后每次执行接近零成本。
接下来值得盯的三个信号
Semgrep 的 Cyber Benchmarks 会不会扩展到更多漏洞类型和数据集(目前只有 IDOR,结论先当参考);
OpenTaint 路线图里列了 Python、Go、C#、JS/TS 方向,目前只有 Java/Kotlin/Spring 比较成熟;
社区最近对"ast-grep 是否要改名"这个旧争议又有新讨论,两个"-grep"工具的定位之争还在继续。知乎
对大多数团队来说,不用急着押注某个 AI 审计产品。先把 Semgrep 的社区规则跑进 CI,再试着让 AI 帮你的业务写几条自定义规则——这条路成本低、坑少,也是这次基准测试验证过的方向。
