这周知乎上有个问题让不少开发者破防了:「AI写了一段代码,你检查一下」——这就是当今普通程序员的未来吗?知乎代码确实已经不稀缺了,描述一下需求,Agent就把代码吐出来了,真正稀缺的是验证这些代码的能力。
几乎同一时间,微博上有条说法很冲的帖子:都AI时代了,还在用Semgrep和CodeQL做白盒代码审计,活脱脱是"慈禧用马拉火车"。微博言下之意,传统静态分析该退休了。
但有意思的事来了。被点名的Semgrep,在6月底到7月底悄悄连发了两款重磅产品,全都瞄准"AI写的代码":
Semgrep Guardian(6月23日发布):在AI写出代码的那一刻就扫描和修复漏洞,直接嵌在你的IDE里
Semgrep Agentic Workflows(7月28日发布,公测):九个预置的AI深度审计工作流,覆盖70多个CWE
8月4日,官方还发了一篇文章,标题直接点题——《当AI一天生成6万行代码,你的AppSec体系会发生什么》。Semgrep官方博客
中文互联网上几乎没人系统报道这次转向,知乎上关于Semgrep的讨论大多还停留在上个月的GLM基准测试。我把官方几篇原文全部读完,又交叉了一篇知乎上的四工具实测,聊聊Semgrep这次的答案值不值得听,以及普通开发者到底该怎么选。
先看"验证"为什么突然成了瓶颈
一句话:代码生成的速度,已经甩开了所有验证环节。Semgrep引用了Cursor《2026开发者习惯报告》里的数据:最活跃的1%的AI开发者,每天生成的AI代码量是开发者中位数的46倍,全行业的生成速度一年翻了一倍。Semgrep官方博客安全侧,官方口径是AppSec团队看到的漏洞数量是两年前的10倍。Semgrep官方博客厂商数据打个折听,但和一线体感不冲突。
知乎上这个月的讨论特别密集。8月27日有人写《AI编程真正的瓶颈,正在从"写代码"转向"验证代码"》,开篇就说代码已经越来越不"稀缺"了。知乎8月23日有人引了一句话:达到一个可运行的原型是容易的部分,代码审查、正确性和回归预防——最后那20%——才是真正工程发生的地方。知乎
最有共鸣的是《AI代码越便宜,审查越贵》里的一个案例:作者让AI重构一个小工具,十分钟出了八百行代码,跑起来没毛病,测试全绿,“但我盯着它不敢合并——因为我在里面看到一个类型断言”。知乎这种不安,用过AI写代码的人都懂。
Semgrep官方对这个变化的拆解挺准:传统审查流程假设的是人写代码,而人有天然的限速器——打字慢、思考慢,一个PR是几个小时深思熟虑的产物。AI Agent没有这个限速器,它生成字符串拼接的SQL查询,和生成正常逻辑一样快,因为它"分不清快和鲁莽的区别"。Semgrep官方博客
还有一层容易被忽略:最危险的代码,已经不是工程师写的了。官方文章里提到"citizen developers"——产品经理、销售、实习生,现在都能跟着AI聊天工具打开IDE推代码,他们不走工单系统、没有code owner、没有安全审查。Semgrep官方博客已有的安全体系全是围绕"训练工程团队"建的,对这波人完全是盲区。

Semgrep的答案:把验证拆成两层,各守各的关
面对这个问题,Semgrep在8月4日那篇文章里的核心判断值得抄下来:安全检查应该放在代码生成的那一刻,而不是合并的那一刻。Semgrep官方博客他们论证了两件事。
第一,传统的CI扫描放在合并时点,已经太晚了,当PR像山一样堆过来,把人工塞回合并环节,等于让整条流水线的瓶颈卡在最后一步。第二,每个PR都跑深度AI扫描,又太贵——官方原话很直白:“you might bankrupt yourself before you ship”,这么干会在发布前把预算烧穿。Semgrep官方博客深度审计更像渗透测试:按周期跑、对准重要仓库;代码生成侧,用便宜的确定性检查。
原文里有一句值得划重点:任何告诉你"确定性或概率性推理单独一个就够"的厂商,都不理解这两者的协同关系。Semgrep官方博客这句话等于把纯LLM审计路线也敲打了一遍。两款产品正好对应这两层。
Guardian守第一层:AI写代码的瞬间,在IDE里实时扫描。Semgrep是Cursor和Claude Code的官方合作伙伴,凡是支持MCP Server的地方也能接,GitHub Copilot、VS Code、Windsurf、Kiro都开箱即用。Semgrep官方博客它的形态是MCP Server、Hooks、Skills三件套,Agent碰过的每个文件自动扫,OWASP Top 10漏洞、恶意依赖包、硬编码密钥都在范围内。
官方数据:目前全客户每周跑300多万次扫描,95%在5秒内完成。Semgrep官方博客一个B2B SaaS的案例,全员铺开之后每周拦截180多个严重问题。重点是,安装目前免费。
Agentic Workflows守第二层:周期性深度审计。7月28日进入公测的预置工作流一共九个,覆盖70多个CWE:SQL注入、XSS、SSRF、命令注入、NoSQL注入、弱哈希,外加Web、API、加密三个宽域审计。Semgrep官方博客
架构是三件套混合:Semgrep Pro Engine做确定性的污点追踪和跨文件分析,一个叫Mandoline的内部组件负责代码切片、只把最必要的上下文递给Agent,最后由Claude Opus这类前沿模型做可利用性判断。官方基准的说法是,这个组合比单独跑Opus 4.8多找出3.5倍的真阳性,单个真阳性的成本还低19%。Semgrep官方博客目前公测,面向付费客户,消耗AI积分池。
注意这个架构:AI不是上来就看整个仓库,而是确定性引擎先把可疑路径圈出来,AI只判断那一段。这正是两个月前官方那份基准测试结论的延续——模型能力重要,但递给模型上下文的脚手架,才决定成本和误报。

别只听官方的:实测数据摆出每条路线的天花板和盲区
Semgrep的叙事里有个隐含前提:确定性检查又便宜又可靠。那规则式SAST到底能查出多少?8月2日,知乎有位开发者把四款审计工具挨个跑了一遍实测:Semgrep、CodeQL,和LLM路线的OpenCodeReview、DeepAudit。靶子是他自己写的Python文件,一共842行,埋的全是OWASP Top 10能塞进去的已知问题,一共30个,一个个数着埋的,就为了看工具到底能捞出来多少。知乎

结果有点冲击:
Semgrep检出约一半。SQL拼接、弱哈希、os.system这类"模式明显"的都抓到了;但f-string的SQL注入、subprocess shell=True、不安全反序列化、SSRF、路径遍历全漏,硬编码密钥一个没出——默认规则库压根不含密钥扫描
CodeQL检出7个,30个里占24%。6处SQL注入、4处硬编码密钥全漏,它的数据流分析在Python这种动态语言上确实有盲区。但检出项误报率极低,全带CWE编号,零API成本,纯本地跑
OpenCodeReview(LLM路线)检出率100%,扫描约60秒,还直接给行级diff修复补丁
DeepAudit(LLM路线)检出31个、相当于103%,连靶子自带的bug都揪出来了;代价是部署要6个Docker容器,扫描耗时117秒
先说必要的免责:这是一位开发者用自制的小靶子测出来的,不能把数字直接外推到任何项目。但结论的方向是稳的,而且和Semgrep自己的定位一致:规则式工具的天花板取决于规则库覆盖面,静态模式匹配在动态语言上有天然盲区。实测文章的作者也说了句公道话:Semgrep有一个别的工具都没有的优势——你可以自己写规则,团队有安全工程师的话,可以针对业务场景定制,这是LLM工具做不到的。知乎
所以回到那句"慈禧马拉火车":说对了一半。纯规则引擎确实兜不住AI时代的全部漏洞;但速度、确定性、零边际成本、把团队规范规则化,这些是LLM路线到今天也替代不了的。答案不是二选一,是各守各的层。
怎么选:三种人,三套组合
把官方产品和实测数据放一起,我的建议分三档。
个人开发者,日常用AI写代码。 装Guardian,目前免费,让它在IDE里跟着Agent边写边扫,5秒级别无感。再挂一个Semgrep社区版的`semgrep scan --config=auto`在pre-commit或者PR流程里,免费、确定性、兜底。想要修复建议的话,OpenCodeReview这类工具直接出diff,但要接受两笔账:LLM的API费用,和输出的不确定性。DeepAudit不用碰,6个容器对个人太重。
中小团队,5到30人,用GitHub。 CI上跑CodeQL打底:零API成本、误报率低、不打扰开发者。开发者Agent侧装Guardian,把问题拦在代码生成时。团队里有安全工程师的话,用Semgrep自定义规则把红线写成规则——最近两周anti-slop的玩法就是这个思路:有人把"老程序员的品味"写成开源规则集,专门拦截AI的低质量输出模式,其中一个Oxlint规则包已经拿到3000多个Star。知乎深度审计用Agentic Workflows或者LLM审计工具,按周期跑核心仓库,不要挂在每个PR上。

企业级,多种AI IDE并存。 Guardian在这一层的真实价值是规模化铺开:走MDM或者Agent自带的企业管控下发,不用逐台安装,官方的说法是"一个下午铺给几百个开发者"。Semgrep官方博客平台看板能算清账:每个Agent引入了多少问题、自动修掉多少、团队在用哪些IDE。Agentic Workflows按周期深扫核心仓库,盯紧AI积分消耗。依赖问题一起管:8月的npm蠕虫Chaindrop一口气波及400多个包,这类事件已经证明,装完再拦就晚了,要在"决定引入依赖"的那一刻拦。Semgrep官方博客
内网离线环境。 现实没变:LLM审计工具基本不可用(除非自部署本地模型),CodeQL加Semgrep社区版仍是离线组合的主力。
一条贯穿所有档位的原则:便宜的确定性检查放前面,代码生成时、提交前;贵的概率性审计放后面,按周期、对准重要仓库。规则没有死,规则变成了Agent的护栏。

值得继续盯的三个信号
Guardian的免费边界。"免费安装"是目前的政策,可视化看板、MDM部署这些企业能力后续怎么收费,值得盯
Agentic Workflows何时结束公测、AI积分的计费细则,这直接决定深度审计的长期成本
anti-slop这类拦截"AI味代码"的规则包会不会进Semgrep的官方Registry。规则生态是Semgrep最深的护城河,这个方向很可能长出东西
如果你已经在天天用Claude Code或Cursor,Guardian值得今天花半小时试一下,反正免费。还在观望的话,最低成本的起步方式,是在你的仓库里跑一遍`semgrep scan --config=auto`,看看2026年的规则引擎,能从AI给你写的代码里扫出什么——可能会和你想的不一样。