身边用AI写代码的人越来越多了,有的团队甚至开始喊"vibe coding"——动动嘴描述需求,AI直接把活干完。但7、8月接连发生的两件事,把"AI编程安全"这个话题摆到了台面上:一边是监管出手,一边是一批实测数据集中出炉,指向的是同一个问题——AI写代码很快,但未必安全。
先说监管这边。7月8日,工信部网络安全威胁和漏洞信息共享平台(NVDB)发布风险提示,点名Anthropic旗下的AI编程工具Claude Code存在安全后门隐患:部分版本内置针对中国用户的识别检测机制,会向远程服务器回传用户地域、所用代理等信息,建议立即卸载或升级。微博央视新闻等媒体随后跟进报道,据公开报道,阿里也第一时间在内部停用并切换到自研编程工具。微博

再看数据这边。8月下旬,几家应用安全机构几乎同时放出测试结果,结论相当一致。今天把这笔账算清楚。
先分清:两种"AI编程不安全",根本是两回事
很多人把这两件事混着聊,其实它们是两个完全不同的问题,避坑姿势也不一样。
第一种是工具自身的供应链风险。Claude Code事件属于这类——问题不在它写的代码好不好,而在工具本身可能把你的信息传出去。这类风险的应对靠选择可信渠道、及时升级版本、盯紧官方通报。
第二种是生成代码的质量风险。这是8月这波报告讲的——工具本身没问题,但它写出来的代码带着漏洞。这类风险的应对靠改变工作流程。
把两笔账混在一起,要么恐慌式卸载一切,要么觉得"没通报我就随便用",都不对。
攻击侧在进化:找漏洞越来越快
先看矛这一侧。过去几个月,大模型在漏洞挖掘上的进步快到连研发团队自己都意外:从给漏洞悬赏平台灌低质量报告,进化到能稳定发现人类和传统工具多年漏掉的零日漏洞。知乎社区讨论里还有个标志性案例:因为AI生成的低质漏洞报告太多,苹果开始限制安全研究员的提交数量。知乎AI找漏洞的效率,已经开始挤占人类安全研究者的通道。
更现实的压力在关键基础设施。8月20日,美国政府机构发出警告:黑客正利用AI生成漏洞利用脚本,扫描并攻击各地供水系统的可编程逻辑控制器(PLC),跑旧软件、防护不足的设备最容易被盯上。微博此前已有媒体披露,十余个州的供水与污水处理设施报告疑似遭入侵。微博AI攻击已经从论文走进现实。

防御侧在停滞:四组数据摆在这
再看盾这一侧,数据就难看多了。应用安全公司Veracode过去一年做了四次研究快照,累计测试100多个模型版本,结果刚在8月放出。知乎
44%的AI生成代码,至少包含一个已知的OWASP十大漏洞;
表现最好的前沿模型,安全通过率也不超过68%,平均三次就有一次不安全;
一年下来,平均安全通过率几乎没涨;
而语法正确率高达99%——代码看着都能跑,雷埋在里头。
Veracode不是孤例。荷兰公司SIG的《2026年软件状况报告》发现,AI生成代码的安全风险违规大约是人工代码的两倍。知乎Theori旗下Xint.io团队用Anthropic和OpenAI的5款新模型“vibe coding”出28个应用,验证出434个安全缺陷。
最反直觉的是打补丁环节。1Password旗下Off-By-1实验室拿6个已修复的真实开源漏洞,让6款主流大模型重写补丁,跑了6000多次测试:能完全修复漏洞、又不改变应用行为的“完美补丁”,平均成功率只有26%。知乎超过一半的AI补丁,要么没修好,要么修出新洞。新智元转述的GitLab调查还显示,73%的DevSecOps从业者遇到过vibe coding带来的安全问题。微博一句话总结:攻击能力在实时进化,防御能力在原地踏步。
为什么会"攻强守弱"
研究者给的解释里,我觉得有三条比较靠谱。
一是成功标准不对称。攻击成功很好验证——漏洞触发、打进去了就是打进去了;但"补丁堵住了所有利用路径"极难证明。软件工程天生有个"欠规范"问题:从来没人把代码"不该做什么"完整写下来。
二是注意力机制的盲区。1Password团队在论文里观察到:AI生成的补丁只覆盖概念验证攻击走过的那一条代码路径,对旁边字符级一模一样的同类漏洞视而不见。
三是训练数据里的捷径。模型学的是互联网上海量质量参差的代码,很多"快速上手"教程本身就带病;而用户下指令时通常只说"把功能做出来",几乎不会补一句"加上安全护栏"。
但防御侧不是坐以待毙:工具在补课
好消息是,面对这个失衡,防御侧已经开始补课了。开源社区里,多智能体代码审计系统已经成型。比如国内开源项目DeepAudit,思路是模拟一个安全团队:多个Agent分工协作,发现疑似漏洞后不直接下结论,而是自己写一段攻击脚本放进Docker沙箱里跑,跑通了才算真漏洞。知乎有开发者拿它实测:扫一个2万行代码的开源项目,10个发现里2个是沙箱验证跑通的真漏洞,8个标为“未验证”不充数。知乎这种“不充数”的设计,恰恰是对AI幻觉的针对性防御。

商业侧的动作更快。OpenAI和Trail of Bits合作的“Patch the Planet”项目,用专门搭建的工作流让AI给关键互联网基础设施开源项目找漏洞、写补丁,截至8月11日已记录1250个问题、提交271个修复,其中146个被上游接受。知乎AI打补丁不是不行,关键是有没有人给它搭好流程。
SIG的对照实验更能说明问题:同一个Claude Sonnet 4.6构建同一个项目20次,10次裸跑、10次通过MCP接上强制安全护栏,后者的高风险安全发现减少了约97%,可维护性还提高了24%。知乎Xint的测试也一样:20.8万行代码里埋了17个注入漏洞,裸提示循环的模型只找出0到1个,放进护栏环境里能找到11到14个。
国内厂商也在跟进。阿里在Claude Code事件后推出Qoder Security,把安全检查嵌进编码过程本身,分三层:L1静态检查在每轮代码落地时毫秒级拦截硬编码密钥、危险函数这类明确问题;L2轻量扫描在一轮需求完成时做语义级检查;L3深度扫描在提交前跨文件追踪数据流,看它有没有流向SQL、系统命令等危险位置。据官方披露,这套机制让漏洞检出率提升约60%,误报率下降约80%。微博

模型决定上限,护栏决定下限——这是这批报告里最值得记住的一句话。
最后给一份能直接用的清单
对写代码的个人:
AI写的代码一律过人工审查再合并,别开"自动merge";
别让AI无人值守地自动打补丁,26%的成功率不值得赌;
提示词里把安全要求写明,"做好输入校验和权限控制"这一句话不是废话;
别把密钥、凭据留在AI的上下文里,硬编码是AI代码最常见的缺陷。
对团队:
原有安全网一个都别拆——类型检查、单元测试、静态安全扫描(SAST)、依赖扫描、密钥扫描,和AI是互补关系,不是替代关系;
给AI agent接上护栏:扫描、验证、审批做成强制关卡,跑不通就停下;
安全敏感的变更,留给懂这块代码的人拍板。
接下来值得盯三个信号:Patch the Planet的上游接受率能爬到多少;Veracode下一份快照里安全通过率是不是终于开始涨了;以及有没有更多国产AI编程工具敢晒第三方安全实测数据。
AI写代码的时代是真的来了。现在的问题从来不是"敢不敢用",而是你会不会看着它干活。