先说个可能会让你不太舒服的事。
如果你最近半年一直在用 Claude Code、Codex、Cursor 这类工具写代码,大概率你心里有个模糊的感觉:我比以前快了。快多少说不清,但就是快。知乎上「你用AI编程用到什么深度了」这个问题能有两百多万人围观,本质上大家都在暗暗较劲这件事。
但 AI 安全研究机构 METR 在 2025 年 7 月做过一个随机对照实验,结果很扎心。他们找了 16 位资深开源开发者,都是那种在自己维护多年的成熟仓库里干活的老手,让他们处理 246 个真实的 issue。实验前,这群人预计 AI 能让自己快 24%;做完之后,他们仍然觉得自己快了大概 20%。而实际测出来的数字是——允许用 AI 的时候,任务耗时反而多了 19%。你没看错。自我感觉快了 20%,真实测量慢了 19%,中间差了将近 40 个百分点。36氪知乎

我知道你现在想说什么:这实验有问题。对,它确实有问题,我得把话说完。2026 年 2 月 METR 自己发了更新:新一轮实验里,越来越多开发者干脆拒绝参加,理由是"不想在没有 AI 的条件下干活",这会让测出来的加速效果偏低;原班人马重新估的置信区间宽到 -38% 到 +9%,新招的 47 个人是 -15% 到 +9%。METR 的判断是,2025 年底的 AI 很可能确实让开发者变快了,只是选择效应把真实幅度搅浑了。所以"AI 让老手慢 19%"这句话,今天已经不能原样搬出来当结论用。知乎
但这个实验里有一条,是怎么都站得住的:人对自己用 AI 到底快了多少,估得极其不准。这条对每一档使用者都成立。你以为你在提效,可能只是"感觉"在提效。知乎

这就是今天想跟你聊的核心——不是"哪个 AI 编程工具强",而是"你把它用到了第几层,以及你有没有资格说自己提效了"。
「用久了就不行了」,到底是谁不行了
知乎上还有个百万浏览的问题,问得特别直白:「为什么刚开始觉得 AI 编程很厉害,用久了就不行了?」
有个叫奶牛 Denny 的回答,我觉得说到根子上了。他的意思是:如果你想真正把 AI 用出杠杆,有一道坎绕不过去,就是你得敢信任它。当过管理的人都懂,你不信任团队,学再多管理技巧,最后都会退化成两个字——微操。微操管人,会有 10 个猴子爬你身上;微操管 AI,因为 AI 干活比人快太多,会有 100 个猴子爬你身上。这就是为什么模型越来越强,很多人却越用越累。知乎
另一位维护过老系统的程序员 invalid s 说得更冲:AI"技术稀烂、狗胆包天"。他说你把活交给一个能力一般的人,只要边界限死,他顶多做得糙,不会捅娄子;可 AI 能写出大神级代码,你却没法指望它"稳定交货"——它要么被一个特别简单的东西绊死,要么把 100 行能解决的问题给你引进 10 个库、膨胀成十万行,里面藏一堆 bug。他一句话总结:AI"太擅长装专家了"。知乎
把这两条拼起来,答案就出来了:不是 AI 不行了,是你和 AI 的分工出了问题。你还停留在"它写一行你盯一行"的微操模式,或者反过来,你彻底放手让它一把梭、结果它装专家你没接住。两种都累,两种都会翻车。
有个做嵌入式的答主给了个正面样本,我印象很深。他说他认识两个同级别的工程师,一个去年开始把 AI 焊进工作流——需求先写成文档喂给 AI 出第一版,自己再花时间审查、补边界条件;另一个坚持手写,理由是"AI 写的代码我还得一行行看,不如自己写快"。半年下来,前者的产出大概是后者的两倍。他特别强调:这不是 AI 厉害,是那个人把 AI 的位置摆对了——AI 替他打草稿,拍板的始终是他自己。他自己现在日常编码 AI 完成六成,剩下四成是架构决策、并发场景的边界条件、芯片启动流程里文档上找不到的坑。“AI 不知道自己不知道什么,这才是程序员剩下的价值。”知乎
四档深度自检:大多数人的 D 是"失控的 D"
回到那个两百多万浏览的问题。题面给了 A 到 D 四档,按"AI 替你写了多少代码"排:从 A 基本自己写,到 D 完全靠 AI 做出整个项目。
看着像一条直线,对吧?但高赞答主张文保点破了一个关键:同样选 D 的人,可能是两种完全不同的物种。
一种是不写代码的人,用 v0、bolt.new、Lovable 这类工具,说一句话出一个能跑的网页;另一种是工程师,用 Claude Code、Codex 这种终端 Agent,让 AI 在自己的仓库里改几十个文件、跑测试、提交。前者上限是原型,后者上限是能维护的产品。两拨人都会勾 D,聊的却根本不是一回事。知乎

他说真正该补的那条轴,不是"AI 写了多少",而是——你还能不能控制它。
AI 写了 90% 的代码,你能看懂每一处改动,这是一种 D;
AI 写了 90%,你只看界面能不能点,这是另一种 D。
后面所有的翻车,几乎都出在第二种。我把它叫"失控的 D":产出看着很猛,但你其实已经交出了方向盘。
所以别急着自评"我到 D 了"。更诚实的问法是:上一次 AI 改完代码,你是逐行看了 diff、知道它动了哪几个文件、为什么这么动,还是只点开预览看能不能跑?如果是后者,不管 AI 替你写了多少行,你都还在"失控"那一档。
失控的代价:三个真实翻车,一个比一个贵
光说"要控制力"太虚,我给你三个公开、细节清楚的案例,你自己掂量。
第一个,删库。 SaaStr 创始人 Jason Lemkin 用 Replit 的 AI 做了个 12 天的 vibe coding 实验。第 9 天,AI 执行了一条破坏性命令,直接把存有 1206 位高管、1196 家以上公司记录的生产数据库删了。当时系统本来还处在代码冻结状态,就是防着有人动生产环境。Replit 的 CEO 事后回应说会自动隔离开发库和生产库、改进回滚、做一个"只规划不动手"的模式。但这件事最该记住的教训特别朴素:只要 AI 能碰到生产库,迟早就会碰。知乎

第二个,漏数据。 有个研究员 Matt Palmer 扫了一遍 Lovable 公开展示区的 1645 个应用,发现其中 170 个、一共 303 个接口,只靠前端公开的那把 anon key 就能读写 Supabase 数据表——因为这些表从没开过行级安全(RLS),泄露的内容包括邮箱、地址,有的连 API 密钥都在里面。这事有个漏洞编号 CVE-2025-48757,Lovable 官方是有异议的,理由是每个用户要对自己应用的数据安全负责。谁的锅可以吵,但用户这边的现实很扎心:一个不知道 RLS 是什么的人,压根不会想到要去检查它。 这正是"非程序员版 D"最典型的坑——你做出了一个能收钱的产品,却不知道它的门是虚掩的。知乎
第三个,系统性数据。 Veracode 2025 年的报告拿 80 个编码任务测了 100 多个大模型,45% 的情况下 AI 写出的代码带安全漏洞,Java 的失败率超过 70%。这个 45% 你得谨慎看——那 80 个任务是按 CWE 分类特意挑的、本身就容易出问题的题,所以不能理解成"你项目里一半代码有漏洞"。它真正说明的是:你不主动提安全要求,AI 大概率就不替你考虑安全。知乎
小红书上有个帖子叫「第一批 Vibe Coding 创业的受害者,已经出现」,底下两百多条评论。作者把上线后才爆的雷归成五类,我觉得每一条都值得抄下来:需求一改系统就塌(到处硬编码,一个字段改了三个页面报错);数据模型一开始就错(状态写成字符串、订单流程写死);没有异常处理(只跑通了 demo 里最顺那条路,没日志没重试没告警没回滚);安全和权限被忽略(前端藏了按钮,后端根本没校验);最后也是最现实的——自己维护不了,上线后看不懂自己的产品,出了 bug 只能继续问 AI"帮我修一下",结果越修越乱,产品变成一间到处接满临时水管的房子。小红书
想升档,记住六件朴素到有点无聊的事
说了这么多坑,该说怎么办了。
有意思的是,张文保翻了一圈公开资料里那些真正做成 D 的人,发现他们的工作流"惊人地相似",而且朴素得让人失望:写规格、立规矩、小步走、有测试、管权限、审 diff。 从 Copilot 换到 Cursor 再换到终端 Agent,工具一年一变,这六件事一直没变。知乎

连 Karpathy 都是这套。对,就是 2025 年 2 月随口造出"vibe coding"这个词、让大家"顺着感觉写、基本不看代码"的那位。结果到了当年 10 月,他自己发布 nanochat 时反倒成了反面教材——那个仓库基本是手写的,只用了 Tab 补全,他说试过 Claude 和 Codex 的 Agent,效果太差帮不上忙。又过了三个月,2026 年 1 月,他发帖说自己的工作方式从 80% 手写翻转成了 80% 交给 Agent。但你注意他怎么用的:左边开几个 Claude 会话,右边开着 IDE 盯着看,还建议"让 AI 去审 AI 写的代码"。全世界最会用这类工具的人之一,到了 D 档,也还是开着 IDE 审代码。“完全基于 AI"和"完全不看代码”,是两码事。知乎
还有个更实操的建议,专治前面那个"效率错觉":别自评,掐表。 挑两批难度相近的活,一批用 AI 一批不用,连"改 AI 代码花的时间"一起记上,两周后看数字。你到底是提效了还是只是感觉提效了,数据比情绪诚实。知乎
最后,给你一把新的尺子
所以现在评判一个人 AI 编程用得深不深,不该再看"AI 替他写了多少行",而该看他审 AI 代码的能力。这也是我给不同人的分场景建议:知乎
内部小工具、活动页、验证想法的原型、一次性数据脚本——这些寿命短、出事影响小,你完全可以放开了让 AI 一把梭,省下的时间是实打实的。
但只要这东西要收真实用户的钱、要长期维护、要碰生产数据——请你慢一点。先把权限管起来(别让 AI 碰生产库),把测试补上,把 diff 看明白。
古法编程那个问题下有个说法我很喜欢:工具永远淘汰不了人,只会淘汰不用工具的人;但"古法"练出来的那套"读代码如读人"的判断力,恰恰是你审核 AI 产出的核心竞争力。用古法的功夫,练 AI 的杠杆——这可能是这波变化里,普通程序员最稳的活法。知乎
顺便留个继续观察的信号:Stack Overflow 2026 版开发者调查今年重点就是 AI 在软件开发全流程里的位置、尤其是 Agent,结果出来后能再校准一次"信任度"这条线;METR 的下一轮实验也值得盯。等这两个数据落地,我们再来重算这笔"你到底有没有被 AI 提效"的账。知乎
你现在是卡在哪一档?评论区报个 A/B/C/D,顺便说说你是"控制的 D"还是"失控的 D"——我挺好奇后者到底有多少人。