9月23日到24日,知乎像约好了一样,同时冒出来两个问题:「用了AI编程后,你是写代码更快了,还是排错更慢了?」和「为何AI编程的速度远超人类,但程序员的工作效率却只提升了30%?」。一边是工具厂商喊「效率翻倍」,一边是每天用Claude Code、Codex干活的开发者觉得自己代码是写得快了,需求交付却没见快,甚至更加班了。知乎
这些数字为什么对不上?我把五份口径完全不同的研究和数据摊开算了一遍,结论先放这里:很可能不是工具不行,而是你的时间搬家了——搬家之后的账单,没人帮你算。
一、先把五个互相打架的数字摆上桌
数据源 | 样本 | 测到了什么 | 数字 | 它的边界 |
|---|---|---|---|---|
《Management Science》2026年·三项随机现场实验 | 约4867名开发者 | 补全类工具的「产出件数」 | 人均产出 +26% | 测的是补全工具,不是Agent;不含验收返工 |
METR 2025 RCT | 16名资深开源开发者、246个真实任务 | 端到端任务耗时 | 慢19% | 样本小,用的是上一代工具 |
Faros AI 2025.7工程数据 | 1255个团队、1万+开发者 | 团队级吞吐与审查 | 合并PR +98%,审查时间 +91%,PR体积 +154%,人均bug +9% | 公司层面:AI使用度与整体交付无显著相关 |
Stack Overflow 2025开发者调查 | 数万开发者自报 | 使用体感 | 66%最烦「差一点就对」,45.2%说调试AI代码更费时间 | 主观感受,非计时 |
DORA 2025.9报告 | 近5000名从业者(90%在用AI) | 组织级分布 | 吞吐量正相关,交付稳定性负相关 | 「放大器」:好团队更好,乱团队更乱 |
五个数字都没撒谎,但它们量的不是同一件事:+26%量的是生产端,+98%量的是提交量,+91%量的是验证端,-19%量的是高手在熟悉项目上的端到端耗时。从「写得快」到「交得快」,中间隔着评审、测试、发布和维护——写代码只是这条链上的一段。知乎

二、最扎眼的不是数字打架,是那40个百分点的体感偏差
METR实验里有个比「慢19%」更值得记住的细节:被实测变慢的开发者,事后自报「AI让我快了20%」。主观和客观之间差了将近40个百分点。知乎
机制不难理解:AI输出的过程很流畅,流畅会让人系统性低估等待和返工;你以为你在「扫一眼」AI写的代码,实际上你的大脑在逐行重新写一遍。微博9月1日那条被顶上来的帖子说得很直白:「代码产出水平的方差反而比以往更大」——同一套工具,有人产出翻倍,有人修bug修到深夜。差距不在prompt技巧,在消化和验证AI产出的能力。微博
三、时间搬去了哪:三个新窝
第一窝:读。 AI一分钟生成600行,你得一行行看懂才敢合并。SmartBear基于Cisco团队的经典研究给了人肉审查的生理极限:单次审查200~400行、不超60分钟、每小时500行以内,能抓住七到九成缺陷;超出这个区间,发现缺陷的能力断崖下跌。AI批量产出的PR,恰好从「能认真审」的区间掉进了「只能扫一遍」的区间。知乎

第二窝:验。 AI代码的错是「看起来对」的错——格式工整、命名规范、注释齐全,边界条件漏了、异常没处理,外表完全看不出来。人写的烂代码一眼能看出烂,审查者会自然警觉;AI代码把缺陷藏在了「质量不错」的表象底下。这就是那66%的人烦躁的「差一点就对」。知乎
第三窝:返工。 验收时没拦住的「差一点」,两天后以线上问题的形式回来找你,成本翻倍计。知乎那个80赞的回答把这事说透了:Notion的Geoffrey Litt那句「理解力是新的瓶颈」正在每个AI工作流里应验。知乎
四、反证检查:也别把任何一份数据当铁律
写到这里必须泼两盆冷水。-19%的METR,9月15日刚被曝出资金与前沿实验室生态高度关联,独立性存疑。而且16人的样本测的还是上一代工具;+26%的《Management Science》,测的是补全提示,不是今天能读文件、跑命令、连续执行任务的Agent工具链。知乎
证据自己就在打架,所以这篇不给你一个「AI到底提效X%」的统一答案——目前所有数据能支撑的最诚实结论只有一句:真实提速存在,真实减速也发生过;对别人成立的百分比都不算数,只有你自己的账算数。别拿顺手感当数据,也别拿一份实验给自己的工具判刑。
五、你的时间账本,一周就能建起来
改口径。 从今天起,别记「今天写了多少行」,记「这个需求从动手到合并花了多久」。工具切换前后各记一周,差距自己会浮出来。
看PR体积。 平均超过400行,你在写作端省的时间,正在评审端加倍还回去——把大任务拆小比换模型见效快。
任务分流。 模板代码、测试脚手架、批量迁移,放心让AI火力全开;十年老系统的业务改造、模糊需求,规格先行:先写接口和失败测试,再让AI填实现。
分角色自查。 入门者:AI是教练还是复印机,检验标准是合并前你能不能复述每段为什么这么写;资深者:重点量「解释上下文成本」,给AI讲清楚比你自己写还慢的任务,就不该交给AI;带队的:把变更失败率和审查等待时间拉进同一张仪表盘,只看吞吐量是自欺。
留一个红色警报。 如果你开始不敢碰自己上个月合并的模块——知乎9月20日已经在讨论「以后软件会不会变成没人真正看得懂」——那不是疲惫,是账本在报警。知乎

今天吴恩达在采访里说「人人都该学编程」,另一边高管们说「别学了,AI全包了」。这本账算完你会发现,两边吵的都不是同一件事:不管代码是谁写的,稀缺的那个动作从来不是「写」,是「验」。微博
你的时间,是写作端快了,还是验证端慢了?评论区对一下账。