最近这段时间,写代码的圈子里一直在吵同一件事:AI编程到底是真的让你快了,还是只是让你"觉得"快了。吵得最凶的几条帖子,播放量动辄几十万、上百万,里面既有用了三四年AI的老程序员,也有刚学Python三个月的新手。吵到最后,大家发现谁也说服不了谁——因为两边说的根本不是同一个东西。
如果你也在用Cursor、Claude Code这类工具写Python,或者正打算重度投入,这篇值得看完。因为有一个不太舒服但很关键的实验,把这场争论的底给揭了。
一个反常识的实验:用最熟的仓库,反而慢了19%
去年,一家叫METR的AI评估机构做了一个随机对照实验。他们找了16名经验丰富的开源开发者,让他们在自己长期维护、非常熟悉的成熟代码仓库上,做246个真实任务。任务随机分配:一半允许用当时的AI编程工具(Cursor Pro加Claude系列模型),一半禁用。METR

结果很扎心:允许用AI的那一组,平均反而慢了大约19%。
但更魔幻的是认知那一层。这些开发者在做实验之前,普遍预期AI能帮自己快24%;做完之后,他们仍然觉得AI帮自己提速了大约20%。也就是说,身体诚实地慢了19%,脑子却坚定地认为快了20%。感觉和现实,差出了快40个百分点。METR

这个实验最近在中文社区又被反复翻出来讨论,有人一句话总结了问题所在:AI把"写代码"的成本降到了接近零,却没碰"懂代码"的成本一下。知乎
为什么"写得快"不等于"干得快"
要理解这个落差,得先看清一件事:写代码从来不是开发里最耗时的那一步。真正吃时间的,是想清楚需求、看懂已有代码、验证结果对不对、以及出了问题往回改。
AI恰好只加速了最不值钱的那一步。
有个刚用AI辅助学Python三个月的网友讲了个特别典型的例子。他让AI帮忙写一道课后题,代码很快生成,注释也全,跑起来终端也不报错,他一度以为没问题。结果反复对照题目才发现,AI少写了一个形参和对应的实参——这种情况程序能正常跑,不会报错,但答案就是不对。从那以后,他每次拿到AI的代码,都得花好长时间逐行核对。知乎
还有一个更坑的。他在做一个pygame小游戏,照着书写完,画面上就是不出"飞船"。他去问AI,AI让他核对代码、检查图片格式、检查路径、还怀疑是Python版本问题,折腾一大圈全都不对。最后他自己想到会不会是操作系统差异——果然是,Windows默认的显示缩放把画面裁掉了,改两行代码就解决。知乎
这两个例子的共同点是:AI生成得飞快,但"判断它对不对"和"定位真正的问题",一步都没省,反而因为你多了一坨要核对的代码,变得更累。这就是慢19%的来源——不是AI写慢了,是你花在验收和返工上的时间,把生成的速度全吃回去了。

社区里有个高赞回答把这个悖论说得很形象:抛不开、回不去、不够好、凑合过。每一件具体的小事,AI确实是以10倍甚至20倍的速度在完成,但整体交付就是没快。知乎
先别急着否定:AI在这些场景是真的快
这里必须把话说全,不然就变成另一种带节奏。METR那个实验有个关键前提:它测的是资深开发者,在自己最熟悉、最成熟的仓库上做改动。这恰恰是AI最不擅长的场景——因为你对代码太熟了,脑子里早有现成方案,AI生成的东西你反而要花力气去读、去核对、去纠偏。
换个场景,结论就反过来了。
同样的讨论里,很多人指出:去碰一个完全陌生的框架、写一堆重复的模板代码、或者从零起一个小工具,AI大概率是真的快,而且快得明显。还有人在复述这个实验时提到一个细节——即便测出来平均变慢,实验结束后仍有约七成参与者继续用AI,因为AI省的不只是时间,还有心力、重复劳动和来回切换上下文的消耗。arXiv

所以更准确的说法不是"AI没用",而是:AI的快慢,极度挑场景。它是把力气花错了地方的加速器——在你本来就不熟、不想干、干起来机械的部分,它帮你大忙;在你最需要专注、最依赖判断的核心部分,它可能帮倒忙。
不同段位,该怎么用才真快
想明白这一点,"该不该重度用AI"就不再是一个笼统的问题,而是看你处在哪一段。
如果你还是Python初学者:别把AI当答案生成器,把它当陪练和调试助手。上面那个学三个月的网友最大的教训就是——如果你还看不懂AI写的代码,它越快你越危险,因为它会用一堆看起来合理的代码,把你的错误判断包装得严严实实。这个阶段,把省下的时间拿去练"看懂",比多生成几个程序值钱得多。
如果你已经能独立写业务脚本、日常拿Python处理数据和自动化:AI生成初稿、自己把关验收,是比较划算的用法。把AI省下来的时间,花在动手前把需求想清楚上——很多返工,根源不在AI写得差,而在一开始你没把要什么说明白,AI只能照着模糊的意图猜。
如果你是资深开发者、维护着复杂的老项目:警惕在自己最熟的代码上重度依赖AI。让它干杂活——写模板、做迁移、搭测试脚手架、啃陌生库的示例——这些它又快又稳;但核心设计和关键判断,留在自己手里。古法编程那帮人说的一句话其实很对:AI帮你编程的前提,是你自己也能编出来,而且还得能看懂。知乎
最后给你一个能落地的自我衡量办法:别再凭感觉判断AI让你快了多少。挑一个你真实要做的任务,估一下不用AI大概要多久,做完再用AI的对比一下,尤其记一笔"验收和返工"到底花了多长时间。做上三五次,你对"AI在我的场景里到底是加速还是拖累",就会有数得多——这比刷十条争论帖都有用。
写在最后
这波争论还会持续很久,工具也会一直变——就在这两天,OpenAI还宣布要终止给Cursor供应模型,理由是它被马斯克旗下公司收购后触发了控制权条款。36氪连工具的模型说断都可能断,把效率和判断力押在某一个工具上,本来就不太稳。
但有一样东西不会随工具波动而贬值:你看懂代码、判断对错、把需求想清楚的能力。AI越强,这个能力反而越值钱。
效率幻觉不可怕,可怕的是把幻觉当成了真实的生产力。下次AI又秒出一大段Python的时候,不妨先问自己一句:这坨代码,我真的能看懂、能验收吗?