这两天早上打开知乎,"AI编程"时间线上飘着好几个同款焦虑:“开始用AI写代码后,我越来越不会自己排查Bug了,该停用一阵子吗”“用AI写代码久了,感觉自己基础变差了,这种焦虑有必要吗”“AI接管编码,程序员正在丧失独立写代码能力?”——提问的人从入行两年的到干了十几年的都有,而且几乎所有人都说同一句话:我不想停用AI,但我怕自己废掉。
这种焦虑不是空穴来风。9月初的一晚,OpenAI、Anthropic、xAI的服务罕见地同时出了问题,Codex、Claude、Grok这些平时被捧上天的编程助手集体罢工整整四个小时,全球数百万开发者被迫从"指令官"变回"手艺人"。宕机是极端的压力测试,但它照出来的东西是真的:一部分能力,确实在被外包的过程中悄悄流失。微博
不过先说结论,这也是这篇文章想帮你省时间的地方:"能力退化"不是一块铁板,把它拆成三层看,你会发现真正值得抢救的只有一层,而且不用停用AI就能练回来。
第一层:记忆力(语法、API、样板代码)——在退化,但不值得抢救
背不出闭包的写法、忘了某个库的参数顺序、离开补全就手生——这是大家感知最明显的"退化",也是最不值得焦虑的一层。
历史上这一幕演过:汇编程序员曾经也必须人肉记住寄存器,编译器普及后"手写汇编"退化成了小众技能,但做性能优化、做芯片、做安全的人到今天还得看得懂汇编,而且这些人工资都不低。工具吃掉的是"记忆负担",吐出来的是"判断带宽"。语法记忆就属于被吃掉的那部分——AI把它压到接近零成本,你为它花的每一分钟维护费,都是亏的。
第二层:排查推理力(复现、缩小范围、读报错)——真退化就在这层,有实验实锤
这是全文最重要的一节。做Claude Code的Anthropic自己在2026年初发了个研究,对自家产品也没客气:52名工程师学习一个陌生的编程工具,用AI帮忙的那组闭卷考试平均50分,自己动手的那组67分,差距最大的恰恰是"找bug、修bug"的题。知乎
更扎心的细节在用法上:同样开着AI,问"这是为什么"的人能考65分以上,直接甩一句"帮我写个实现"让AI代劳的人,连40分都不到。而且AI组完成任务只比手动组快了大约两分钟,统计上根本不显著——用两分钟的"快"换17分的"懂",这笔账谁算谁亏。微博
为什么偏偏是排查能力最先废?因为它依赖的不是知识,是"从看到报错到形成假设"这段推理的手感。知乎那楼里有个练了三个月的回答说得很透:真正会废掉排查能力的不是AI,是"一出错就把整段代码贴进去等答案"这个手感。知乎
写代码的时间也没有消失,只是变形了。METR在实验里统计了开发者的屏幕时间:用AI之后,纯手写代码的占比从约36.5%降到24.5%,同时多出三个新类目——"审查AI输出"约9%、"给AI写提示词"约8%、"等AI跑"约4.5%。原来在敲代码间隙完成的那段推理,现在散落在审查、提问和等待里——排查推理恰恰是最容易被顺手省掉的那一段。arXiv

这种"认知外包"的损伤不止发生在编程圈。卡内基梅隆、加州伯克利和牛津的研究者做了一系列覆盖1222人的随机对照实验:在数学推理、阅读理解等任务上,AI辅助确实让短期表现变好,可一旦撤掉AI,这批人的成绩显著变差、还更容易直接放弃——而这个效应只需要大约10分钟的AI交互就会出现。研究者的解释是:AI让人习惯了即时得到答案,剥夺了自己啃完难题的体验,而"坚持性"恰恰是技能习得的地基。论文里还有个更细的拆分:用了AI的人当中,直接要答案的那组独立表现受损最重,只让AI给提示、自己继续做的那组,损伤要轻得多。arXiv

顺带说一个比"变慢"更可怕的数据。评测机构METR在2025年做过随机对照实验:16名资深开源开发者在自己熟悉的项目里干活,能用AI的任务平均反而多花了19%的时间,但这些人开干前以为能快24%、干完还觉得自己快了20%。慢不慢可以吵,但"感觉和实际对不上"这件事没法吵——你对自己排查能力的主观判断,同样可能是失真的。这也是为什么"我最近好像不会查bug了"这种模糊焦虑,值得用一次刻意测试来验证,而不是靠体感。知乎arXiv

第三层:判断力(对不对、该不该这么写)——没退化,反而在升值
反直觉但数据很硬的一层。Stack Overflow 2025年全球调查里,84%的开发者在用或准备用AI工具,可是不相信AI写得对的人(46%)比相信的人(33%)还多,而且越是老手越不信。知乎
判断力不但没被AI吃掉,反而成了稀缺品。招聘网站Indeed的数据显示,从2025年2月底Claude Code推出到2026年7月,美国程序员岗位招聘数量涨了将近15%(同期所有岗位总量少了7%),多出来的岗位里七成招的是有经验的老手。知乎
真正被挤压的是另一头:斯坦福团队用美国最大发薪公司ADP的数据算过,到2025年7月,22-25岁年轻程序员的在职人数比2022年底的峰值少了近20%,排除公司经营因素后相对降幅仍有16%,而老员工基本没受影响。腾讯高管今年也说,公司大部分代码已由AI生成,程序员的工作变成了"指导AI写代码"和"检查AI有没有写错"。把这两条放一起看就明白了:判断力升值、新人入口收窄——退化焦虑的真正代价,可能不落在正在焦虑的你身上,而落在没有机会练出判断力的下一代身上。知乎微博

正因为看透了这一层,Anthropic在10月2日做了件耐人寻味的事:宣布投入1亿美元办Claude Frontier Academy,目标2027年底培养1万名工程师,而且不是教你怎么让AI多写代码,是沿用自家工程师的标准,考"先选出值得做的问题、做完能过安全审查、还能教同事用起来"。最懂AI的公司,砸一亿美元培养的不是"会写代码的人",而是"能为完整结果负责的人"——这几乎是给"判断力在升值"盖章。36氪
反方也得听:这个焦虑有一半可能是错觉
按老规矩,把反证摆出来,不然结论就是耍流氓。
第一,METR那个"变慢19%“的结论,机构自己在2026年2月已经公开改口:说它过时了,现在的工具大概率是让人变快的,只是新一轮实验里愿意参加的人太偏、测不准。用2025年上半年工具得出的数据,套2026年10月的Opus和GPT-6,本身就不公平。更能说明问题的是同一份研究里按"用AI时长"的拆分:累计用得越久的人反而越快,重度用户那一档已经从"变慢"翻到了"变快”——下图里最右侧那根向下的误差棒就是它。换句话说,"变慢"更像是新手期的学费,而不是能力退化的铁证。知乎

第二,“退化"的定义在变。有位干了多年的工程师在知乎回答里说得很直白:AI没有让思考变少,只是把思考从"怎么写"挪到了"写的对不对、该不该这么写”。如果你的"能力"清单还停留在2020年,那确实处处都在退化;换个清单,你可能反而变强了。知乎
第三,样本局限要说清:Anthropic实验只有52人、考的是学完马上闭卷、用的还是偏聊天式的AI;斯坦福的结论也有机构(EIG)质疑22-25岁这个窄年龄段数字波动太大。所以上面所有结论的强度,都只能到"方向可信、数字别当真"这一档。
那到底怎么办:不用停用,改四个提问姿势
结合Anthropic实验里的高分用法和知乎社区里被验证过的土办法,给一套不需要戒断AI的保功方案:
1. 排查两步法。 报错出现后,第一步自己只做三件事:复现、缩小范围、读报错原文,读到能用自己的话说出"这段代码在什么输入下会走到哪一行";第二步再放AI进场。知乎
2. 换问法:要实验,不要答案。 别问"这段代码为什么报错",问"我怀疑问题出在A和B之间,给我三种能证伪这个猜测的实验"。它给实验,你做实验——推理的主动权留在你手里。
3. 动代码前让AI先交底。 让AI修改前先说一句话:你打算改哪几个文件、为什么。这句话它说不明白,宁可自己写。知乎
4. 复制之前追问一个"为什么"。 实验里考65分以上的人干的就是这件事:代码到手后追问"你为什么用这个函数"“这段逻辑给我讲一遍”。生成后理解,和生成即提交,是两种完全不同的能力轨迹。
不同处境的优先级不一样,直接抄表:
你是谁 | 最该警惕的 | 本周就能做的一件事 |
|---|---|---|
入行1-3年,AI重度用户 | 排查推理层还没建立就被外包 | 每天留一个bug走完整两步法,再让AI进场 |
3-8年中坚,感觉"基础变差" | 感知失真(自以为快20%那种) | 挑一个熟悉项目,计时做一次无AI排查,校准体感 |
8年以上/带团队 | 团队新人失去练手机会 | review时让新人先讲假设再贴AI结论 |
非程序员vibe coding党 | 无所谓退化,但要在意"看不懂自己项目" | 让AI给关键模块写一段人话注释并讲给你听 |
值得继续盯的信号
这个题目不会一个月就吵完,四个观察点:METR新一轮(换2026年工具)的正式数据什么时候发、结论往哪边倒;Stack Overflow 2026开发者调查刚出炉,超3万人参与,AI日常使用率已经到了73%。明年这份调查里"信任率"怎么变,会再次校准判断力升值的速度;2027年初Claude Frontier Academy首批认证颁发时,看它会不会变成招聘市场的硬通货。最后一个是你自己——每季度做一次两小时的"无AI排查测试",你的真实退化速度,比任何研究都更有发言权。小红书36氪
焦虑解决不了问题,但把"退化"拆成三层之后你会发现:该放手的放手(语法记忆),该抢救的抢救(排查推理),该加仓的加仓(判断力)。这大概是AI编程时代最不亏的一笔时间投资。