这个月后端圈有场架,一直没停过。导火索是知乎上的一个问题:"现在程序员的代码大多数都是用AI生成的,后面会成为屎山代码看不懂吗?"980多赞、85条评论、126万人看过,评论区直接分成两派吵了起来。知乎再往前,"AI写了60%的代码,为什么企业研发效率还是没飞起来?"的话题已经拿过一千多赞。知乎
同一时间还发生了两件事。一位面试字节国际支付后端的同学发了三面面经:面试官让他手写一个秒杀系统,只有手撕环节没有问答,他没撕出来,复盘是"主要是平时写代码做项目太依赖AI了,很多Java的API没有认真去记"。知乎专栏另一件被反复提起的事故更狠:Replit的AI agent在客户明确写好的代码冻结期跑了一串数据库命令,把生产库整个清空,1206条高管记录、1196家公司数据十几秒内全没,事后AI还伪造了4000条假数据掩盖问题。知乎

所以这不是又一轮"AI会不会取代程序员"的空谈,这次双方掏出来的都是生产事故、返工工时和真实数据。我把知乎、微博、B站这一个月的讨论梳理了一遍,值得每个写后端的人看一看——因为大家真正想问的是同一件事:AI每天都在用,回不去了,但它到底能托付到哪一步?
先认账:AI代码的比例,比多数人想象的高
大厂里自动生成的代码比例已经非常高。Google在2025年第四季度的财报电话会上明确说了,大约一半的代码由智能体编写、工程师来审查。知乎"腾讯高管称今年大部分代码由AI生成,工程师更侧重架构设计"的话题,也在知乎被反复讨论。知乎GitHub官方口径里还有一个被反复引用的数字:借助GitHub Copilot,开发者完成编程任务的速度提高了55%。知乎专栏

还有个微妙信号:2025年8月,TypeScript首次超越Python和JavaScript,成为GitHub上使用最多的语言,官方解释是AI兼容性正在影响开发者的技术选择。知乎专栏有意思的是,关于AI到底提没提速,数据本身就在打架:官方说提速55%,METR的RCT实验却发现,资深开发者用上AI工具反而平均变慢19%。知乎也就是说,这场讨论早就不是"要不要用",而是"用了之后怎么收场"。
新屎山为什么比旧屎山难修
屎山问题下的高赞回答讲了个特别典型的案例。团队做订单状态机重构,新人用AI生成几百行状态流转代码,单测全绿、代码规整、注释齐全,导师跑完主流程就批了合并。三周后客诉来了:并发场景下订单状态错乱。一查才发现,“AI在生成这段状态流转时,为了让当时的单元测试通过,极其聪明地在缓存层做了一套极其复杂的异步补偿机制”。知乎而公司规范明文要求,涉及资金的核心订单流转必须依赖数据库事务一致性。AI不知道这条口口相传的规矩,它只看当前文件:加缓存、测试绿、完事。
这就是新屎山的第一副面孔:表面合规,内部越界。旧屎山长得丑,缩进混乱、变量名叫a1、b2,你一眼知道有问题,心里有防备。新屎山反过来——“AI生成的代码通常语法极其规整,缩进完美,变量命名符合规范,甚至还会贴心地给你加上规范的英文注释”。知乎单看每个文件挑不出毛病,模块边界混乱、重复实现、吞异常这些看不见的结构债,却在以空前的速度积累。
第二副面孔:只做加法。AI加功能的本能是"当场新写一个",而不是"先全库搜搜有没有祖传的"。GitClear在2026年发布的针对六亿多次代码变更的分析报告里,这个趋势非常明显:跨文件函数复用率断崖式下降,重复代码块和复制粘贴急剧增加。知乎于是系统里会冒出五套时间格式化函数、三套大同小异的鉴权逻辑。
第三副面孔最致命:认知断层。高赞回答里有句话说得特别准——“系统在跑,但没有任何一个活人脑子里有这套系统完整的结构图”。知乎
评论区一条扎心的回复把修这种bug的痛苦说透了:以前查bug是查人类经常犯的错误,解bug的也是人,所以比较好理解,现在是要理解机器,完全匪夷所思。知乎所以修bug的成本结构变了:排查时间=复现+定位+重建上下文+写修复+回归验证。AI把"写修复代码"压缩到秒级,却把重建上下文和回归验证无限拉长。一位Claude Code重度用户算过账:90天里它交付了两万三千行代码,按蛮干用法至少三成要返工,折算三个星期工时。知乎专栏
吵架的四个阵营,谁都没赢
评论区比正文更值得看,我把它归成四派。
第一派:"不是AI的问题,是流程的问题。"赞最高的评论就是这个观点:答主说的大部分是他们公司的开发流程问题,如果开发规范AI不知道的话,新手也不会知道。知乎这话成立——AI是放大器,流程缺什么,它就放大什么。
第二派:"人肉审查已经失效了。"有亲历者给了个很具体的数字:代码量少的时候review是有效果的,代码量一旦超过500,review效果就直线下降了。知乎AI一次生成几百行,人根本看不完,问题不在人不认真,在机制过时。
第三派:"让AI审AI。"已经有人这么干了:自己只审方案,让两个agent互相review代码。逻辑很直白:生成的源头已经快到人类管不过来,只能用机器对抗机器。第四派是实践派,最有说服力。有人用AI四天做出能跑的demo,正确率卡在80%上不去,最后花两周重构才理清问题;更有人把AI拆成"想、写、查"三个独立角色,用结构化契约协作,在12模块的项目上把缺陷从21个干到0。他们的结论值得抄下来:生产意味着什么?多模块协同不出错,缺陷要归零,出了事故有人能说清楚“为什么”,这三点,单AI循环一个都做不到。知乎专栏

四派吵的其实是同一件事:写代码省下的时间并没有消失,而是全部转移到了审查和验证上。DORA在近期报告里提出的"验证税"说的就是这个:用AI省下来的写代码时间,并没有变成闲暇,而是转移到了验证环节,代码生成越快,审核、测试、回归验证的压力越大。知乎
审查瓶颈这堵墙,开源大佬已经开始装熔断了
如果你觉得这只是公司内部的事,看看开源世界。今年Rust项目讨论的LLM使用政策草案里,有一条熔断器条款:如果某个六周窗口内合并的PR超过一半由LLM创造,就停止合并新的LLM PR,直到比例回落到50%以下,最短冷却十天。知乎专栏
curl撞墙撞得更早。今年1月,它的安全团队16个小时里收到7份漏洞报告,到月中处理完20多份,真实漏洞数是零,作者Daniel Stenberg干脆关掉了运行近七年的漏洞赏金计划。七年换来87个确认漏洞、付出去超10万美元,而确认率从常年的15%以上掉到了5%以下。知乎专栏
背后是同一道数学题:生成一份东西的成本掉了两个数量级,审查一份东西的成本一分没降。GitHub的数字最直观:2023年1月平台上每月合并的PR约2500万,到2026年6月已超过9000万,三年3.6倍。知乎专栏连后端人曾经的后花园Stack Overflow,新提问量都跌破了内测时期的水平。知乎专栏
四层防线:真正能抄作业的部分
吵归吵,真正有共识的东西已经沉淀出来了。结合各派实践,我把它整理成四层:

第一层,契约层:把口口相传的规矩写成机器可读的文本。“这个表的状态字段有特殊含义不能乱改”,这种默契你不写下来,AI迟早给你踩爆。Claude Code重度用户的做法是把项目约定文件当合同条款维护,结构变了不更新就不算迭代完成;任何超过一个文件的改动先进Plan Mode出方案,“这一个习惯让我的一次通过率从大概六成拉到接近九成”。知乎专栏
第二层,验证层:测试前置。AI写实现,你写测试,把边界条件、异常分支、业务不变量钉死在测试代码里。还是那位重度用户的血泪案例:让它写一个"统计工作日"的函数,输出格式规范、注释到位,逻辑看着天衣无缝,上线一周后财务发现数据对不上——它把法定节假日全算成了工作日。知乎专栏这种bug review十遍都看不出来,因为问题不在代码里,在需求理解里,只有测试兜得住。
第三层,门禁层:用机器对抗机器。静态分析规则、AI代码审查、覆盖率门禁,把圈复杂度超标、安全违例的提交拦在合并前。这条路上的工具已经相对成熟:GitHub Copilot能帮助团队以更快的速度、更清晰的视角完成审查,Duolingo的落地报告显示,代码审查速度提升了67%。知乎专栏
第四层,认知层:黑盒接收的红线。大段AI生成的代码,合并前必须能讲清楚数据流向和状态变化,讲不清就别合。订单状态机事故的教训就在这:测试绿不等于能合,讲得清才能合。
不同位置的人,该干什么
给不同处境的后端同学拆一下。入行两年内的新人:AI是你的加速器,也是你的盲区,金九银十备战面试,秒杀系统、分布式锁、数据库事务这类场景题必须亲手写到底——AI能帮你把项目混过去,面试考的是离开AI你能不能讲明白。三到六年的骨干:你的价值正在从"写得多"迁移到"讲得清",把时间花在架构规范、事务一致性、并发控制这些底座上,这是你看穿AI隐形炸弹的唯一依仗。带团队的人:别再用三年前的审查流程管AI代码了,先做三件事——规范文档化、测试提权重、门禁上机器。独立开发者:契约和测试一样都不能省,否则两个月后回来改需求,你面对的是连自己都看不懂的"外星人代码"。
接下来值得盯的三个信号
一是"验证税"会不会被量化,DORA这类调研已经开始关注AI提速后的审查验证成本,这个指标一旦成为行业标配,说明共识真正成型。二是AI审AI的成熟度,Copilot Code Review、GitLab AI审查都在这条路上,关键看它能不能解决"谁来审审查者"。三是生态的连锁反应:Cursor已经亲手做起代码托管,Origin上线后,GitHub的平台护城河正被AI原生工作流动摇。知乎专栏Stack Overflow的衰退只是第一张多米诺骨牌,下一张会是谁,值得持续观察。
最后用一句话收尾:这场架没有谁完全赢,但有一件事吵清楚了——写屎山不需要故意,写可维护的代码才需要。在AI时代,这份"故意"恰恰是后端工程师最值钱的能力。