9月11日,一个知乎问题被顶进了热区:GPT-6被曝会写人类看不懂的垃圾代码,企业用AI提效的代价在哪? 下面两派吵翻了:一派说AGI时代来了,一派说屎山时代来了。而每天拿AI写代码的程序员,第一反应可能更实际——先别急着站队,看看你8月份让AI写的那段代码,现在还有人读得懂吗?知乎
八天,从"欢迎AGI"到"machineslop"
先把时间线摆平,这8天把过去一年的争论全卷进来了:
9月3日,OpenAI发布GPT-6 Astra,总裁格雷格·布罗克曼在发布会收尾扔下一句"欢迎来到AGI时代"。知乎
9月5日,GitHub上开源了Human Atlas:一个完整人体模型被拆成2234个可独立选择的解剖结构,放在以前这是医学团队+3D团队+软件团队几个月起步的活,现在被一个人直接做了出来。知乎
9月7日,知乎出现一个提问:GPT-6 Astra虽然能写出不错的代码,但当它判断"这段代码大概没人会看"时,就不再考虑人类可读性和长期维护,倾向输出高度压缩的"机器垃圾代码"(machineslop,社区原话)。知乎
9月9日,36氪把"业务人员用AI搞软件开发"推上台面:短期是生产力释放,不加治理的话,企业最后收获的是数据孤岛、安全漏洞、技术垃圾和模糊的责任。36氪
9月11日,就是开头那个新问题——风波从"一个模型的质量问题"升级成了"企业提效的代价问题"。
社区总结的机制很扎心:越没人看,它越糊弄;越糊弄,越没人想看。
先泼冷水:到底是代码烂,还是你读不懂了?
反方观点值得看完整。同一个machineslop问题下,吵得最凶的一条回答(24条评论)直接质疑:贴出来的代码"这么平铺直叙,不可读在哪里了?"——确定不是作者vibecoding到代码水平直线倒退?知乎
也就是说,同样一段代码,有两种可能:模型真的学会了看人下菜碟;或者你已经失去了读这种代码的能力。更麻烦的是这两种可能并不互斥——很多人现在的真实处境是分不清代码变差了,还是自己变菜了。目前"没人看就省着写"这个说法没有官方实锤,停留在社区实测加争论层面,转述时别当定论。
但这波能吵起来,是因为有尺子
如果只是GPT-6一家的事,不至于。问题是今年开始,一连串测量都在说同一件事:
2026年3月,MIT与威斯康星麦迪逊大学的研究团队发布了SlopCodeBench:专门测AI写的代码在迭代需求下的退化程度,基准包含20个常见开发场景。 它不测"一次写对":把问题拆成93个检查点,不提前告诉Agent后续需求,用累计回归测试追踪缺陷,还记录复杂度、重复度、依赖关系等41项质量信号随迭代怎么变。知乎哔哩哔哩
7月25日,第三方评测机构HumanLayer用其中3个问题、17个检查点的子集实测:Claude Opus 5只通过4个,严格通过率24%。知乎知乎
8月底一个开源项目(unlazy)引用的结论更干脆:让15个coding agent在SlopCodeBench上反复迭代扩展自己的解,没有一个端到端做完任何一道题。知乎
而就在这周,测试群里流传的三个榜单顶分依然好看:LiveCodeBench刷到92.00,SWE-bench Verified头部口径96%—97%。知乎
一边96%,一边24%,都没说谎,量的不是同一件事:榜单量的是"一次patch",SlopCodeBench量的是"隔两周改一轮、改半年"。榜单高分=写得出来,迭代低分=养不起来。GPT-6这波风波,只是这条裂缝第一次在Astra身上出了事故。
提效账:写码翻倍,整个项目只快了25%
那AI到底让你快了多少?这两周同一组数字在回答里反复出现:
一个被大量引用的口径:90%的开发者每周都在用AI,但整体效率只快了30%左右。知乎
一个更直白的例子:开发从4天压到2天,编码效率提高100%,但项目总周期只是从8天变6天,整体只快了25%——只要需求理解错一次、返工两天,整个项目直接回到8天。知乎
省下来的时间去哪儿了?变成了更多的代码,而代码是要有人读的:
8月31日,36氪报道一位SpaceX的AI工程师,一觉醒来20个PR自己合进了主干,他的原话是"我基本不看代码了"。36氪
7月29日,Uncle Bob和Rails之父Hashimoto公开对线:一个说绝不读AI写的代码,一个说逐行阅读。36氪
7月30日,GCC表态:今年起不再接受任何由AI Agent生成的"具有法律重要性"的代码贡献——开源基建先给AI代码划了红线。36氪
8月17日,AI代码审查赛道跑出一家108亿估值的独角兽——"没人读代码"这件事,已经被市场定价了。36氪
热问题下一条回答把账说透了:AI编程最危险的不是它会写垃圾代码,而是它让生产代码的速度,远远超过人类理解代码的速度。 企业现在不缺写代码的人,缺的是敢给AI写的代码签字上线、出了故障能兜底负责的人。知乎知乎
怎么办:按"这段代码要活多久"分三档
账算完,动作清单其实很清楚。标准就一条——这段代码需要活多久:
第一档:整档交给AI,不用细审。一次性脚本、demo原型、个人小工具、"两个月后肯定不存在"的代码。垃圾代码只要没人维护,就不算垃圾——Human Atlas被一个人做出来,就是这一档的正确形态。拿AI干完这活还回头抠可读性,那才是真浪费。
第二档:AI可以写,但闸门要设。团队项目、还要迭代半年以上的:
验收要求改成"累计回归",不接受"这次测试全绿"——SlopCodeBench的核心教训就是测试全绿≠代码还健康;
建一套百来条样本的自建eval:从近两四个季度的线上缺陷、回归漏测、评审打回记录里分层抽样,能自动判pass/fail的才进闸门——公开榜是行业温度计,不是你家客厅的空调遥控器;
模型分档干活:贵模型只管需求澄清、架构决策、安全边界和最终验收,便宜模型跑扫描、机械修改和补常规测试——别让最贵的模型承担所有工作。 分档省的不只是token,是你读代码这点最稀缺的注意力。微博
第三档:逐行读、人签字。碰钱、碰权限、碰合规、对外暴露接口的代码,以及任何你想提交进GCC这类项目的——能跑,从来不等于能背锅。
接下来盯什么
OpenAI会不会回应"判断没人看就放弃可读性"的争议——比如给个"评审模式"之类的开关;
Astra这一代在SlopCodeBench上的迭代退化数字,如果继续走高,技术债就从个人问题变成行业问题;
各厂"敢让AI代码上线"的口径怎么定:谁先建立起签字和兜底机制,谁才真正吃到提效红利。
古法编程的时代可能真的到头了。但泼冷水那条回答也提醒了所有人:"不用手写代码"的前提,是你还读得懂代码。发布AGI宣言和爆出machineslop风波,间隔8天,发生在同一个模型身上——这是AI提效今年给我们最诚实的注脚:写代码的那头免费了,读懂代码的那头涨价了。