提交量翻三倍,安全漏洞翻了十倍:给老板报"AI提效数字"前,先看清这个衰减漏斗
这周,知乎上背靠背出现两篇"冷水帖",都戳向同一群人——被老板要求"用AI提效、并且把数字交出来"的那个人。
第一篇出自一位银行研发负责人(9月28日):年初团队全面铺开AI编程工具,推广一个月,代码提交量涨了三倍,日报里全是"AI帮我生成了XX"的捷报。直到季度代码审计找上门:安全漏洞数量是去年同期的十倍——SQL拼接没做参数化、权限校验漏了分支,全是教科书级的常识错误,可AI写代码的时候,它不觉得这些是问题。知乎专栏

第二篇是问题:"AI办公存在’生产力衰减漏斗’,为什么工具单环节提效,放到企业里效果大打折扣?"举的例子就是代码生成:单环节产出提升300%。至于走完评审、测试、上线还剩多少,正是带团队的人睡不着的地方。知乎
第一本账:感觉"变快了"不能作为依据,秒表和体感方向相反
先说证据链最硬的一组。下面这张图来自METR 2025年的随机对照实验:16名平均5年经验的资深开源开发者、246个复杂任务,一半人允许用AI。预测他们能提速,实测用AI的一组平均多花了19%的时间;他们事前预期快24%,做完仍然觉得自己快了20%——体感和秒表方向相反。知乎

另一项丹麦的企业侧研究同样不浪漫:员工报告AI平均只省下2.8%的工作时间,和很多实验室RCT里动辄15%的提升差了一截。研究者的解释很扎心:省下的时间,被"新冒出来的整合与监督任务"部分抵消——审查AI产出,本身就成了一份新工作。知乎

所以,当有人说"我们组快了30%“,先问一句:你计的是"AI写完"还是"人能交付”?生成更快≠完成更快。知乎当天一篇热文的标题就是大实话:“省下十分钟,却多了二十分钟审核”。把复核、返工、解释成本全入账还是正数,才有脸拿去见老板。知乎专栏
第二本账:单环节提速不是提速,链式收益要过瓶颈这一关
BCG的顾问实验给AI能力画过一条"锯齿状边界":在边界内,用AI的顾问多完成12.2%的任务、快25.1%、质量高40%以上;换到特意挑在边界外的任务,用AI的反而正确率低19个百分点。对管理者的含义是:AI提速集中在低判断阈值的环节——规则写得清、错了代价小、上下文都在文档里;越需要拍板判断的环节,增益越不可信。知乎

这也是"基准测试、样板间、员工晒单全在报喜,企业真实报表却很难看"的原因:三类证据的乐观程度根本不在一个口径上。
同一天(9月25日)一位知乎作者点评WorkBuddy产品总裁提出的"技能+专家+助理"三件套,话说得更直白:三件套描述的全是通用能力,而通用能力"你有,我有,竞争对手也有"。真正的差异在AI能不能嵌进你自己那条抄不走的流程:低阈值环节让AI跑满,高阈值环节由人介入,并且把人对个例的判断喂回流程。如果人介入只是"替AI擦屁股",组织就一直堵在人肉瓶颈上。知乎专栏
银行那件事就是全链路教训:提交速度×3,审查速度×1,安全扫描没跟上——下游得到的不是更快交付,是堆积的"看着能用的代码"。斯坦福社交媒体实验室和BetterUp Labs在2025年9月给这类东西起了名字:workslop(AI注水活儿)——写的人省两小时,读的人多两小时,公司实际效率基本持平,账面上却多了一份"AI提效成果"。知乎
第三本账:汇报本身成了目标,数字就开始注水
古德哈特定律正在AI提效汇报里现场演出:一条微博吐槽过BIGO的AI提效自评,员工看到大家填50%-60%,就顺手写了70%-80%,评论区更是一个比一个猛——“那我也不能落后,只能填90%-100%”。考核什么,你就得到什么——考核使用率,你拿到的就只有使用率,离提效最远。微博
钱账也要防注水。微博话题#公司烧不起token了#下有人转述:Uber给5000名工程师开了Claude Code权限,人是用起来了,单人每月AI账单500~2000美元、四个月耗尽全年AI预算。工具铺下去、没人管产出,得到的从来不是提效,是热闹。微博

银行那篇文章还引了一组覆盖50家大型企业的实证:AI辅助开发的代码提交速度是同事的3-4倍,但引入安全漏洞的速度是10倍;AI生成的Java代码(多数银行核心系统的语言)安全通过率只有29%;81%的企业对团队到底怎么用AI、产出了什么,完全没有可见性。这组口径是转引,往上报之前,得自己把原始出处补上。知乎专栏
怎么办:今天就能动手的三件事
换尺子。别看提交量、使用率、单份日报节省——记端到端:需求到上线的周期、一次通过率、AI产出的返工率和复核耗时。做过戴尔、安踏等500强CIO、现在给企业做AI落地陪跑的李宏阳给过起手式:老板那句"要用AI",必须先翻译成"解决哪个业务环节的具体问题",翻译没到位就先别买工具,“买的越多,浪费越多”。他那套零售客户案例是最好的模板:不是"智能化"蓝图,是"经营周报从2人天到2小时"这一个点。知乎
按三层推进(那位银行负责人交完学费后的路径)。第一层,让AI做只读的事:读代码、写文档、生成测试用例,数据不出域、审计无障碍;第二层,非核心地带:内部工具、数据脚本、监控面板,顺便把"审AI代码"的习惯建起来;第三层才碰核心业务,且三个前提缺一不可——私有化或合规部署、生成过程可追溯、安全扫描嵌进流水线。缺一个,不进。知乎专栏
把人的判断喂回流程。每次修正AI产出,把"错在哪"写进模板和检查清单,让下一次AI能接住——今天付的复核成本,才有机会变成明天的折扣。

谁该看这篇
十几人的小团队负责人:别追大叙事,专挑最蠢、最重复、最文档型的环节,做一个"2人天→2小时"的单点。
大厂技术Lead/数字化推动者:你真正的KPI是"工程治理追不追得上产出速度"——提交量×3、审查×1,差距就是风险敞口。
被老板一句"用AI提效"问得不知从哪下手的普通打工人:上面三本账直接转给老板看也行,哪几笔账被混着算了,掏钱的人比干活的人更需要看清。
继续盯三个信号:“生产力衰减漏斗"会不会变成企业AI评估的标准口径;工具侧"AI代码可追溯"能力什么时候变成标配;以及这波WorkBuddy式桌面Agent装机潮之后,下个季度的成绩单怎么交。老板下次问"AI到底提了多少效”,希望你的回答是三个端到端数字,而不是一句"感觉快了"。