知乎上周有个回答被顶得很高:“一张进度表,以前我自己看两遍就过。现在AI先给我出一版分析,我得逐条核它说得对不对。核完一轮,时间没省下,脑子先累了。”
这不是个例。小红书搜"AI提效"按最新排,一周内前20条里有4条在说同一件事——活儿没少、人更累;有帖子的原话是公司上了AI工具后"下班前要多花一小时检查AI的输出";有人让AI跑了一半的方案,“扫一眼觉得方向不太对,但说不上哪不对,想让它重来又怕更偏,干脆自己上手改了”。10月8日一条微软员工的吐槽被顶了89条评论:如果AI没让我涨工资,反而让我工作更累,还让电子产品变贵了,那AI存在的意义是什么。知乎小红书
把这几天的帖子、研究和评测拼起来看,一个此前被"省时间"叙事盖住的东西浮出来了:用AI之后,你并没有少干活,你只是换了工种——从执行者换成了审核员。而这个审核岗,目前没有SOP。

先说三个硬数据,它们拼在一起才完整
第一个:波士顿咨询今年3月发在《哈佛商业评论》上的研究,给这症状起了名字——“AI脑疲劳”(AI brain fry)。样本是1488名美国全职员工,14%明确报告了这种疲劳。 注意边界:不是14%的人都废了,而是集中出现在"重度监督AI"的人群——那些一天要盯AI交很多次活的人。研究给的机制也很直白:过度监督AI工具,已经超出了人的认知极限。干活累的是身,盯AI累的是"随时准备抓错"的那根弦。知乎
第二个:9月中旬开始,技术圈在传一个新出的长任务智能体评测,讲清楚了弦为什么必须绷着。108件真实白领工作,熟练的人平均干1.6小时,AI平均要操作三百多步才做完。结果是最强的系统完整做对22件,20.6%;同一批系统在"点几下就完事"的短任务上成绩是八成以上。平均完成度54.8%——大半的活它真干了,就是收不了尾。而所有数字里最刺眼的一个:这些AI花在"检查自己做错没有"上的力气,不到7%,剩下九成多全在往前冲。它不回头看,所以错了也不知道,一路错到底。小红书
里面还有一道值得每个用AI干活的人记住的算术:就算单步做对概率有99%,连乘318步,全对只剩4.1%;提到99.9%才能回到72.7%。差0.9个百分点,结果差18倍。你的AI初稿翻车,多数不是模型变笨,是活变长了。小红书
第三个:斯坦福HAI的新研究,把"累"从个人问题还原成了配置问题。2023年全球55%的组织报告自己在用AI,两年后涨到88%——普及曲线和疲劳投诉是同一条曲线。研究者在一家律所做了近两年的对照观察:两个业务、人数、薪酬结构几乎一样的部门,拿到同一款AI工具,唯一的区别是管理者怎么介绍它。一个部门听到的是"帮你更快起草、缩短周转",律师助理用完觉得自己"只是机器上的又一个齿轮",没人试新功能;另一个部门听到的是"哪些活最无聊?让AI替你干掉,腾时间做更有意思的事",结果使用频率高出58%,尝试新用法多出70%。 同一个工具,引入方式不同,一个变齿轮,一个变外挂。知乎
为什么"检查AI"比"自己干"更耗人
把三个数据放一起,机制就出来了。
你自己干活时,思考和执行是同一条流水线——写到哪、错在哪、哪里没把握,你身体里有数,检查是"顺便"的。AI干活时,执行跟你无关了,你只剩一个纯监督动作:在一段你没有参与的产出里,找回丢失的上下文,判断它错在哪一步。评测那边算过一笔实账:一件96分钟的活,按54.8%的完成度折算,AI确实替你干掉了53分钟——但你接手之前得先搞清楚它干到哪了、哪几步歪了,这段时间不在任何评测报表里。省下的53分钟,很可能被这笔"上手税"吃回去,这就是"教程说省2小时、评论区说更忙"同时成立的原因。
再叠一层AI的"防御性写作":小红书最近也有帖子在吐槽,让AI分析数据、写文档,“写出来的东西大而全,没有重点,废话还多”。AI天然倾向于把话说得确定、完整,“可能受影响"会被写成"将导致”。通顺是它最强的地方,也是你最容易放下戒心的地方——读起来越顺的材料,漏检率越高。
把"检查"拆成四只手,别一双手全自己扛
社区里自救的方法已经卷起来了:9月11日小红书一条"10个复核提示词,能挡住90%的返工"拿了281个收藏,把AI交付前该查的事列了10类——幻觉编造引用、把推测写成事实、漏项、数字单位口径、前后矛盾、建议不可落地、合规隐私、受众错位、专有名词称谓、引用时效。 收藏率远高于点赞,说明这个需求是真的饿。小红书
但这10类其实不该都由你查。按"谁最擅长查"分一下手:
交给AI复查的:机械一致性。漏项核对(对照任务要求逐条打勾)、分项加总等于总计、前后章节口径矛盾、复述验收标准。这正好补上AI自己不肯花的那7%——你不问它"做完了吗"(它一定说做完了),而是给它一张核对清单让它逐条过。
交给搜索/原文的:来源核验。数据、法条号、标准号、人名职务、政策时效。幻觉引用查无实据,AI自己验自己是验不出来的,必须拿外部源对。
只有你能查的:判断类。受众错不错位(你把推演过程写了十页、领导要的结论在最后一页)、称谓抬头、合规边界。这三样错一次就报废整份材料,且AI越顺你越看不出来——这半小时不能省。
前置的:别让活跑到318步。评测给出的五个补丁里最值钱的一条其实发生在生成之前:把长活拆成短活,一次只让它干一件"能验收"的事,验收标准写在最前面。拆一段、核一段,你的上手税就按段付,不用一次还本付息。

什么人值得把检查流程改了,什么人先别动
按"错的代价"分三档就够用:
要对外、要签字的(报上去的方案、发出去的邮件、含数字的汇报):数字全核、来源全核、称谓受众人工核,AI只做一致性。这一档不省时间,省的是事故。
内部流转的初稿(脑暴、框架、会议纪要、长文打底):抽核。看头尾和中间各抽一段,重点看"它替你补的案例和引用还在不在原位"——AI编的东西往往长得很专业。
纯给自己看的(学习摘要、资料清洗):直接吃54.8%,错了再问。这一档才是AI提效的真甜区。
另外给带团队的提个醒:斯坦福研究里最扎心的一条是,有些公司开始按员工token消耗量、生成文本量考核"AI使用度"——“用得多"不等于"有价值”,只会逼人生成猫咪表情包凑配额。 你团队里那个"用AI更累了"的人,很可能不是不会用,是他在替全公司当质检员,而这部分工作量从没进过任何报表。知乎

接下来盯什么
一是各家的Agent长任务评测数据——“完成度54.8%”"自查不到7%"这类数字如果下个版本明显抬升,说明托管边界真的在移动,你可以把第二档范围往第一档推;二是办公套件往"交前自验"方向做的功能(现在谁把"自检清单"做成默认流程,谁才是真的在降你的审核税);三是社区里"复核提示词"的迭代,那是同行用返工换来的免费功课。
最后对个账:这件96分钟的活,AI替你干掉53分钟,剩下的检查你只用了不到20分钟,那今天就是真赚。AI当实习生用,效率是真高;当成能托管的员工用,返工成本会全额回到你身上。你让AI干过最长的一件活是什么,它干到哪一步歪的?评论区晒一下你的翻车节点,比看一百篇教程都管用。