AI把每天的告警从80条降到11条,但运维的手开始生了:效率翻3倍背后藏着的三笔账

源自228位全网作者

09:15

先说一张很好看的效率表。一个团队把AI接入运维半年后,晒出了这样的数据:接入前,5个运维,月均处理问题127个,每单平均38分钟;接入后,4个运维加AI Agent,月均处理工单143个,每单平均14分钟。领导盯着这张表看了30秒,问了一句:工作量没减少,效率翻了快3倍,是不是不需要这么多人了。知乎这个问题,几乎每个接入AI的团队都被问过。

告警侧的变化更直观:推送从每天80多条降到8到11条,凌晨误扰从每月15次降到0,值班响应时间从5.2分钟缩到42秒。知乎同一份复盘里,诊断准确率也从人工的约60%提到了85%以上。

评论区都在讨论"运维会不会被淘汰"。但我反复读了几遍,真正让我停下来的,是作者顺带提到的一句话——

作者说:值班人的排查肌肉记忆在退化,以前闭着眼都能describe pod然后grep OOM,现在大脑自动跳过了这一步。知乎这句话,比任何效率数据都刺眼。

同一篇复盘里还提到:运维不再亲自摸集群了,有些角落再也不去了;领导甚至开始怀疑,是不是有人把告警屏蔽了。这三句话,都没写进那张效率报表。今天就聊聊这笔被藏起来的账。

AI把每天的告警从80条降到11条,但运维的手开始生了:效率翻3倍背后藏着的三笔账

AI接走的,确实全是重复劳动

先把真实的部分说清楚。最近AI运维的真实落地不少,拉三个出来看。

第一个就是前面这个团队。作者统计过三个月的工单:380多个问题里,63%是"Pod又Pending了"“帮看个日志”"这个服务怎么又重启了"这类重复问题,每次要花15到45分钟,累计每周烧掉40多个小时——相当于团队里有一个人,全职在回答已经回答过一百遍的问题。知乎

第二个是古茗。全国上万家门店跑在100多个数据库实例上,DBA团队只有几个人,70%的时间耗在"接警—登跳板机—看Process List—Kill慢SQL"的循环里。去年下半年他们引入了Agent:一次大促,订单库CPU突然飙高,以前从收到告警到处理完最快也要十几分钟,这次Agent几分钟定位完、DBA一键执行,前后不到5分钟搞定;DDL审批时间也平均下降了30%到40%。极客公园

第三个是一位"养了AI一个月"的运维。AI每10分钟巡检一次15个生产集群,攒下97项技能。某天凌晨3点47分,P0告警:数据库节点磁盘快满了。他没起床。3点57分,AI捕获告警,早上醒来时根因已经查完——是凌晨3点到8点的备份作业把使用率顶过了红线,AI还顺手做了趋势预测:两周内常态超限,明早还会再触发。知乎

AI把每天的告警从80条降到11条,但运维的手开始生了:效率翻3倍背后藏着的三笔账

三个案例放在一起,AI咬住的方向高度一致:巡检、告警分诊、翻日志、拉证据、回答重复的问题。就像知乎一个高赞回答说的那样——“AI可以接管的,都是重复劳动”。

这部分值得鼓掌。但账在后面。

第一笔账:判断力是靠重复劳动喂出来的,现在饲料没了

"排查肌肉记忆在退化"这句话,不是个体的矫情。它在自动化研究里有个几十年前就起好的名字:自动化讽刺(ironies of automation)。

核心是一个悖论:自动化系统越可靠,操作者动手的机会就越少;而系统越可靠,剩下那些真正出事的稀有时刻,反而越依赖人来兜底——偏偏这时候,人的手已经生了。航空业跟这个问题缠斗了几十年:常年依赖自动驾驶的飞行员,手动飞行能力会退化,并且真的发生过自动系统异常后飞行员处置失误的案例。

翻译成运维的语言:你判断"这个告警要不要半夜起来处理"的能力,不是天生的,是被几百次假告警和真告警喂出来的。现在AI把告警过滤到每天11条,你的样本量没了,判断力失去了训练场。

诊断准确率从60%到85%很好看,但提升的是AI的准确率,不是你的。知乎你每天做的是"看一眼结论靠不靠谱"。一位干了十几年的SRE描述过这种工作模式:AI把同时间窗的曲线、带trace_id的日志、调用链证据几分钟摆出来后,人主要看结论靠不靠谱。知乎问题是,这恰恰是最高阶的能力,也是最吃经验储备的能力:长期不碰集群,哪天AI判断错了,你真的能看出来吗?

那个问题下有条评论一针见血:有时候错了可能直接就没了,没有重新跑的机会。知乎

第二笔账:盲区漂移——AI不巡检的地方,再也没人去了

那份半年报里有个容易被忽略的数据:自动巡检覆盖率100%,还发现了4个人工巡检从未注意过的隐藏问题。这说明,AI确实能照到人漏掉的角落。

但反过来同样成立:当AI的巡检范围就是你视野的全部,AI不巡检的地方,就永远不再被看见。证书过期、conntrack打满这些被自动化覆盖了,可那条没人说得清来历的遗留配置、那个只在大促触发的灰度路径、那台三年没人碰过的老服务器——没人去看,也没有人再提醒你去看。

AI把每天的告警从80条降到11条,但运维的手开始生了:效率翻3倍背后藏着的三笔账

养AI那位还提过一个细节,听起来像顺带说的,其实很扎心:他给AI整理知识库时才发现,团队十几年的隐性经验,一直存在老员工脑子里,从来没有被记录过。知乎反过来想:这些经验没进知识库,AI知不知道它们存在?老员工离职之后,还有没有人知道,这些盲区存在过?

第三笔账:签字,正在变成走形式

这是最难听、但最需要说的一笔。

所有落地案例划出的边界几乎一致:只读检查随便跑,变更操作必须人来批。古茗的运维负责人说得更直白:过分相信AI也会出问题,等磨合几年之后可以逐步放权到80%到90%,但现在还不是时候。极客公园但这里有个悖论:人工审批,前提是人有能力审。当值班人的肌肉记忆在退化、排查开始依赖看报告,这个签字,实际上正在变成走形式——你在批准一个你无法独立验证的结论。那位十几年经验的SRE也划了同样的线:发版变更、对外事故通报、真要进生产环境操作,必须有人批,机器可以帮忙查,不能替人签字。知乎线是划住了,但签字的能力却在流失。看看评论区那几条高赞,句句问的都是这件事:“ai能背锅吗”“那出了问题谁担责啊”,还有人留下一句"ai埋雷可就真没救了"。知乎AI不承担责任,签字栏里写的还是人的名字,而这个名字背后识别风险的能力,正在悄悄下降——这是整张效率表里,最结构性的一笔风险。

怎么办:三个案例其实已经把答案写出来了

有意思的是,做得越成功的案例,越保守。把三个案例里的动作提炼一下,都是可以抄的。

第一,分层放权,别急着撒手。古茗的原则是十四个字:先标准化,再自动化;先划好边界,再放开权限。极客公园低风险操作让Agent直接执行,高风险的人做判断、Agent做执行,Agent接数据库要过一层网关,所有操作按会话可追溯。养AI那位更简单,三档:只读检查随便跑,变更先出方案再人工批准,密钥永远不进聊天记录。

AI把每天的告警从80条降到11条,但运维的手开始生了:效率翻3倍背后藏着的三笔账

第二,给"保手热"留训练场。航空业的做法值得抄:定期让飞行员练手动飞行,不是不信任自动驾驶,而是保住它失效时的接管能力。翻译成运维:定期安排人工演练,某类告警故意不让AI处理,让值班人从头排一遍;对AI的诊断报告做抽样复核,要求人独立复现证据链。

第三,经验先落纸面,再喂给AI。AI放大的是你已经有的东西;团队经验都在人脑里没落纸面,AI放大的就是糊涂。那位养AI的运维说得最狠:AI是你工程纪律的一面镜子,你糊弄它,它就糊弄你的生产环境。知乎

最后一句:把隐性账单也写进汇报。如果你是在团队里推动AI运维的人,下次向领导汇报,别只放效率表,把这三笔账和你的对策一起放上去。这不是拆自己的台,这恰恰是让领导敢把生产环境交给你的理由。

谁最需要警惕

分三档说。

一线值班人,团队已经接入AI的:从今天起保留一个习惯——AI给结论之前,先给自己30秒判断一下根因可能是什么,再去对报告。这是成本最低的肌肉保养。

团队负责人,效率表很好看的:问自己两个问题——团队上一次完整人工排查一个故障,是什么时候?最近一个月,有几次有人说"AI这个结论好像不对"?两个都答不上来,说明你们已经在签字走形式的区间里了。

还在观望要不要接入的:先别担心被淘汰,先担心AI接入那天,团队里还有没有人,能接得住AI。

方向是回不去了。那位十几年经验的SRE说得干脆,“往回不走了”,这不是PPT炒作。知乎真正决定结局的,不是用不用AI,而是把重复劳动交出去的时候,你有没有保住判断力的训练场。

三个信号可以继续观察:有没有团队开始把"人工演练"写进值班制度;AI诊断工具会不会开始暴露置信度和证据链——只给结论不给证据的工具,是在训练人服从;以及,行业什么时候开始讨论"给AI变更签字的人,需要什么资质"。

你的团队如果已经在用AI运维,评论区聊聊:你上一次从头到尾手动排查一个问题,是什么时候?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章