可观测性AI大战开打:Datadog一次调查收费25美元,这个'AI值班员'值得买吗?

源自31位全网作者

10:00

凌晨两点被告警叫醒,你的第一反应大概率还是:打开大盘、翻日志、对时间线。但今年 8 月,可观测性厂商们集体想把这一步提前——在你睁开眼之前,AI 已经把第一轮排查做完,把带证据的结论推到你手机上。

8 月 10 日,InfoQ 用一篇报道给这件事定了调:可观测性厂商的 AI 大战开始,Grafana、Datadog、Splunk 全部入场。知乎注意,这不是发布会上的概念:Datadog 的 AI 排查 Agent「Bits」已经正式 GA 商用,还改了个更克制的名字叫 Bits Investigation。知乎

Grafana 13.1 的版本说明里,「Grafana Assistant 扩展」被列为头部亮点。知乎Splunk 被思科收编后,也在把 AI Triage Agent 往安全运维场景里推。知乎

问题来了:AIOps 喊了十几年都没真正普及,这次凭什么值得当真?以及更实在的——这玩意儿用起来,要花多少钱?

可观测性AI大战开打:Datadog一次调查收费25美元,这个'AI值班员'值得买吗?

这次集体入场,和以前的 AIOps 故事不一样

AIOps 当年没跑通,卡在三件事上:数据散在各套系统里串不起来,模型给结论却解释不了过程,用得越多越没人信。早在 2016 年 Gartner 提出 AIOps 之后,各大厂商便陆续推出智能告警、异常检测、根因分析等产品,但直到今天,真正能在企业里稳定落地的场景依然有限。知乎

这两年大模型把「可解释性」这一条补上了——它能用工程师听得懂的话把推理过程讲出来;OpenTelemetry 又把 Metrics、Logs、Traces 统一到一套标准上,AI 第一次能看到「同一件事」的完整上下文。知乎

但真正让厂商集体冲进来的,是商业信号:Datadog 已经把 AI 调查做成了独立计费项。排障能单独收钱,排障就不再是平台的附赠功能,而是一条新产品线。这边刚验证完有人买单,那边 Grafana 和 Splunk 自然坐不住。

三家卖的其实是三种东西,先分清再谈值不值

同样是「AI 排障」,实际上分三个层级,含金量完全不同。

第一层,问答助手:帮你写查询语句、总结日志、解释报错。Grafana Assistant 目前的重心更偏这一层,最近又在推 watchers 自动化工作流,想往「自动处理」方向走,好用,但现阶段省的主要还是敲键盘的时间,不是半夜起床的时间。

可观测性AI大战开打:Datadog一次调查收费25美元,这个'AI值班员'值得买吗?

第二层,自动调查:告警一响,Agent 自动开工,几分钟后给出带证据引用的调查结论。Datadog 的 Bits Investigation 是这一层的代表,官方说在超过 2000 个客户环境里测试过、累计跑过数万次调查。知乎

第三层,自动修复闭环:查完直接生成修复代码、开 PR、盯着 CI 迭代。Datadog 的 Dev Agent 已经在 Error Tracking 场景 GA,「观测→调查→修复→验证」的链路雏形已经出来了。

Bits 的技术路线值得多说一句,因为它踩过大家都想踩的坑。早期版本也是「把所有数据一股脑丢给大模型总结」:一次 Kafka 消费延迟的排查里,Agent 跨日志、链路、指标发了 12 次工具调用,结果全塞给模型——输入 token 爆炸不说,模型还被那些「看起来可疑但和根因无关」的信号带偏了。知乎

后来改成假设树架构:先形成多个假设,再用有针对性的查询逐个验证或推翻,有证据的分支深挖,没证据的直接剪枝,一次调查大概 3 到 4 分钟收敛。知乎

可观测性AI大战开打:Datadog一次调查收费25美元,这个'AI值班员'值得买吗?

还有个容易被忽略的功能:bits.md。你可以把团队自己的排障知识写进这个 Markdown 文件,Agent 调查时会参考——说白了就是 SRE 版的 CLAUDE.md知乎好处是排障知识可版本化、可评审、可继承;代价也很直接,这些知识沉淀在谁家平台,你就被锚在谁家平台。

国内厂商也在跟:观测云上线了 AI Agent 可观测平台,把会话、Trace、模型调用和风险事件放进同一个视角分析。观测云阿里云今年夏天把「LLM 应用监控」升级成了「AI Agent 可观测」并推出 AgentLoop 平台;腾讯云 CLS 则用 5-Agent 架构喊出「故障定位从 30 分钟降到秒级」。知乎国内叙事的重心明显不在功能本身,而在合规和数据不出境。

可观测性AI大战开打:Datadog一次调查收费25美元,这个'AI值班员'值得买吗?

算一笔账:一次调查 25 到 30 美元,账单会自己长

这是全文最该认真看的一段。Bits Investigation 走 Datadog 的 AI Credits 计费:调查不出结论不收钱;年付每月 500 美元含 20 次结论性调查,月付每月 600 美元,折算下来一次大约 25 到 30 美元。知乎

单次看不贵,但账单会跟着告警量长。按一个中等规模微服务环境的常见水位算:一天 30 个告警,开启自动调查、七成能出结论,一个月就是 600 多次结论性调查,按挂牌价就是每月一万五到一万八美元——一年二十万美元上下,而这还是叠在已有的主机、APM、日志账单之上的新增项。知乎有竞品(Metoro、Better Stack、Groundcover)专门逮着这一点打:告警量恰恰是你最难控制的变量,它直接决定账单,成本根本不可预测。

换回来的是什么?官方口径是故障恢复时间缩短 90% 到 95%,这个数字目前只有厂商自己的测试背书,没有第三方验证。拿它对比一线城市一个轮岗 on-call 工程师的人力成本,这笔账是可能算平的——前提是那些「凌晨两点的第一轮排查」真的被接住了。有意思的是,Datadog 自己的界面上还挂着一行常驻提示:「AI 生成的回答可能不准确,请核实重要信息。」一边宣传九成以上的 MTTR 缩减,一边提醒你别全信,这就是 AI 排障产品现阶段的真实状态。知乎

一线怎么用?社区比厂商 PPT 清醒得多

知乎上一位工程师分享了自己的用法:排障时别急着贴日志,先用三句话说清现象——什么时候开始、改了什么、什么表现,然后让 AI 把原因「从最不可能到最可能」列出来。知乎他靠这个办法查出过一个压根没想到的配置项。他的总结很实在:列出来的原因一半是废话,但你要的本来不是答案,是让它帮你把盲区翻一遍。

另一位搭过排障工作流的工程师说得更直接:AI 只看一段报错就下结论,那不叫排障,叫猜。知乎可用的流程必须沿证据链走——时间线、日志、Trace、监控、发布记录、配置变更、代码 Diff,每个假设都要标注证据强弱和验证方法,止血方案和长期修复必须分开。

还有那个扎心的知乎问题——「AIOps 为什么喊了十几年,直到大模型时代依然没有真正普及?」答案区的结论也很克制:当前大多数团队对 AI 的定位仍然是智能助手,AI 出分析,人按最后的按钮。知乎

把这几条放在一起,你就能理解一个细节:Datadog 把「Bits AI SRE」改名成「Bits Investigation」,不是随手改的——当 Agent 真正进入生产,连厂商自己都开始回避「替代某个岗位」的说法。知乎

值不值得买?按你的处境对号入座

适合认真考虑的:已经是 Datadog 深度用户,告警量大、on-call 轮值痛苦,数据已经用 OpenTelemetry 统一过。你的痛是真的,入口是现成的,边际成本可控。

建议再等等的:小团队一天十几个告警,人看比 AI 便宜;自建 Grafana、SkyWalking 的用户,这波 AI 功能暂时主要在商业版平台里,跟你关系不大;还有日志、链路、监控至今各存各处的团队——AI 只会放大混乱,不会替你治理数据。

决定要开的,先立三条规矩。第一,给预算封顶:按调查次数计费的模式会随告警量失控,先和财务约定月度上限。第二,权限只给只读:查、看、分析都可以,重启、回滚、切流量这类写操作必须人工审批,这是底线不是选项。第三,人保留终审权:AI 交出来的是「带证据的假设列表」,不是判决书。

想低成本试水的,有条现成路线:挑一类高频低危的告警(磁盘水位、证书过期这种),只对它开自动调查,跑两周,把 AI 结论和历史人工排查的命中率、耗时做个对比。数据站得住再扩面,站不住就默默关掉,谁也不丢人。

接下来值得盯的三个信号

一是 bits.md 和调查 API 什么时候 GA。这决定你能不能用自己团队的排障经验去「调教」它,也决定锁定有多深。

二是 Grafana 的 AI 功能怎么收费。Grafana Cloud 用户对「加钱项还是打包送」极其敏感,这一步会直接影响整个市场的定价锚。

三是国内厂商的实际落地案例。阿里云 AgentLoop 从真实 Trace 里自动挖掘经验、再注回 Agent 运行时的思路已经亮出来了,观测云的观测 AI 智能体「带你」也在主打与本地 Coding Agent 协作排障。知乎对有信创和数据出境约束的团队来说,国内路线可能是唯一可选项,值得持续观察。

一句话收尾:这轮 AI 排障大战,卖的不是「替代 on-call」,是「把凌晨告警的第一步提前」。值不值得掏钱,就看一笔账——你愿意为告警量付的账单,和 on-call 工程师的睡眠,哪个更贵。先算清楚,再开钱包。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章