当前位置:
AIGC文章详情

监控大盘全绿,Agent却骂上热搜:89%的团队装了可观测,近三成从来没做过评估

源自177位全网作者

08:59

凌晨,某公司的客服Agent把用户的退款请求理解成了产品咨询,给人家回了一大段功能介绍。用户截图发微博当天就上了热搜。知乎

复盘的时候,一屋子人都在骂模型蠢,但根因根本不在模型:Agent在处理第47轮对话时,拿的是三小时前的工具返回结果当最新数据用,而退款接口的返回结构前一周刚改过一次、多了层嵌套,参数校验没拦住。知乎模型换了两代,这个bug活了三个月没人发现。

最讽刺的是,事发当天,监控大盘上所有指标都是绿的。

这不是孤例。LangChain针对1300多名专业人士做了一项调查,结果很割裂:57%的受访者已经在生产环境运行智能体,接近89%的受访者已经为智能体部署了可观测性,看上去一片向好。知乎

但再看另一组数字:52.4%的受访者只做离线评估,37.3%做在线评估,还有29.5%表示完全没有做评估。知乎

与此同时,32%的受访者把质量问题列为部署到生产环境的最大障碍。知乎

翻译一下:大多数团队已经能回答"Agent做了什么",但近三成团队从来没回答过"它做得好不好"。他们装的不是可观测性,是更贵一点的结构化日志。

钱也在往这个方向涌。据Business Research Company估算,LLM可观测性平台市场规模2026年为26.9亿美元,预计2030年增至92.6亿美元,年复合增长率36.2%;Gartner预测,到2028年,LLM可观测性投入将覆盖50%的生成式AI部署,而2026年初这一比例只有15%。知乎

原因不复杂:LLM应用的出错方式,和传统软件根本不一样。同一个提示词,可能得到不同的输出,检索步骤可能返回错误文档,但每个HTTP状态码仍然都是200,一个智能体可能连续调用14次工具,消耗数千个Token,最后却自信满满地给出错误答案。知乎

延迟、错误率、可用性,这些传统指标捕捉不到这类"语义层"故障:编造的政策、逐渐跑偏的语气、听起来很确定的错误答案。开头那个客服Agent就是典型——接口正常、延迟正常、无报错,只是答案是错的。

美团图灵Agent评测团队把两年的实践总结成一句话:观测+评测=持续迭代。知乎

他们的判断是,Agent评测的对象已经不再是单一模型,而是一个"模型+系统+工具+流程"的复杂系统,评测正在从"答案评测"走向"行为评测"。知乎

那一条完整的Agent执行轨迹长什么样?它不是一条线性日志,而是一棵嵌套的树:主Agent调用子Agent,子Agent再调用子Agent,每一次模型调用、每一次工具调用都是树上的一个节点,各自带着Token数和耗时。只有记到这个颗粒度,后面的评估层才有数据可评。

监控大盘全绿,Agent却骂上热搜:89%的团队装了可观测,近三成从来没做过评估

看到这里,很多团队的第一反应是先设计一套完备的评测指标体系。美团的结论恰恰相反:起步阶段"让数据飞轮高效运转起来"的意义远大于"设计一个复杂精妙的评测体系"。知乎评测体系不是一蹴而就的,是靠Good Case和Bad Case喂养出来的,而Bad Case的价值往往更高,因为它最容易暴露能力边界和系统短板。

拆成能动手的动作,一共四步。

第一步:从今天开始攒Bad Case。不需要多,用户投诉过的那几十条回答、你自己看不下去的那几条回答,就是回归集的第一批资产。有从业者说得非常狠:没有评测集的Agent上线,等于你不知道它明天会比今天好还是差。知乎

按他们的观察,离线评测集、在线A/B、实时监控告警这三件套,能凑齐的团队不超过两成;大部分团队的状态是上线靠感觉、迭代靠玄学、出事靠用户投诉。知乎

第二步:把模糊指标拆成"是不是"的判断题。"这个回答口语化吗?打个0到10分"是经典的坏示范——他们判断,评测真正难的不是没有人会评,而是不同的人评得不一样,机器和人评得也不一样。知乎

美团的做法是,把模糊指标下钻成更细的评测Rubric,再把每个Rubric尽可能二元化——从"主观的模糊感受"转向"可判断的事实依据"。知乎

效果立竿见影:Beam用这套方案改造评测体系后,人机一致率从62%提升到92%。知乎

第三步:装一个"AI裁判",让它抽查生产流量。也就是LLM-as-Judge:让一个大模型当裁判,读Agent的输出轨迹并打分。Langfuse等平台已经内置这套能力,但真正上过生产的人替你踩过坑:裁判的prompt必须"先说理由,再打分",否则同一条trace跑两次,分数能差出0.3。知乎

裁判的角色定义也要窄:“AI评审专家"是个什么都能评的空帽子,“意图识别评估专家"才是真正的岗位;分数区间的语义同样要写清楚,不然今天0.8算"好”、下周0.8变"还行”,标准漂移到你没法做趋势对比。知乎

监控大盘全绿,Agent却骂上热搜:89%的团队装了可观测,近三成从来没做过评估

第四步:先算成本账,再开在线评估开关。"每进来一条新trace就自动打分"这个开关听着美好,无脑全开是真烧钱。一份实测:日均3000条trace全量打分,用混元当裁判,一个月下来模型侧成本多了200多块。知乎

监控大盘全绿,Agent却骂上热搜:89%的团队装了可观测,近三成从来没做过评估

省钱的办法不复杂:只对模型生成的那一层打分,不对工具调用、检索这些中间步骤打分——光这一条就能砍掉60%以上的成本,再叠加10%采样,日均3000条trace一天大概1.5-2块token钱。知乎用作者的原话说:比招个实习生review便宜100倍,比完全不知道Agent在干嘛强1000倍。

评估跑起来之后,它给你的信号会超出预期,其中三个最容易被忽略。

监控大盘全绿,Agent却骂上热搜:89%的团队装了可观测,近三成从来没做过评估

信号一:长期0分的trace,未必是Agent的bug。上面那份实测里,上线第三周发现有6%的trace长期0分,查下来是产品同学新加了一个意图类别、训练数据还没补,落到这类的用户输入全被识别成了"其他"。知乎评分数据不只反映Agent质量,也反映产品定义是否稳定——这种时候该催的不是改prompt,是产品同学补数据。

信号二:0.5分的"半对"样本,比0分更值得盯。0.5分对应的不是"中等质量",而是"差不多对、但有偏差"——模型选了个相邻意图,或者在多轮对话里跟丢了上下文。知乎这个比例一周涨5%就是该查的信号:上面那个案例追下去,发现是用户在多轮里改了主意、Agent没意识到,暴露出prompt里缺一段"意图重置"逻辑。

信号三:你终于能用一个数字回答"变好了还是变坏了"。改完prompt、升级完模型,重跑一遍历史trace,对比前后分数变化再发版,这是最直接的改进证据。没有这一步,每次迭代都是赌博。

如果你还没做任何评估,不用恐慌性采购全家桶。最小起步是三样东西:一个Bad Case集(20条就够)、一道二元化的判断题、一个抽样裁判。半天能搭完,从此你手里有了一把尺子。

有两个信号值得持续盯着。一个是OpenTelemetry的GenAI语义约定:这套gen_ai.*属性已经被Google Cloud、AWS、Azure、Datadog等平台采用,GitHub Copilot、Claude Code、Codex这些编程Agent也开始按这套标准暴露遥测数据。知乎现在埋点就按这个标准来,将来换后端不用重新埋点。

另一个是市场节奏。一个年增36.2%的市场,意味着工具会快速成熟、价格会快速下探,等一等大概率更便宜;但事故的成本不等人。

链路回答的是"发生了什么",评估回答的是"做得好不好"。只做了前一半的你,装的不是可观测性,是录音机。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章