这两周,关注 AI 工程化的人都会觉得有点不对劲。知乎上「Agent 目前最大的瓶颈是什么?」讨论得火热,连「研究生搞 agent 还有搞头吗」的评论区,都开始有人逐条拆解 AI 量产的职业指导文;腾讯云 ADP 连续更新,把「评测」直接放进了 AgentOps 的核心;B 站上「一口气讲清 AI 工程化三代演进」的视频播放量已经几千。而做了几年 MLOps 的朋友开始慌:LLMOps 还没整明白,AgentOps 就来了,我干的这行是不是要被淘汰了?
先说结论:MLOps 没死,但这门技能正在被重新定价。有的技能能平移,有的在明显升值,有的在悄悄贬值,还有的「学习路径」根本别碰。今天把这笔账算清楚。
三代演进,管的根本不是一回事
很多文章把 MLOps、LLMOps、AgentOps 讲成「概念升级」,其实一句话就能讲清:管的对象变了。
MLOps 管的是「一个模型」。当年的痛点是模型在实验室表现好、一上线就崩:数据漂移、训练推理不一致、版本混乱。于是从 DevOps 借来 CI/CD,把训练、部署、监控串成流水线,跑「训练—部署—监控—再训练」的闭环。

LLMOps 管的是「一次调用」。大模型火起来之后,很多团队不再自己训模型,而是调 API,问题变成了:怎么判断一次提示词修改是变好还是变差、怎么管 RAG 的检索质量、怎么控制成本和幻觉。AgentOps 管的则是「一次任务」——Agent 会读数据库、发邮件、调工具,一个任务跑几十步,任何一步跑偏都可能级联放大,要管的就是整条执行轨迹。有知乎专栏总结得很准:可以看到,三者并非简单的替代关系,而是关注层级在不断上升:从「一个模型」到「一次调用」,再到「一次任务」。知乎每往上升一层,系统的自由度越大,工程治理的复杂度也就越高。
打个比方:MLOps 像维护一台自动售货机,只要保证每瓶掉出来的饮料都正常;AgentOps 像带一个会跑腿的实习生,你得盯着他走了哪些门、花了谁的钱、有没有卡死在循环里、最后到底办没办成事。这套演进也不是纸上谈兵,已经成为视频里的常见选题:B 站有 UP 主做了「AI 工程化三代演进」专题,把问题直接摆到台面上——MLOps、LLMOps、GenAIOps 分别在管什么?为什么大模型时代不能只靠传统MLOps?哔哩哔哩这条视频已有 4780 播放、133 收藏,说明确实有人在认真补课。
这波行情,是真的还是炒的?
什么值得买的习惯:先看证据,再下判断。把知乎、B 站、微博、招聘和企业产品页的信号交叉核对之后,可以分成真实信号和噪音两类。
真实信号一:岗位市场在真金白银定价。知乎科技博主引述 Business Insider 的报道:Forward Deployed Engineer 岗位在一年内增长 729%,从 2025 年 4 月的 643 个职位增加到 2026 年 4 月的 5330 个职位。知乎比数字更重要的是 JD 的用词变了:Neuron7 明确要求 distributed tracing、trajectory evaluation、cost-per-goal optimization,Google Cloud 的 GenAI 岗位把细粒度追踪、cost-per-request、state management 写进要求——都是非常具体的工程词汇,不是泛泛的「懂 AI」。
真实信号二:钱在涌进工具生态。LLM 可观测性平台市场规模在 2026 年为 26.9 亿美元,高于 2025 年的 19.7 亿美元,到 2030 年预计达到 92.6 亿美元,预测期年复合增长率为 36.2%;Gartner 预测到 2028 年,LLM 可观测性投入将覆盖 50% 的生成式 AI 部署。知乎主流平台也被拉出来逐项对比,Langfuse、LangSmith、Braintrust、Arize 们的比较维度,都集中在追踪深度、评估能力和生产监控上。

真实信号三:企业端开始动真格。当 Agent 进入生产环境,评测就从「开发习惯」变成了正式工程问题:腾讯云 ADP 4.0 将效果评测作为 AgentOps 的重要组成部分。知乎腾讯云官方则直接把 ADP 定位为「以AgentOps为核心的企业原生智能体平台」,端到端支撑企业 Agent 全生命周期。腾讯云
真实信号四:社区痛点对得上。「Agent 目前最大的瓶颈」讨论里,认同度最高的不是模型不够聪明,而是工程复杂度:一到真实业务,链路拉到二十步,状态空间爆炸,误差累积,结果不可复现。知乎这恰恰是技能升值的反向证明——正因为落地难,能让系统「可观测、可评估、可治理」的人才值钱。组织层面的传言也已经出现:关于「支付宝体验技术部被拆分、员工统一切换为 Agent 开发全栈工程师」的知乎问题下,有回答说这类消息已经在技术圈里刷了屏。知乎注意,这是网传消息、未经官方证实,只能说明大家对组织重构的焦虑和预期有多高。
噪音同样明显,一共三类。
第一类,证书营销。微博上流传「大模型应用工程师证书,考之前先看这7条」的推广帖,帖子自己都承认:「坑②:被各种证书晃花眼政企国企认工信部教考中心,外企认NVIDIA/AWS,通用市场认人社部」。微博证书连认谁都没统一,冲上去交钱,更像是为信息差焦虑买单。
第二类,平台崇拜降温。知乎出现「为啥coze和dify这种llmops没热度了,是不是没必要部署了?」的提问,播放量很高的回答上来就说:我经常看到有人在纠结:应该学LangChain还是Dify?n8n和Coze有什么区别?这些问题本身没有通用答案。知乎工具选型吵架降温,说明需求已经沉到「评测、观测、治理」的工程层,而不是停留在「用哪个框架」。
第三类,AI 量产的职业鸡汤。知乎一条热门回答的评论区,有人逐条拆作者的量产痕迹:第一,产量和篇幅不符合普通人工写作节奏。账号共有 226 个回答;加载到的近期约 60 篇,从 2026 年 6 月初一直密集发布到 7 月上旬。知乎这类模板文往往以「MLOps 已死」「必须全员转 Agent」的强硬结论开头,看到绝对化判断,不妨先打七折。
技能账:哪些升值,哪些贬值,哪些平移
这是本文的主体,分四种情况说。
第一种:平移即可,别丢。MLOps 的三件套——流水线、监控、成本——在 Agent 时代没有失效,只是换了对象:CI/CD 变成提示词、工具配置、Agent 版本的发布管道;监控从「模型指标漂移」升级为轨迹级追踪,哪一步跑偏、调了哪个工具、烧了多少 token 都要能回放;成本管理从训练资源变成按请求、按目标的成本核算。做过 MLOps 平台的工程师,转这些岗位基本零门槛。
第二种:明确升值,越早补越好。方向一:任务级评测。Agent 的评估不能只看最后一句回答,要定义「这个任务算不算办成了」,这是目前最稀缺的能力。方向二:治理与审批。企业 agent 不可能所有动作都自动执行,比如发给客户的邮件、退款、合同修改、CRM 重要字段更新、高风险建议,这些都需要设置审批门槛。知乎

方向三:可观测标准化。OpenTelemetry GenAI 语义约定为模型调用、Token 使用、智能体步骤和工具执行定义了与供应商无关的 gen_ai.* span 属性,Google Cloud、AWS、Azure、Datadog 等平台已经采用。知乎2026 年再看工具,OTel 兼容性应该当成硬性要求,而不是可有可无的加分项。
第三种:悄悄贬值,但没归零。手工特征工程、单任务调参、「训一个模型吃三年」的工作方式,溢价确实在收缩。但容易忽略的是另一面:在责任重的垂直领域,MLOps 反而建得更重——互联自动驾驶方向已经出现了面向车队集体学习的五层 MLOps 架构,用来做多级自我评估和边缘情况检测。知乎贬值的是「通用模型看护」,不是「行业模型工程」;越是垂直、越是出错代价大,传统功底越稳。

第四种:想转进来的人,补这三块。后端/DevOps 背景转型,要补的是轨迹追踪(分布式追踪、轨迹回放)、工具与参数治理(白名单、参数校验、沙箱执行)、任务级评测三块。学生党冲秋招,别从背框架名词开始——JD 的用词已经很具体(distributed tracing、trajectory evaluation、cost-per-goal optimization),拿一个开源项目把「评测—回归—发布」闭环跑通,比任何证书都有说服力。
避坑清单:这三种东西别碰
没有统一认可度的证书。连证书推广帖都承认各家认证各认各的;证书是敲门砖,但企业现在高薪买的是能解决具体问题的工程能力。
「21 天精通提示词+低代码编排」的速成营。真正升值的是评测、追踪、治理、成本工程,没有一项能靠拖拽画布教出来。
宣称「MLOps 已死」「必须全员转 Agent」的绝对化文章。社区已经有人在逐条拆这类模板文,结论的强度应该和证据的强度匹配。
不同的人,不同的走法
MLOps 老手(3-7 年经验):别转行,升级。把流水线和监控经验延伸到 Agent 轨迹与评测,补半年的回报远大于从零开始。
后端/DevOps 工程师:你们离 Agent 工程最近——追踪、状态管理、成本控制、细粒度权限,都是现有技能树的延伸,一年暴涨 729% 的 FDE 岗位本质就是冲这类背景来的。
算法研究员:评测是当前最稀缺的方向,定义「什么算任务完成」的价值,不低于多刷两个点精度。
学生/秋招党:围绕 JD 关键词做项目——分布式追踪、轨迹评估、按目标优化成本,做出一个能演示的完整闭环,胜过一摞证书。
值得继续盯的三个信号
信号一:标准在谁手里定型。整体上,该领域正处于「标准尚未定型、工具快速迭代」的早期阶段。知乎OTel GenAI 语义约定的推进节奏、主流厂商接口的收敛方向,会决定未来三年的技能要求。
信号二:平台市场的分化。目前的市场大致分成四类:AI 原生可观测平台、开源评估库与平台、AI 网关、APM 扩展,先看清它们各自站在哪里,比逐项罗列功能更重要。知乎

信号三:组织重构是否成为常态。FDE 岗位暴涨和大厂 Agent 团队调整的传闻,说明这不是工具层面的风潮,而是分工重构;各大厂是否普遍设立独立的 Agent 平台团队,会是判断这波行情是否落地的重要标志。
最后一句
别被代际名词吓到。工程领域从来不为概念定价,只为问题定价:谁能把 AI 系统变得可观测、可评估、可治理、可控成本,谁的技能就在升值。这笔账未必精确到每一个数字,但方向不会差太多——值得收藏,一年后再回来对照,看看兑现了多少。