Anthropic 已经为 Claude Managed Agents 开放动态工作流(Dynamic Workflows)公测:主 Agent 自己写一段调度程序,服务器按阶段拉起一批 Agent 并行干活再汇总结果,单次运行累计最多 1000 个、当前同时约 64 个。 官方在 11.6 万行真实代码库里的对比测试证明,这种编排能扛住最重的工作负载——多 Agent 协作第一次从演示概念变成生产级工具。 但对行业的重塑未必发生在「千人军团」的标题里,更可能发生在三道闸门上:成本、可靠性和协作质量。微博知乎
项目经理不再挨个派活:排班表写进了代码
以前跑多 Agent,主 Agent 得在对话里一份份收报告、再派下一项任务,对话本身就是编排的瓶颈;现在这活交给程序,主 Agent 可以腾出手继续回答你。 流程也不是写死的流水线:复查通过就汇总,没通过就重读相关材料再复查,轮到上限仍有分歧就直接报告未解决的问题。每个 Agent 的对话历史互相独立,但读的是同一个沙箱里的文件——各记各的笔记,共用同一间办公室。微博
先拆解「1000」:它是累计上限,不是并发
1000 指的是一次运行累计可以拉起多少个 Agent,当前并发约 64 个线程,两者相差一个数量级,读标题时最好先分清。 编排方式换成程序驱动后的收益,在官方对比测试里很直观:11.6 万行代码植入 70 个 bug,单个 Agent 三次找出 14、15、27 个,动态工作流三次都是 66 个,每次仍漏 4 个。 官方的演示场景同样强调「可拆分、最后要汇总」:丢给 Claude 300 份合同,让它找出带「控制权变更条款」的,程序先把合同分给多个 Agent 同时读,再交复查 Agent 核对,最后给出 41 份命中。批量合同筛查、多模块代码排查这类任务,才是这套编排的舒适区。微博微博
第一道闸门是账单:没有单次运行费,只有越跑越快的燃烧
Dynamic Workflows 的 run 本身不单独计价,按模型 token 收费,session 另加每小时 0.08 美元,且只要程序在跑就一直计时;官方自己说过,multi-agent 的花费大概是普通聊天的几倍到十几倍,所以 session 预算必须在创建时就设死——不设预算的千人调度,等于把刷卡机交给一段自己运行的程序。 Anthropic 也已在价格端回应大客户此前的「账单焦虑」,9 月初发布的 Fable 5.1 把缓存读取成本降了 75%,高度 Agent 化的重活最多便宜 45%。微博36氪
背景是两大客户刚刚收紧过钱包:微软在 Claude 上超 10 亿美元的内部预算被砍掉三分之一以上,Meta 内部使用 Claude Code 的人数从约 6 万降到约 3 万,最近 28 天仍花掉超过 1.05 亿美元。 越好用、越烧钱,这道闸门不会因为调度上限抬高而变松。36氪
行业重排的另一面:对手把 Claude 接进去,买家同时在砍预算
执行层正在被公开争夺。谷歌新发布的 Gemini Agent 可根据任务自动选择底层模型,候选池里就包括 Claude,谷歌把这套能力称为「多模型编排」并配了自动路由。 这个选择带着数字:按谷歌自己公布的评测,旗舰模型 Argon 在 Terminal-Bench 4.0 上只拿了 57.4%,Claude Opus 5.5 却有 66.4%;马斯克也宣布 Grok Bot 今后按任务选择最合适的模型,名单里同样有 Claude。 一边是竞品把 Claude 接进自家 Agent,一边是最大客户为成本往外撤,这两股方向相反的力,恰好画出了「重塑」的真实战场:比的不再只是谁的模型最强,而是谁的编排层和计费模式能被企业接受。36氪知乎
1000 是调度规模的天花板,不是协作质量的天花板
重塑判断的另一半来自实验室。多智能体协作基准 AgentWorld 评测了四个主模型,最好的团队在主任务集上也只完成了 52.0%。36氪
消息量也换不来协作:一组模型平均每任务发 44.1 条消息、成功率 36%,另一组只发 11.0 条反而做到 52%;失败集中在交接处——重复提问、认错交接对象、关键步骤没完成就宣布收工。 需要说清口径:这类基准测的是「平权对话式协作」,与 Dynamic Workflows 的程序驱动主从编排不是同一种设置,52% 不能直接拿来反驳 66/70 的自测;但两者放在一起,恰好标出行业现状——调度规模和编排结构已经落地,Agent 之间的协作质量还是未解题。36氪
当模型能力趋同、价格战从国内烧到海外,这次公测把 Agent 竞赛从「谁的模型强」推进到「谁能把一千个 Agent 组织起来、定价清楚、跑得可信」。公测能不能走出演示期,可以看三个具体信号:企业设好 session 预算后的单任务成本曲线、工作流在官方测试之外的第三方代码库上的增益,以及谷歌、Grok 们接进来的编排接口会不会长成事实标准。