10月9日,Anthropic 把 Claude Managed Agents 的动态多智能体工作流推进公开测试:一个主智能体先写计划,再把活拆给多个智能体分阶段跑、最后合并结果,官方称能扛住最庞大的工作负载。 公告里最抓眼球的数字,是单次运行的调度上限:1000 个智能体。 但上限不等于用量目标——Anthropic 在文档里的建议恰好相反:先拿一个范围小的任务试跑,验证效果后再逐步加大复杂度。知乎小红书
这个功能真正的卖点不是能开多大的数字,而是结果的稳定性。官方给过一组对比数据:在一个 11.6 万行的真实代码库里埋 70 个 bug,单个智能体跑三次分别找到 14、15、27 个,波动很大;用工作流跑三次,每次都找到 66 个。 换句话说,动态工作流的价值是把"有时很好、有时很糟"变成可复现的结果——这才是值得为重度负载打开它的理由。小红书
什么样的活才配开工作流
这类编排的体感可以看一个现场演示:丢进去 300 份合同,要求找出带控制权变更条款的,Claude 先写一段调度程序,多个智能体同时读,再交给复查智能体核对,最后交回的答案是41 份命中。 需要说明,这是 AI 博主的二次演示,命中数本身不代表官方口径;真正代表官方立场的是文档里列的任务形态——审计大代码库、批量迁移代码、一次读几百份合同、调研时交叉核对多个来源,全是能拆成很多块、块与块互不依赖的活。官方举的合同审查例子说得直白:一两份合同让智能体自己看就够了,多了才开工作流并行读。反过来,工作对象少、环节间有强依赖、或者中间结果要一路带着上下文走的任务,硬拆给一大批智能体只会同时抬高成本和错误放大面。微博
跑一次要花的钱,账单大概长什么样
Anthropic 没给现成的价目示例,但成本可以按牌价透明地算。Claude Managed Agents 的消耗本质仍是 API token:当前官网牌价为 Opus 5 每百万 token 输入 5 美元、输出 25 美元,Sonnet 5 为 3/15 美元,Haiku 4.5 为 1/5 美元。做一个可复核的假设:每个子智能体读任务说明加分到的材料约 1 万输入 token,汇报约 1 千输出 token——真实数字随材料体量浮动,合同审查这类任务通常只会更高。按这个口径,不同规模的单次运行成本如下:
子智能体数量 | Opus 5 | Sonnet 5 | Haiku 4.5 |
|---|---|---|---|
50 | 约 3.8 美元 | 约 2.3 美元 | 约 0.8 美元 |
100 | 约 7.5 美元 | 约 4.5 美元 | 约 1.5 美元 |
500 | 约 37.5 美元 | 约 22.5 美元 | 约 7.5 美元 |
1000 | 约 75 美元 | 约 45 美元 | 约 15 美元 |
按此推算,50 到 100 个智能体的小批量试跑落在几美元的量级,这是验证期多数人该待的档位;把单次运行推到 1000 个,Opus 档约 75 美元,若子智能体全部改用预建的 Haiku 则约 15 美元。省钱的另一个结构性因素是提示缓存:如果所有子智能体共享同一份指令前缀,且前缀逐字节一致、达到模型的最小可缓存长度(Opus 5 为 512 token),输入侧可按约一折牌价计费,Opus 场景的总价有机会从 75 美元压到 30 美元上下。这是估算而非官方报价——真实账单取决于每份材料的 token 数和缓存命中率,上线前应当用 count_tokens 对代表性任务实测。
比上限更要紧的三个坑
会话预算只能在创建时设置。 文档建议在创建会话时设一个会话预算,花到上限工作流会自动暂停、调高额度后继续——但这个额度事后加不上。等于说封顶数字必须在开跑前定好,而不是等账单失控了再找刹车。
子智能体默认和主智能体用同一个模型。 工作流里临时定义的智能体继承主智能体的模型档位,想把轻量子任务交给更便宜的模型,必须提前单独创建这些智能体并列进配置。否则"Opus 主智能体加几百个 Opus 子智能体"就是最贵的那组组合,上面测算里 75 美元和 15 美元的差距就出在这一步。
整个功能仍在公测,口径随时可能变。 动态工作流是 2026 年 10 月 9 日才进入公开测试的能力,入口是在智能体配置里把 multiagent 类型设为 multiagent_20261001(该类型下工作流默认开启),然后直接让 Claude 跑一个工作流,拆计划、派活、汇总都由它完成。公测版本的调度上限、默认行为和计费细则都可能调整,对成本敏感的团队应先用小样本锁定验证,再逐步放大。
能扛最重的负载是真的,账单按智能体个数线性放大也是真的。正确的顺序不是把数字推向 1000,而是先用几十份材料验证它比单个智能体稳定在哪,再决定要不要踩下这个油门。