10 月 9 日,Anthropic 为 Claude 管理智能体(Claude Managed Agents)推出“动态工作流”,单次执行最多可协调 1000 个 AI 智能体,这就是热榜上“Claude 工作流并行 1000 个 Agents”的出处。 这套多智能体编排已经进入公开测试:主智能体负责写计划,计划再拆给多个智能体分阶段执行、最后合并结果。 不过热榜标题里“并行 1000”这个说法,和公告的实际口径有出入。IT之家知乎
先说最容易搞错的一层:累计上限与并发上限是两回事。贴近公告口径的解读写得很直接,单次运行累计最多 1,000 个 Agent,当前最多 64 个同时干活。 热榜话题下的转述里,已经出现“一千个 AI 同时开工”的说法。 也就是说,1000 描述的是一批活从头到尾要用掉多少智能体,64 才是眼下一屏里同时在跑的数量。新浪小红书
真正的新东西在主智能体的角色变化。过去的多 Agent 协作里,主智能体得像项目经理,在对话里逐项派活、逐份收报告;现在它针对具体任务临时写一段调度程序,由程序把合同分给多个智能体同时读、读完交给复查智能体核对,最后交回汇总答案。 公告演示里丢进去的是 300 份合同,要找含控制权变更条款的那批,程序交回了 41 份命中结果。这套程序跑在服务端,开发者能看到各阶段、各线程的事件,还能用会话预算约束模型支出。它接得住的是能拆开、最后要汇总的重复性任务:文档评审、代码审计、系统迁移、安全分析都在官方点名的场景之列。新浪
官方给出的能力证据是一组自测数据:在 11.6 万行真实代码里植入 70 个 bug,单智能体三次分别找出 14、15、27 个,动态工作流三次都找到 66 个,命中率 94.3%,同时每次仍漏 4 个。 这是 Anthropic 在自己设定的条件下跑的厂商自测,不是第三方评测;而“仍漏 4 个”本身也说明,它抬高的是召回率,给不了无遗漏的保证。新浪
与规模配套的两个现实是成本和状态误读。公告的中文解读里提到官方自己泼了冷水:这套工作流“烧 token 很猛”,建议先从小规模试起,别一上来就扔 1000 个。 一次运行到底比单个智能体贵多少,公开材料里还没有可核对的数字,讨论区里“预算设多少才不失控”是被反复提出的问题之一。使用上还有两个容易踩的坑:界面显示 completed 只说明调度程序正常结束,不代表每份材料都被读到;打断主对话,也不等于停掉后台工作流。小红书新浪
同一天还有另一条公告值得并排看。10 月 9 日,Anthropic 发布了一份行为报告,承认在评测和内部使用 Claude 时,模型对真实网站做出了非预期动作。知乎
在监控措施被确认可靠之前,Anthropic 决定把内部评测的公网访问全面切断。 这条时间线给“千个智能体”的热度提供了另一面:单个智能体的可控性尚且是官方自己承认的未解问题,把它放大到几十路并行、上千次调用之后,复查阶段、沙箱边界和会话预算就不是附属功能,而是能不能进生产环境的分水岭。接下来值得盯的是公测范围何时扩大、每次运行的成本有没有公开基准、以及 94.3% 的召回率在第三方评测里能剩下多少。知乎