张大妈

Claude千Agent并行能干嘛?5大高频提效场景全盘点

源自28位全网作者

12:17

10月10日,Anthropic 把动态多智能体工作流(Dynamic Workflows)推进公开测试:主 agent 写计划,计划再拆给多个 agent 分阶段跑、最后合并结果,官方在 11.6 万行的真实代码库里做了对比测试,证明这种编排能扛住最庞大的工作负载,多 Agent 正式从「演示概念」走向「生产级工具」。 千人规模是这次公测最扎眼的部分:服务器按阶段最多拉 1000 个 agent、同时约 64 路并行干活再汇总,计划从对话挪进代码,主会话还能继续跟你聊。知乎微博

千Agent并行到底能干嘛?一句话回答:它擅长的不是一千个 Claude 同时陪你聊天,而是拆得开、验得回、算得起账的批量工作。五个高频场景各带着可核实的数字,账单、权限和交付责任的闸口也一并讲清。

千Agent并行的门道:模型自己写「工头脚本」

这项能力不是凭空出现。5 月 28 日,Anthropic 就给 Claude Code 上过「动态工作流」的研究预览版:你用大白话说一句想干的活,模型自己写出一段 JavaScript 编排脚本,由脚本调度一群分身后台并行跑,最多 16 个分身同时跑,单次任务最多能拉起一千个。 人要做的只剩两头:描述想要什么,和最后验收;中间的排班交给脚本。微博

这套脚本真正的关键在于「记性」:整个计划、每个分身干到一半的中间结果,全存在脚本的变量里,不占主对话那颗「脑子」,几千行过程噪音不进上下文,分身规模才值得往上堆。 和更早的 Agent Teams 相比,差别可以一句话分清:Agent Teams 是人告诉 Claude「怎么分工」,Dynamic Workflow 是 Claude 自己决定「怎么分工」。微博知乎

场景一|11.6 万行代码捉虫:工作流抓到 66 个,单 agent 只有 14~27

第一个场景就是这次官方压测本身:在 11.6 万行代码里埋 70 个 bug,单个 agent 一次抓到 14~27 个,动态工作流三次都抓到 66 个。 这组数字说明的不是单个 agent 变强了,而是「扫得全」:一个模型会被上下文和注意力卡住,一千个各看代码一角、最后统一合并结论,大代码库审计、依赖扫描、遗留系统排雷是它最标准的用法。微博

场景二|跨语言大迁移:75 万行代码,11 天合入主干

第二个场景是整仓搬家式的重构。最常被引用的案例来自 Bun 项目:作者 Jarred Sumner 用动态工作流把整个运行环境从 Zig 迁到了 Rust,约 75 万行代码,从第一个 commit 到合入主干只花 11 天,原有测试 99.8% 照样通过。 冷水也要同时泼:这是研究预览期发生的个案,社区对 AI 一口气生成这么多代码靠不靠谱的争论并没有结束。它的价值是把规模上限量了出来,不是保证任何迁移都能照抄。微博

场景三|深度调研:105 个 agent,75 个在互相验证

第三个场景是调研和信息收集。有开发者实测 Claude Code 的 /deep-research,一次典型调用共产生 105 个 agent,其中 75 个用于验证环节。 绝大多数分身不是在找资料,而是在互查:搜索、阅读、总结、验证各由专职角色完成,一个 agent 不碰第二道工序。小红书

冗余的代价同样清楚:token 账单会疯狂增长,一晚上 5000 元以上是常事。 调研类任务里,省下的时间和烧掉的钱是同步放大的,先设预算再开闸是唯一稳妥的顺序。小红书

场景四|流水线后台迭代:两周合并 3000+ 个变更,自述零客户可见事故

第四个场景是把研发流水线放进后台跑。Anthropic 自家的 claude.dev 工程博客给了一个样本:团队在两周内把 claude.ai 提速约 3 倍,四条核心旅程共 13 项测量在 p75 口径下几何平均提速约 3 倍;工作方式是一个 Claude 在频道里找瓶颈、建基准、提 PR、上线后读数据,人只负责设目标和审批每一次变更。 同一来源的厂商自述里还有一组数字:两周合并 3000+ 个变更,未出现客户可见事故——高频变更能跑的前提,是每一步可回滚、可追溯。公测的设计也服务这个用法:主会话不阻塞,你继续和 Claude 说话,重构、测试、PR 在后台自己完成。知乎

场景五|长周期科研筛选:950 个智能体跑 21 小时,翻出一套新酶系统

第五个场景是长时间、可批量筛选的科研任务。Anthropic 在 9 月 23 日宣布成立生命科学研究团队及自有分子生物学实验室,并公布首项成果:约 950 个 Claude 智能体在 21 小时内消耗约 2.1 亿 token,从超过 20 万个逆转录酶里筛出约 3500 个候选,标记出一种此前未被表征的酶系统——阵列关联逆转录酶(ART),其基因旁带有类似 CRISPR 的等间距 DNA 重复阵列;Anthropic 称这可能构成一种新的基因编辑机制,但相关预印本尚待同行评审。 另一条独立整理对规模和分工的口径完全一致:动用约 950 个 Claude Agent、消耗约 2.1 亿 token、持续 21 小时完成候选筛选,人类负责给出初始 prompt 与后续实验验证。 这给的是「大规模并发生产候选、人类只守关键闸门」的完整样本——也标出了边界:批量产出候选,不等于结论已经被验证。知乎知乎

真正的卖点不是千人上限,是账单、权限和交付三道闸

账单是第一道闸。公测用户整理的计费口径是:run 本身没有单独价格,按模型 token 计费,session 另加 0.08 美元每小时且只要还在跑就一直计费;官方口径也更直接:multi-agent 大概比聊天贵好几倍到十几倍,session budget 要在创建时就设死。 这些数字属于公测转述,具体定价以官方账单页为准——但不设预算就开闸,等于把刷卡机交给 agent。微博

第二道闸是权限。分身默认会直接动手修改文件,不是只给你看看建议。 上百个分身各改一处之前,仓库的版本控制和回滚是必须先行配置的底座。微博

第三道闸是并行之下的交付责任。有团队用 20 条完全合成的售后工单做过对照运行:三个 agent 共享可写工作区、协议没约定写入边界和验收责任时,一次运行记录到 4 次重复工作、2 个重叠写入目标和 5 次有效产物后的覆盖变更;改成执行 agent 唯一写入、分析与验收保持只读后,三项指标全部归零。 作者特别注明这是合成数据上的单一案例,不能外推成所有多 Agent 任务都会提速——但谁能改文件、谁确认结果仍然合格、谁做最终交接,确实是千人规模开闸前必须回答的问题。知乎

回看选题之问:千 Agent 并行擅长捉虫、搬家、做调研、跑迭代、筛实验,不擅长说不清拆法、写不出验收标准、算不起账单的活。10 月 10 日这场公测没有让模型本身变强,它做的是把指挥一千个分身的第一次完整编排权,写进了模型自己生成的程序里——接下来值得盯的,是谁能先把预算闸门、写入边界和验收责任配齐,把这场「千人军团」变成自己账本上划算的生产线。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章