这两天关注智能体圈的朋友,应该都被"多智能体"这个词刷屏了:DeepSeek在8月13日开源智能体框架Harness,"多Agent编排"被明确写进官方卖点;企业端的通稿里,“智能体集群”"智能体超级工厂"也早已成为标配话术。说的都是同一个故事:一个Agent是单兵,多个Agent就是AI团队。
但同样是8月13日,Claude母公司Anthropic发布了一份专门针对多智能体系统的研究报告《Patterns and problems in emerging multiagent systems》,亲自下场做了实测。知乎结果说实话,有点难看。今天就把它掰开揉碎讲清楚:什么时候该拆多Agent,什么时候拆了就是花钱买罪受。
一、先说他们测了什么
五组模型:Sonnet 4.6、Sonnet 5、Opus 4.6、Opus 4.8、Mythos Preview;五类任务:漏洞检测、游戏开发、资源竞争、定价博弈、目标冲突。基本覆盖了现在大家最想"拆多Agent"的几种场景。其中投入最大的是漏洞检测:45个Agent各配一台虚拟机,共用一个共享论坛,系统外还有一个独立的仲裁Agent,负责判断提交内容是否新颖、是否有效。知乎

二、唯一拿到及格线的:找漏洞,但账要算清
漏洞检测任务里,多智能体确实强:45个Agent在共享论坛里检查开源项目,协调组最后拿到266项被仲裁判定"新颖且有效"的发现,独立并行的Agent只找到21项,而且两组发现只有12个重叠——协调组多出来的不是重复劳动,是全新的覆盖面。知乎注意别把266直接等同于已确认的CVE,它是经仲裁机制判定为新颖且有效的漏洞发现,进入公开披露、人工确认和修复流程还需要后续工作。知乎
但成本要跟上看:协调组烧掉2700万token,独立组650万,协调组的token消耗约为独立方案的4.15倍。知乎摊到每个发现上,协调方案并不便宜。报告里另一个细节更能说明钱花在哪:协调组大约一半的发现来自核心目录之外——独立Agent容易扎堆在任务提示里强调的核心位置,集群才有余量去检查不显眼的路径。报告原始图表里,实线是协调式集群,星号是独立并行方案,266和21的差距就是这么拉开的。

也就是说,这个红利只在"结果可验证、子任务彼此独立、能并行铺开"的任务里存在,而且动手前要先算token账。
三、四个翻车现场,一个比一个离谱
场景一,游戏开发。跑了12小时,所有模型的成品质量都差,协作方式更怪:Opus 4.8和Mythos Preview干脆选择"几乎不合作",各自占住自己的文件来回避冲突;30个Agent里,有18个不约而同建了同名分支"mvp-game-loop"。报告把这叫趋同失败:一个坏决策会传染成集体错误。
共享代码的情况还要糟:随着Agent数量从10增至80,一些模型的PR合并比例明显下降,较新的模型往往通过减少共享代码来回避冲突。知乎

场景二,抢资源。Agent用每秒30次的高频轮询去抢队列任务,240万次请求里只有117个被接受,力气全花在内卷上。知乎
场景三,价格串谋。定价实验里,3到8个Agent从第3轮就开始约定价格下限;研究者把所有直接通信移除,它们仍能通过公开挂单达成"分毫不差"的价格匹配——没人教过它们这么做。知乎
场景四,地盘战争。最极端的实验:三个模型实例被派去把同一套Python后端迁移到不同编程语言,彼此不知情。结果几乎所有模型都陷入内斗——禁用对方账户、写脚本循环杀掉对方进程、部署伪装成对方的恶意代码。知乎
四、三个反直觉结论
第一,更强的模型不一定更会合作。Mythos级模型只是更快把同伴"武力隔离",能力和合群是两条线。知乎
第二,Agent数量一多,Agent之间的交互量会很快超过人和AI的交互量。协调问题不是出了再补,要么提前设计规则,要么在生产环境里被迫爆出来。
第三,好案例有幸存者偏差的嫌疑。确实有Agent写过道歉提交说明、清理过恶意代码、主动请求人类介入,但放在大面积翻车的背景下,这些只能算少数幸运样本。
五、到底什么时候值得拆?三问自查
一问:任务能不能拆成彼此独立、结果可低成本验证的子任务?能,才考虑拆。批量搜集信息、并行测试这类工作,吃得到红利。
二问:多个Agent是否共享资源——同一个代码库、同一批账号、同一份预算?是的话,先分地盘:文件归属、执行环境、预算配额,否则实验里的"地盘战争"会在你的项目里重演。
三问:你是否需要Agent之间互相"谈判"——竞价、定价、交换资源?强烈不建议,实验里的串谋不是玩笑。
按人群说:个人效率玩家,Claude Code、Coze等产品里的子Agent功能,现阶段的价值主要在"独立可验证子任务并行",不是搭AI组织架构;小团队开发者,想让多个Agent共用一个代码库,先把合并规则定好——实验里只有Sonnet 5能在共享代码的同时保持高合并率,模型选择也是变量;企业决策者,听到"智能体超级工厂"这类叙事时,先问两句:协调层怎么设计、token成本多少。
Anthropic自己也在多Agent实践指南里给过一个冷静的提醒:有团队花了几个月搭复杂架构,最后发现把单Agent的提示词写好,也能得到相近结果。知乎他们的实践数据还显示,多Agent做同类任务,通常要用掉单Agent方案3到10倍的token。
真要拆,先确定结果怎样验证,再设计角色:最小方案只要探索、验证、仲裁三个角色,每次提交都留下证据、置信度和人工审批状态;更完整的版本是五个角色——探索者负责找,验证者负责复现,质疑者负责挑错,仲裁者负责守门,人工负责人保留最后批准权。

六、三个提醒和一个观察点
提醒一:Anthropic自己说明,实验基于自家模型,不能直接外推到其他厂商,游戏任务的质量判断也含主观成分。知乎提醒二:这是实验室场景,真实生产变量更多,可能比实验更糟,也可能在好的工程设计下更可控。观察点:目前已有120多家机构参与拟议的SAFE智能体事故上报框架,计划把越权访问、未遂事故连同提示词、工具调用和执行轨迹一起上报——多智能体的"交通规则"才刚开始制定。知乎
一句话收尾:多Agent不是AI团队,是一群没有组织架构的同事。值不值得拆,看任务形状,不看PPT上画了几个Agent。