当前位置:
AIGC文章详情

爽是真的爽,钱也是哗哗的流:多智能体并行的两本账,打开开关前先算清

源自21位全网作者

03:01

上周,OpenAI 全量上线了 GPT-5.6 的「多智能体 v2」,主 Agent 可以自动拆解子任务、委派给任意支持的模型,每个子 Agent 还能单独设置推理强度。36氪官方的说法很直白:这是为了让 Agent 用起来更便宜。

但用户端的体感是另一个故事。一位深度使用了半个月的微博用户说,它 10 分钟干完自己 5 小时的用量,「一堆智能体并行跑,爽是真的爽,钱也是哗哗的流」。微博

爽是真的爽,钱也是哗哗的流:多智能体并行的两本账,打开开关前先算清

先算「烧钱账」:并行不是简单的 N 倍

一个走过弯路的开发者团队分享了很典型的案例:客服工单系统原本用一个智能体走完意图识别、工单生成和质检,拆成四个「专业智能体」之后,「单次请求的 Token 消耗从 8K 涨到了 35K,翻了四倍多」,平均响应延迟从 3 秒涨到 12 秒,上线第一周还新增了 Agent 间通信失败、死循环、互相踢皮球等六类故障模式。知乎这只是个案,不是行业统计,但它把机制讲透了:多智能体之间的通信不是免费的,每传一次话就是一轮完整的模型调用,每个 Agent 还要各自重填一遍上下文;两个 Agent 要是意见不合来回打回,Token 就在反复确认里白烧了。

单个案例之外,大盘的消耗也是真实的。Agent 时代「替你干一件事,后台要来回调好几轮模型,查一轮、核一轮、再查一轮,请求量跟人用完全不是一回事」。知乎

再算「省钱账」:省的是模型差价

官方那本账也有自己的逻辑:「复杂任务仅20%步骤需最强模型,其余可交给便宜模型」。36氪GPT-5.6 本身分了 Sol、Terra、Luna 三档,从最强到最便宜,多智能体 v2 干的就是把关键步骤自动派给贵模型、简单步骤派给便宜模型的活。

社区已经有人把这套玩法跑出了账。小红书有用户实测,在 DeepSWE 榜单上,「GPT-5.6 Luna Max 以 67% 得分,平均成本只要 $0.61 登顶最具性价比的模型」,他总结的最高效打法是「主线程用 GPT-5.6 Sol 做整体规划和拆解,把边界清晰的子任务全部丢给 GPT-5.6 Luna Max 并行执行」。小红书

爽是真的爽,钱也是哗哗的流:多智能体并行的两本账,打开开关前先算清

所以两本账并不矛盾:烧钱账烧在「协调」上,省钱账省在「差价」上,最后多花还是少花,取决于你的任务结构。

三个问题,判断你的任务值不值得并行

一问能不能拆。子任务之间如果强依赖彼此的结果,并行不会提速,只会徒增通信开销,这类任务老老实实跑单智能体。二问能不能验。子任务的结果如果没人能判断对错,智能体之间反复互查就是最烧 Token 的黑洞,前面那个翻四倍的案例,账大多烧在这里;反过来,结果能自动验证的任务(代码能不能编译、数字能不能对上),并行才站得住。三问买的是时间还是结果。任务确实赶时间,用 Token 换「10 分钟干完」是笔划算买卖;只是好奇尝鲜,就别拿最贵的旗舰档开并行。

现在就能改的设置

用 Codex 的话,v2 已经支持给子智能体单独设推理强度、委派不同模型,社区也有了现成方案:写一个配置文件,把 Luna 定义成专职干活的子智能体,主线程留给 Sol 做规划。小红书一句话:别让最贵的模型从头干到尾。

接下来值得盯的信号

「20% 步骤」这套省钱叙事刚刚上线,真实账单还没跑出来。两个观察点:一是 OpenRouter 的周数据,这家被 Stripe 以 70 亿美元收购的模型路由平台,「截至8月10日,OpenRouter官方披露的最新周Token规模已经超过55万亿」。知乎分档委派普及后增速会不会放缓,这里是最直接的体温计;二是 Claude 和国产厂商会不会跟进给「并行」与「分档」单独定价。这两点落地之前,并行这个开关,建议先算账再打开。

爽是真的爽,钱也是哗哗的流:多智能体并行的两本账,打开开关前先算清

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章