先说结论:你同时开着Claude Code写功能、Codex查Bug、再来一个做Review,看着像多了三个同事,实际是你自己变成了全天候调度员——这个瓶颈,最近半年被三拨人用三种方式解决,而9月5日我实测GitHub时发现,涨得最快的那拨已经在8个月里把项目推到了48,999个Star。
这周的真问题:Agent越多,人越忙
9月5日知乎上有个问题在提效圈子里传得很快:一个人同时使用多个AI Agent,真的能提高效率吗?提问下的描述几乎是一份现场速写——一个终端在写功能、一个终端在查Bug、另一个Agent负责Review,人不停切窗口、补上下文、确认谁卡住了。知乎
有意思的是,连Multica自己的README都没回避这件事:“You already run Claude Code, Codex, and three other agents… The more agents you add, the more of your day goes to babysitting them.”(你已经在同时跑好几个Agent,加的越多,你的一天就越像在带孩子。)
这个项目2026年1月13日才建仓,8个月做到4.9万Star、6329个fork,9月2日、3日、4日连发三个版本(v0.4.38到v0.4.40),官方定位就一句话:像给同事派活一样给AI派活——Agent在Issue里接单、汇报进度、报阻塞,交付后进Review。它不造模型、不造Agent,宣称支持26种Agent CLI:Claude Code、Codex、Cursor、Copilot、Kimi、OpenCode都在列表里,跑在你自己机器的daemon上,代码不出本地。GitHub

一个项目冲到这种热度,说明它戳中的不是个别玩家的矫情,而是一整批"守终端"用户的日常损耗。但装不装、怎么装,别急着跟风——把全网这一个多月的实测帖摆在一起看,判断要复杂得多。
全网四条路线:各在解哪一层的问题
第一条:管理派(Multica)。 把任务装进Issue,Agent作为Assignee接单,进度、命令、错误、Token花费全部回到同一条时间线;Squad允许人+Agent混编、指定一个Leader Agent路由派活;做对一次的方法沉淀成Skill挂给所有Agent;重复任务交给Autopilot按cron跑。两个细节值得单独点名:一个是Review gates,工作落在review列而不是直接进main;另一个是Inbox,需要你做判断时才ping你,而不是每一步都ping。GitHub 这两条恰好回应了社区最集中的两个抱怨:Agent自称完成没人验收,和多窗口轮询榨干注意力。得物技术8月20日发的EP-Harness,就是基于Multica二开做团队级Agent工作流,算是它在生产环境被认真对待的信号。知乎
第二条:隔离派(Orca)。 三个Coding Agent共享一个目录,最先发生的一定不是效率提升,而是文件互相覆盖。Orca的思路是给每个任务开独立Git Worktree、绑独立终端和会话,把状态收敛到一个控制台——9月5日它实测62,000多个Star,总热度还在Multica之上,说明"隔离"这一层同样不缺投票的人。它官方文档里有句话值得抄进决策笔记:Worktree只隔离文件和Git分支,三个Agent仍然共享同一个用户权限、网络、SSH Agent和云凭据——隔离不等于沙箱。知乎

第三条:克制派(Paseo)。 一个独立开发者做的壳,到9月5日实测已经16,000多个Star。它和第一二条的分歧点在于:大量编排项目都想自建Agent Harness,代价是你的CLAUDE.md失效、Skills读不了、积累的配置和记忆全部作废,等于从零重新教一遍AI干活。知乎 Paseo选择不造引擎,你在里面跑Claude Code,底层就是Claude Code本身,配置全保留,再用/paseo-handoff在不同Agent之间交接、/paseo-loop循环跑到验收条件、跨Provider把Claude Code的任务派给Codex。切过来零成本,不喜欢随时切回去。

第四条:手搓派(SpaceX工程师的Grok Bot体系)。 9月2日知乎有人拆解了SpaceX AI工程师Lingxi Li的分享:有团队成员一个月提交2000多个PR,他本人从手动管15个Cloud Agent扩到同时跑200多个。知乎 注意,这些数字来自产品团队自述,没有独立评测,普通团队大概率复制不了规模——但机制可以抄:五个带名字的工程Bot各守一个领域,接任务后创建Cloud Agent干活;所有Bot共同维护一张Notion表,每30分钟巡检PR的CI失败、合并冲突、安全告警;视觉任务的验收标准写死——截图里必须真的出现需求要求的变化;还有个不写代码的Jenny,每天凌晨5点和各Bot做1:1复盘、更新Playbook。

该不该上:三档人群对号入座
一个8月15日的调研帖(作者自称日常并跑三四个Agent、重度到"每天把手伸进机器里")给了一个我认为最清醒的分层:看板解决的是"看着更方便",不是"干得更准确"——点餐系统再精密,端上来的菜也还是不好吃。知乎 但同一个作者也承认,"需要介入时主动通知你"是从"你去找它"到"它来找你"的转变,一两个Agent时没感觉,管四五个时几乎零成本。
照这个逻辑分三档:
只跑一个Agent、偶尔改一两个文件:别装。为一个简单任务先建工作区、Agent档案、Runtime、Issue,等于给自己加了一层流程税——那个知乎问题回答的原话就是,平时只让一个Agent改一两个文件时终端和IDE更直接,先建工作区、Agent、Runtime、Issue和Squad只会多出一层流程。知乎
同时用两个以上Coding Agent、已经在反复派工交接补上下文:管理层开始划算。它的价值不是让Agent写得更漂亮,而是把散在窗口里的状态、交接和Token账单集中起来——特别是Token usage按Agent、按Issue统计这项,并行三四个Agent时账单是成倍涨的,你得先看见钱花在哪。
小团队要把Agent正式纳入流程:Issue、权限角色、执行日志、Review状态、自托管,让机器干的活有地方可查,而不是藏在某个同事的本地会话里。这一档Multica和EP-Harness这类二开路线都成立,但要先过许可证关:Multica不是原样的Apache-2.0,自定义的Multica License限制了对外托管、商业嵌入和品牌修改,内部用没事,想包装成对外服务先读完条款。
还有一个比装工具更前置的判断,SpaceX那篇拆解和知乎回答不约而同都指向同一句话:先把一两个任务跑到"能接续、能验证",再增加并行数量。任务发出去前把交付物标准写在末尾(截图+Diff+测试,别信"已修复"三个字),中断前在TASKS.md里留下当前PR、失败命令和下一步。这一步不花一分钱,今天就能做。知乎

翻车清单:新项目的学费你来之前也有人交过
4.9万Star的另一面,是1502个未关闭Issue和一天可能两个版本的更新节奏。8月底到9月初的实测帖里,这几个坑出现频率最高:
daemon抢生命周期:先用CLI跑了`multica login`和`multica daemon start`,再开Desktop应用,runtime就start不起来——Desktop发现自己管不了已被CLI占用的daemon。结论:别混用两条启动路径,选一个生命周期管理者。
token写两处:主配置文件里有token,Desktop读的profile配置里没有,认证就静默失败、报"fetch failed"。修复方式是手动把token补进Desktop所读的profile目录config.json里。知乎
聊天正常、Issue报错:服务端litellm代理找不到某个模型组对应的API Key,且新模型不在fallback映射表里——同一个Agent,聊天通道活着,派任务就AuthenticationError。给Agent显式指定模型并注入Key才能闭环。
自动升级背刺:8月21日有用户报告,Agent CLI自动从0.29.1升到0.37.2后,与Multica daemon的ACP客户端不兼容,Kimi的runtime Bash通道整体不可用。管理层的版本兼容是持续风险,锁版本、留出回滚位是刚需。知乎
Skill不审就挂:从外部导入的Skill可以带脚本和命令,平台不替你审核、不自动沙箱——Skill能复用经验,也能把风险一次复用给整支Agent团队。知乎
Runtime权限裸奔:daemon以系统用户权限执行,能读写该用户可访问的一切文件。官方自己的建议就是:专门用户、容器或虚拟机隔离,别放在装满个人资料的主账户下跑。
另外提醒一句:站内搜Multica,你能搜到一批"明显是AI主导的评测"(一位Day 1用户的原话),热度期恰好处在"给AI答案投毒"生意被曝光之后——看这类新工具评测,优先找附了报错原文和修复动作的实测帖,少看只有好评的种草文。知乎
继续盯什么
这个赛道现在最大的变数是:如果Codex、Claude Code这些"本尊"很快原生补齐跨Agent派工、共享记录和审计,单独一层管理就显得多余。知乎 三个观察信号——一是各家原生多Agent方案(比如Codex的多Agent并行对话)功能推进到什么程度;二是Multica的open issues消化速度和release notes里是否出现权限沙箱类条目;三是Paseo这种"不造引擎"路线的Star增速,如果克制派持续涨粉,说明社区对"重管理层"的信任并没有看上去那么大。
回到开头那个问题:当你同时用三个Agent时,你缺的是不是第四个更聪明的Agent?至少现在不是。你缺的是验收证据、交接状态和一张看得见的Token账单——前两样今天就能补上,第三样,才是那些4.9万Star项目真正在卖的东西。