两边都绿、合起来就崩:这周Copilot官宣试水控电脑,多开Agent先看清三个坑

源自264位全网作者

21:50

10月1日,GitHub在更新日志里宣布:Copilot CLI 和桌面 App(macOS、Windows)的 computer use 进入公开预览,可以代你操作桌面应用。 按一位逐条核对官方公告的知乎作者的梳理(明确标注"依据公开资料、未实测"):它点控件、输文字、走流程之前会先请你批准,CLI 里有 /computer off,组织还能用托管设置统一关掉;而数据去向和提示注入防护,官方公告没写。GitHub知乎

同一周里,这个方向上的动作密集得不像巧合。10月5日,桌面工作台 Ekko Studio 的版本更新把 Qwen Code、Kimi Code、CodeBuddy、Qoder、GitHub Copilot、ZCode 六个编程 Agent 接进同一个工作空间。 10月7日,B站技术账号"猴子AI笔记"拆解了钉钉新开源的命令行工具 dingtalk-workspace-cli(dws),看点是结构化输出为什么更适合 Agent,以及企业场景的鉴权、权限、审计、dry-run 怎么落地。哔哩哔哩哔哩哔哩

讨论也从产品细节绕回人的处境。10月1-2日,Peter Steinberger 展示了把 Agent 之间的通信默认折叠成一行的交互,Theo 介绍了开临时会话不必先建项目的变化;10月4日,LangChain 创始人 Harrison Chase 抛出问题:该做专用 Agent,还是一个超级 Agent?知乎

产品侧在把"并行"当下一个提效故事卖。另一侧,先用上多开的人正在评论区对口供。知乎问题"为何AI编程的速度远超人类,但是程序员利用AI编程的工作效率却只提升了30%而已?"阅读量超过8.3万。 10月2日有人写《同时开了几个 AI Agent,为什么反而更累了?》,他的判断是:任务可以并行,人的注意力仍要在它们之间切换。知乎知乎

那位做市场的朋友的抱怨流传最广:她一天开 8 个 ChatGPT 对话框,感觉比管 3 个实习生还累。 还有个21.8万浏览的回答在吐槽:现在广告里的 agent team,和研究里的 multi-agent 早就不是一回事了。知乎知乎

把两边材料对完,这篇给一个中期判断:多开 Agent 的天花板不在模型,在你"验得过来的输出数"。并行前要先看清三个坑——假绿、交接、账单。

Ekko Studio 的 Agent Manager 里,Claude、Codex、Hermes、Pi、OpenCode 们作为一张卡片矩阵并排摆放——"多个 Agent 待在同一空间"已经是桌面工作台们的默认形态。

两边都绿、合起来就崩:这周Copilot官宣试水控电脑,多开Agent先看清三个坑

第一个坑:假绿——两边测试都绿,合并之后系统崩了

知乎作者药尘Ray复盘过一件事:两个 Agent 并发改一个项目,A 负责改数据结构,B 负责改调用逻辑,两边各自跑完、测试结果都是绿的,合并之后系统仍然可能跑不起来。 他的结论是:局部成功不等于系统成功,瓶颈已经从单点执行和上下文容量,转向了状态、协调与验证——AI 把修改速度放大了一个数量级,冲突、重复和过期状态传播的速度也被同步放大。知乎

做理论研究+工程开发的独立研究者 IGT-Damon 跑了上百个任务后,把话说得更重:Agent 系统最大的风险不是崩溃,而是"看起来都对"——崩溃会报错、会被立刻发现,假绿会带着错误一路固化。 他们踩过一个具体事故:代码里引用的 BP02–BP23、G201/G320/G460.3 一批"定理编号",查遍论文库根本没有定义原文——全是 Agent 开发过程中的内部编号,套上定理样式后被当成"既成事实"写进了系统。知乎

第三类假绿最隐蔽:LangChain 的一组架构测试发现,协调者重新表述子 Agent 的回答会引入错误,直接转发反而能减少这类问题。 让一个 Agent 替你把另外两个 Agent 的成果"总结一下",等于给传话游戏加了一环——摘要流畅了,"某功能只在指定版本可用"这种会改变结论的条件可能正好被抹掉。知乎

把"执行—编码—评审"串成一条带人工审批门的流程,是这批工作台共同的产品语言:

对应的抽查动作,社区里已经收敛出几条:

  • 验收不看全文,重点位抽查:结论依赖的资料来源、适用条件(版本/地区/额度)、数字口径,这三个位置必须回原文。

  • 裁判和运动员分家:执行 Agent 自己宣布"测试通过"然后关单,等于把审计工牌和执行钥匙发给同一个人。写进提示词的"角色"不限制它实际能调什么工具,权限要由工具层强制——药尘Ray的原话是,钥匙才决定他实际上能做什么。知乎

  • 发布、付费调用、生产数据、不可逆操作,默认过人。

第二个坑:交接——Agent 可以退出,任务状态不能跟着退出

药尘Ray 那次会话中断的代价:执行 Agent 改代码改到一半停了,代码还在、任务还在,但进行到哪一步、哪些修改是中间尝试、哪些结果已验证,系统完全答不上来。 他用医院的比喻讲清了这件事:医生换班靠的是病历,不是上一位医生的脑子——Agent 的对话上下文是医生的记忆,不是病历,对话一旦结束,系统就失去了一部分工作记忆。知乎

B站 UP"蛋挞2890"的解法朴素但好用:换 Agent 时,把任务进度、已确定的决定和下一步,主动写进 Obsidian 的本地 Markdown,下一个有访问权限的 Agent 读指定文件夹接手。 交接件就三项:走到哪、定了啥、接下来干什么。哔哩哔哩

两边都绿、合起来就崩:这周Copilot官宣试水控电脑,多开Agent先看清三个坑

IGT-Damon 的团队更进一步,把协作固化成协议:共享留言板、固定字段、强制取证,任何新 Agent 必须先读现状再接手,禁止边学边做。 他们还有一个反直觉教训值得抄:角色不是越多越好,每多一个角色就多一道交接、多一份信息损耗——他们的角色配置先增、后减、再按需细分。知乎

这里也就能理解 Steinberger 为什么不做"检测到 Agent 分歧自动展开":他的回应是,检测这类分歧并不容易,还会增加 token 成本。 折叠通信省的是屏幕空间,不是你的注意力。知乎

第三个坑:账单——你的 Agent 在花钱、在报错,你看得见吗

B站 UP"肖恩君Sean"10月6日的视频(1957播放就有277收藏,做 eval 的人都在标记收藏)把这套东西讲成了两句话:可观测性是一台摄像机,只负责记录跑了什么、花了多少;eval 是一个裁判,负责判断这次跑得够不够好、能不能发出去。 他自己的实测里,一次顺畅运行是 10 个工具、29 美分、零错误。 另一次工具调用失败,全靠 trace 把问题捞出来。没有摄像机,你只会收到一份错误的报告,和一张不知道钱花在哪的账单。哔哩哔哩

国内用户能对齐的动作有三个:

  • 查你主力工具的预算/用量面板能不能按任务看消耗——今年 6 月 GitHub Copilot 转向 AI Credits 计费后,企业侧已经可以配四级预算和多档警报,个人侧至少要知道每个 Agent 每天烧掉多少额度。知乎

  • 给常驻 Agent 立默认拒绝:碰发布、付费、生产数据的操作,宁可每次多一次人工确认。

  • 把数据边界当第一屏问题而不是售后问题。9 月底 ZCode 的风波是现成教材:技术博主曝出其桌面客户端在用户登录状态下,自动把整个工作区代码打包加密上传到云端,设置界面里找不到关闭入口;随后企业用户发函追责 12 项,智谱三次回应、承诺开源并接受第三方审计。 Agent 替你干活,碰的是你的真代码、真账号、真客户数据——它有没有"手",比它聪不聪明更早决定你的风险敞口。36氪

哪些活适合并行:先对号,再上车

判断依据其实已经散落在这些复盘里,合并成一张表:

适合先并行

别急着并行

任务关系

互相独立:不同仓库跑测试、多方向查资料、图/视频夜间批量出任务

强依赖:A 的产出是 B 的输入,等一个还得回头重读另一个

失败代价

低:废了重来,不碰线上

高:产出直接上线/直接交付给老板客户

验收标准

明确、可抽查:数字对得上、条件没丢

模糊:"看着不错"就算完成

你的状态

有空逐个验收

已经在给8个对话框当项目经理

对照下来,多数"办公党"的现实结论是:先把手上这一件事跑稳,再考虑第二件。那个引用了 arXiv 论文《Atria Dawn》的知乎回答分析了一组人机协作任务记录:Agent 频繁提出方法和实现修订,但大多数最终决定仍由人保留,参与者还把约三分之一的 AI 辅助任务评为没有 AI 就根本做不成。 也就是说,并行的价值是把你"能做的"边界推远了,而不是替你做了——推得越远,你手里的验收队列就越长。知乎

那位8个对话框的朋友的处境,《你不是在提效,是在给AI当项目经理》一文描述得很准:拆任务的是你、传话的是你、衔接的是你、控制质量的是你,最后兜底的还是你——AI 省的是打字时间,没省的是组织成本。 多数 Agent 产品现在替你接管的只是其中一部分,所以"装了就快一倍"这类宣传,验收标准应该是个人的:“我中途被叫回来几次,重读前情花了多少时间”,而不是窗口数量。知乎

节后返工第一周:三个动作,两个观察信号

如果你明天(10月8日)返工就打算开始多开,先做三件事,都是零成本的:

  1. 给每个在跑的 Agent 建一份"病历":一个本地 Markdown,就三个字段——走到哪、定了啥、接下来干什么。会话没断也写,断了它就是你唯一的交接件。

  2. 列一张"工牌与钥匙"清单:哪些 Agent 能读什么目录、能调什么工具、哪些操作必须过人。默认全关,按需开例外;上新工具(尤其带控屏/上传能力的)先查三件事——批准粒度、可见范围、能不能关,在不含敏感信息的小任务里试。

  3. 开一次"摄像机":翻一遍你主力工具近7天的用量/日志面板,挑一次失败任务看它有没有留下原因。看不见的钱和看不见的错,才是"越用越累"里最隐蔽的两笔。

两边都绿、合起来就崩:这周Copilot官宣试水控电脑,多开Agent先看清三个坑

值得继续盯的有两个信号:Copilot/Claude 们的控屏能力从 beta 转正式时,"数据去向、提示注入防护"这两项官方没写的会不会补上——这直接决定办公党能不能把敏感业务交给它;以及 WorkBuddy 这类国产桌面工作台 10月31日限免结束后,免费边界收在哪——想长期并行开工具的,双11 前把各自账单看清再动套餐。

工具在给 Agent 发钥匙的年代,提效的瓶颈反而回到了最古老的那件事:谁验收、谁记录、谁担责。 多开几个 Agent 不会替你回答,只会让你更早看清自己的答案够不够用。

内容由AI生成

精选参考来源

1. GitHub Copilot can now interact with desktop apps with computer use

2. Copilot 也能控电脑了:先看批准、范围、能不能关(依据公开资料,未实测)

3. Ekko Studio v0.7.30 版本更新|新增六个 Agent,统一接入聊天、群聊和工作流

4. 钉钉官方开源CLI:一个dws串起企业协作与AI Agent

5. 企业该做一个全能Agent,还是几个专用Agent?

6. 为何AI编程的速度远超人类,但是程序员利用AI编程的工作效率却只提升了30%而已?

7. 同时开了几个 AI Agent,为什么反而更累了?

8. 用了半年 AI,我发现大多数人根本不会用 AI——你不是在提效,是在给 AI 当项目经理

9. 如何在短时间内学习multi-agent(有翻译成智能体or代理)建模?

10. 第二篇:踩过才懂:加了更多Agent后,为啥工作效率快不起来?

11. 一个人,一支 AI 研究团队——多 Agent 协作做理论研究与工程研发的实战复盘

12. 换 Agent,记录还在:我的 Obsidian 用法

13. 一口气学会AI Agent可观测性与Evals/LLM Ops/Tracing/成本追踪/开源实测

14. GitHubCopilot如何设置预算

15. 被指偷传代码企业发函追责,智谱:ZCode将开源并接受第三方审计

16. 一个人同时使用多个 AI Agent,真的能提高效率吗?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章