“三省六部”不是噱头:Mavis Agent如何用古代官制破解AI协作可靠性难题?

源自104位全网作者

05-14 00:42

精选参考来源

1
Context 还不够,Harness 才是 Agent 工程优化的正解?
2
《Towards a Science of Scaling Agent Systems》在多智能体系统(MAS)与单智能体系统(SAS)之间,究竟何时“多代理合作”能真正提升性能?《Towards a Science of Scaling Agent Systems》为我们揭示了首个定量科学框架,系统探索了代理数量、协调结构、模型能力与任务属性之间的复杂交互。核心发现如下:1. 工具协同的权衡博弈 任务中工具种类越多,MAS的协调开销越大,反而可能拖累整体效率。例如在复杂工具环境下,单智能体因无额外通信开销,反而表现更佳。这打破了“多代理越多越好”的迷思。2. 能力饱和阈值 当单智能体基线准确率超过约45%时,增加代理数反而出现负收益,协调成本超过性能增益。说明高水平模型不一定适合盲目扩展多代理协作。3. 架构相关的误差放大效应 独立代理系统因缺乏交叉验证,错误传播可达单体的17倍,严重影响结果质量;而集中协调架构通过协调者检验,能将误差放大控制在4倍以内,显著提升鲁棒性。4. 任务结构决定最佳架构 - 并行可分解的任务(如金融分析)中央集权架构优势明显,性能提升高达80.9%。 - 动态环境中的高熵搜索任务(如网页浏览)去中心化架构表现最好。 - 严格的顺序依赖任务(如Minecraft规划)所有多代理架构均表现不佳,甚至退步达70%。5. 性能与成本的非线性关系 多代理系统的推理轮数随代理数量呈超线性增长(幂律指数约1.7),固定预算下,单代理的有效推理能力将被稀释,限制了实际可扩展的团队规模至3-4个代理。6. 模型能力的加速回报 智能指数的平方项显著正相关,表明能力越强的模型,升级带来的性能提升呈加速趋势。7. 冗余带来的边际效益有限 多代理中的任务分工冗余虽有助于错误校正,但其贡献远小于协调开销带来的性能损失,强调了高效协调设计的重要性。此外,研究搭建了180种配置的严格对照实验,涵盖三大主流LLM家族(OpenAI、Google、Anthropic)与多种协调拓扑结构(独立、集中、去中心化、混合),跨四类多样化任务(金融分析、网页浏览、游戏规划、工作流执行),确保结论在任务和模型间的广泛泛化。这项工作首次提出一个可预测性能的混合效应模型(交叉验证R²=0.513),能够基于任务的工具复杂度、单体基线表现及协调效率,准确预测最优的代理架构,指导科学合理地部署多代理系统,告别经验主义。启示与展望:- 多代理系统不是“越多越强”,而是“适合的架构+匹配的任务结构”带来实质收益。- 任务的顺序依赖性、工具多样性和环境动态性是决定多代理成败的关键。- 协调设计需兼顾效率与错误控制,避免过度通信导致的性能灾难。- 未来研究应探索异构模型团队、工具访问调度及多模态环境中的协调机制,突破当前规模和效率瓶颈。这篇论文为多智能体系统的科学化设计奠定了坚实基石,为实际部署提供了首个可量化、可预测的理论指导,推动从“更多代理”走向“更优协调”的智能体发展新阶段。详细阅读请见:arxiv.org/abs/2512.08296
全部
来源
内容由AI生成

精选参考来源

1. Context 还不够,Harness 才是 Agent 工程优化的正解?

2. 《Towards a Science of Scaling Agent Systems》在多智能体系统(MAS)与单智能体系统(SAS)之间,究竟何时“多代理合作”能真正提升性能?《Towards a Science of Scaling Agent Systems》为我们揭示了首个定量科学框架,系统探索了代理数量、协调结构、模型能力与任务属性之间的复杂交互。核心发现如下:1. 工具协同的权衡博弈 任务中工具种类越多,MAS的协调开销越大,反而可能拖累整体效率。例如在复杂工具环境下,单智能体因无额外通信开销,反而表现更佳。这打破了“多代理越多越好”的迷思。2. 能力饱和阈值 当单智能体基线准确率超过约45%时,增加代理数反而出现负收益,协调成本超过性能增益。说明高水平模型不一定适合盲目扩展多代理协作。3. 架构相关的误差放大效应 独立代理系统因缺乏交叉验证,错误传播可达单体的17倍,严重影响结果质量;而集中协调架构通过协调者检验,能将误差放大控制在4倍以内,显著提升鲁棒性。4. 任务结构决定最佳架构 - 并行可分解的任务(如金融分析)中央集权架构优势明显,性能提升高达80.9%。 - 动态环境中的高熵搜索任务(如网页浏览)去中心化架构表现最好。 - 严格的顺序依赖任务(如Minecraft规划)所有多代理架构均表现不佳,甚至退步达70%。5. 性能与成本的非线性关系 多代理系统的推理轮数随代理数量呈超线性增长(幂律指数约1.7),固定预算下,单代理的有效推理能力将被稀释,限制了实际可扩展的团队规模至3-4个代理。6. 模型能力的加速回报 智能指数的平方项显著正相关,表明能力越强的模型,升级带来的性能提升呈加速趋势。7. 冗余带来的边际效益有限 多代理中的任务分工冗余虽有助于错误校正,但其贡献远小于协调开销带来的性能损失,强调了高效协调设计的重要性。此外,研究搭建了180种配置的严格对照实验,涵盖三大主流LLM家族(OpenAI、Google、Anthropic)与多种协调拓扑结构(独立、集中、去中心化、混合),跨四类多样化任务(金融分析、网页浏览、游戏规划、工作流执行),确保结论在任务和模型间的广泛泛化。这项工作首次提出一个可预测性能的混合效应模型(交叉验证R²=0.513),能够基于任务的工具复杂度、单体基线表现及协调效率,准确预测最优的代理架构,指导科学合理地部署多代理系统,告别经验主义。启示与展望:- 多代理系统不是“越多越强”,而是“适合的架构+匹配的任务结构”带来实质收益。- 任务的顺序依赖性、工具多样性和环境动态性是决定多代理成败的关键。- 协调设计需兼顾效率与错误控制,避免过度通信导致的性能灾难。- 未来研究应探索异构模型团队、工具访问调度及多模态环境中的协调机制,突破当前规模和效率瓶颈。这篇论文为多智能体系统的科学化设计奠定了坚实基石,为实际部署提供了首个可量化、可预测的理论指导,推动从“更多代理”走向“更优协调”的智能体发展新阶段。详细阅读请见:arxiv.org/abs/2512.08296

3. 稳了!AI生成85%代码,程序员职业历史上最好的黄金十年来了!

4. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格

5. 我用1400年前的三省六部制,搞了一套很酷的多Agent协同方案。

6. 【AI Agent的终局不是无限上下文,而是60年前的操作系统】快速导读:大家都在卷百万上下文窗口,但一篇新论文和一线实践者的共识是:真正的解法是把AI的上下文当成一个文件系统来管。这不仅是理论,更是正在发生的事实。---几乎所有人都默认,AI Agent的瓶颈是上下文窗口不够大。从几千个token卷到上百万,仿佛只要窗口无限,AI就能包揽一切。但一篇名为《Everything is Context》的论文提出了一个反直觉的观点:解决上下文问题的最佳方式,是退回到60年前,像操作系统一样,把一切都视为文件系统。记忆、工具、外部源、人类笔记,都作为文件出现在一个共享空间里,只在需要时加载必要的部分。这不只是个学术脑洞。评论区里的一线开发者证实,他们早已在实践中这么做了。他们发现,真正的难题不是建立文件结构,而是决定“不加载什么”。上下文工程的核心,是战略性地遗忘,而不是暴力地堆砌。当AI的每一次信息调用都有时间戳和来源记录,调试Agent的过程就从“重跑一遍碰运气”,变成了像git-blame一样精确回溯。有人一针见血地评论:我们正在以惊人的速度,重跑一遍计算机科学60年的历史,最后发现,操作系统第一次就做对了。最好的想法不会消亡——它们只是在等待房间里的人跟上。---简评:长上下文的暴力美学走到了尽头,架构的优雅开始回归。从“大力出奇迹”到“万物皆文件”,不是技术倒退,而是认知升级。AI的未来,藏在计算机科学的过去里。---ref: x.com/rohanpaul_ai/status/2028184543040270769#AI创造营##人工智能#

7. Harness Engineering:AI Agent 落地企业的工程化核心

8. Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文

9. 3天赚1200刀?纯聊天就能捏出个能搞钱的 AI Agent!【教程】

10. LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景

11. 多Agent一定比单Agent更强吗?AI应用到底该在什么节点拆分?

12. 企业专属 Agent 开发实践

13. 「Github一周热点103期」超轻量的clawdbot、编程智能体的记忆工具、聊天记录分析工具、视觉agent框架和键盘、鼠标统计工具

14. 神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

15. 用AI的方式,重新打开飞书!【建议收藏】

16. 今年最火的开源Agent项目,如何思考Agent的自我进化?

17. 和AI一起,做了一个优化版的三省六部制的智能体架构。智能体也好,政治制度也好,其实很像,本身目的都是把若干个精力/体力/认知各有不同的角色组织起来,让每个角色做单点专业的事情,通过合理的分工协作机制,实现大规模的协作,最终做成一个高度复杂的事,实现整个组织的目标。唐制三省六部是中国古代行政制度的巅峰设计,其核心逻辑与现代多智能体系统高度同构:中书省起草(Plan)、门下省审议(Review)、尚书省执行(Execute),这个结构,正是古人解决「复杂决策如何不出错」的工程方案,只是三省六部制是为人类设计的,记忆和自动进化版块是缺失的,所以引入了一些其他朝代的机构名称来替代。最终的结果是,皇帝只负责1目标和意义的制定,2重大例外的处理 3定期优化流程,95%的工作由系统完成,这样才能有时间去后宫玩儿,毕竟皇帝也不是干活机器 也是要图一乐的。。。但整个系统也是有上限的,上限就是皇帝的偏好,如果以“速度”为唯一指标,系统会产生“奸臣”行为(跳过审计);如果以“满意度”为指标,系统会产生“宦官”行为(过度谄媚)。。。

18. MSE Nacos Prompt 管理:让 AI Agent 的核心配置真正可治理

19. 2026必备!这8大AI工具,没有裸泳......

20. AI原生电商出现,Agent帮你从建站到运营

21. 能上生产才是硬道理!Coding Agent 评测,终于开始关注过程了

22. 给建议的AI看够了?MiniMax Agent 让AI直接住进你的电脑干活#AI新星计划#科技改变生活#MiniMAX#Agent#minimaxagent

23. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding

24. MiniMax M2.7+OpenClaw实战!AI到底能接管多少工作?

25. AI工具实盘炒股爆赚第一,我用它来分析特斯拉,结果更炸裂 “AI炒股大战”太上头了!Qwen梭哈第一名,DeepSeek打工人第二,GPT-5纠结到只剩两千块。但真正把我震住的,是我实测Qwen的“深入研究”——17步投研流程、引用权威文献、还能自动生成图表、播客、网页。普通人第一次可以拥有专业分析师级别的判断力。AI时代,真正能提效的工具正在悄悄改变我们 #AI工具 #AI研究 #投研工具 #qwenchat #Qwen

26. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说

27. AI Agent 很火,但 Agent Infra 准备好了吗?

28. 「Github一周热点100期」爆火的AI编程工具却被Claude封禁?

29. AI 圈的“春晚”提前开了?MiniMax 的M2.5,10B 激活参数跑出旗舰水准! #人工智能 #科技改变生活 #玩个很新的东西 #MiniMax #Agent

30. 如果你现在还没用Agent帮自己干活,那其实很危险

31. 从“工具过载”到“精准调用”:破解 Agent 工具管理难题

32. 2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent

33. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

34. n8n要凉了?Agent Skills实测对比,谁才是AI自动化之王!

35. 引入三省六部制

36. 1300 年前的帝国制度,重新设计了 AI 多 Agent 协作架构

37. AI 界的"三省六部制"

38. 小龙虾三省六部

39. 发现一个超赞的 AI 多 Agent 开源项目(附部署教程)

40. openclaw github高星项目

41. 三省六部幻觉

42. Agent落地不再拼智商,而是拼可控性

43. Agent进入生产

44. 人人都是赛博皇帝

45. OpenClaw框架的多Agent协作系统

46. 长任务 Agent 不失真

47. AI Agent 越跑越蠢?先把六层架构搭好再说

48. 别再堆框架了!Anthropic最新实验打醒开发者

49. MiniMax M2.1,首个跨过“长程任务可用性阈值”的国产模型

50. Devin 多 Agent 范式

51. 从 GAN 到三 Agent 架构

52. Harness

53. GLM-5.1开源

54. DeepSeek-V4 技术报告深读

55. 面向 AI Agent 的高效上下文工程

56. Harness 设计模式

57. 复杂Agent应用开发 - 长程任务

58. agent 训练为何总在长程任务上崩溃

59. 分步验证

60. MuleRun vs OpenClaw vs Manus

61. Cursor 揭秘 Agent Harness:模型只占一半,另一半在你看不见的兜底里

62. AI Agent 的生产力悖论

63. AI Agent 编程

64. 2026 编程巨变

65. 能修bug不代表能维护代码,编程agent的长期考验才刚开始

66. 重新定义编程

67. Agent到底有没有用?关键看这3大维度|Google Cloud最新提出一套Agent KPI框架

68. 建议收藏 | 构建长期运行 AI Agent 的 5 种核心设计模式!

69. 【Agent时代·第 9 讲】智能体应用场景全景图——从帮你点外卖到帮企业省百万

70. 从编程助手到数据分析,看Agent如何改变工作方式

71. OpenCode技能集(SKILLS)

72. Coding Agent完全指南

73. 人脑已经成为Agent工作的瓶颈

74. 大语言模型智能体(LLM Agents)工具调用的演进

75. 从零实现一个 Mini Claude Code

76. MiniMax让AI语音有了新基建

77. 我用三省六部架构训练9只AI龙虾团队(openclaw) 很多人不知道,中国古代的 三省六部 其实是一套极其先进的“组织架构系统”。 我把这套体系搬进了 AI。 用 OpenClaw(龙虾) 训练了 9 个专业化 Agent: 👑 龙虾皇帝:负责最终决策 📜 尚书省龙虾:负责执行任务 🔍 门下省龙虾:负责审核与纠错 再加上完整的 问责 + 审计机制。 结果就是—— 一个可以 自动决策、自动执行、自动审计 的 AI 团队。 这套系统跑起来,比很多人类团队还要严密。 如果你想: 本地部署 OpenClaw 搭建 AI Agent 团队 或升级调试你的系统 可以联系我。#openclaw #股票 #厦门 #DeepSeek部署#clawdbot

78. 用数据驱动 Agent 迭代:如何设计一个客服 Agent 的评测系统

79. Edict:三省六部 AI 多 Agent 协作

80. 告别混乱协作!把AI Agent放进“三省六部”,效率直接起 还在为AI多Agent协作混乱、不可控头疼?试试用中国千年帝国的“三省六部”制度来重构协作逻辑! 这套名为Edict的框架,把AI Agent分工成: - 中书省:负责规划与任务分解 - 门下省:专职审核,可直接封驳打回 - 尚书省:统领六部并行执行 - 军机处:实时看板,让你像“皇上”一样掌控全局 对比传统框架(CrewAI/AutoGen),它有三大核心优势: ✅ 制度性审核与分权制衡 ✅ 极致的可视化与可干预(叫停/取销/恢复) ✅ 零核级部署与模型热切换 让AI协作从“自由创作”变成“精密运转的帝国机器”,可控、高效、可追溯。 #AI多Agent #多智能体协作 #三省六部AI #Edict框架 #AI工程化

81. 智能体深度解析:Agent中的多代理协同的优势和难点是什么?

82. 把老祖宗的智慧用在 AI 身上——三省六部制

83. 模型和Agent的边界

84. 收藏!小白程序员必看:用图文彻底搞懂AI Agent与大模型应用开发

85. OpenClaw之外的新方向:AI多Agent架构创新 — 三省六部·Edict项目解析

86. openclaw三省六部-对外支援

87. 赛博朝廷:三省六部 AI 多 Agent 协作架构

88. 面经分享|构建Agent时遇到过的瓶颈和挑战

89. 别只用单个 Agent了——AI 多智能体(Multi-Agent)协作才是降维打击

90. 2026年还不会multi-agent开发? 这8个谷歌官方multi-agent设计模式你收好

91. 一文搞懂AI Agent评测,拆解Anthropic最新发布的自动化评测体系

92. 拒绝“人工智障”:Multi-Agent系统的失控处理

93. 资深程序员如何使用 Agent辅助编程:不是 Vibe,而是 Control

94. Agent 评测怎么做

95. AI Agent评测基准的真相:为何刷榜容易、实战难

96. 赛博皇上驾到!OpenClaw+三省六部硬核玩法

97. 构建生产级 Agent 的 12 个法则

98. 顶级 AI 公司如何处理上下文工程

99. 当 Session 成了枷锁:从 OpenClaw 的上下文焦虑到 Hermes Agent 的解法

100. 别再只会用AI聊天了!MiniMax Agent,才是打工人真正的效率神器

101. MiniMax双功能升级 实测揭示真实体验 Agent生态新信号?

102. 周末在家用MiniMax搭建了一个Agent harness

103. 编程Agent为什么成了Token消耗大户

104. 基于 Hermes 的可控编排 SubAgent 实践:以大A市场分析场景为例

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章