张大妈

LLM多智能体新方法:GRPO

源自小红薯:🎃量子智心

01-25 17:07

大型语言模型智能体在协作时常缺乏全局观,导致效率低下。一项新研究将强化学习与LLM结合,提出GRPO方法,通过优化团队整体表现,显著提升了多智能体在写作和编程等复杂任务中的协作效率。

LLM多智能体新方法:GRPO智能速览

  • GRPO是一种结合强化学习优化多LLM智能体协作的新框架。

  • 采用集中训练分散执行架构,平衡全局优化与独立决策。

  • 协作写作任务中,结构一致性高达98.7%,速度提升3倍。

  • 编程任务测试通过率达74.6%,并减少了20-35%的冗余交互。

  • 通过“留一”对比评估贡献,有效抑制了重复性沟通。

LLM多智能体新方法:GRPO精华内容

这项研究如何系统性地解决多智能体协作的瓶颈?其核心在于将协作过程建模并加以优化。

核心框架

LLM多智能体协作的挑战在于缺乏全局意识,依赖提示工程的传统方法难以系统优化团队表现。为此,研究团队将协作过程建模为去中心化部分可观测马尔可夫决策过程,并提出了强化学习增强框架。该框架采用集中训练分散执行(CTDE)架构,旨在利用全局信息进行训练,同时保持各智能体在执行时的独立决策能力。

GRPO算法

框架的核心是团队相对策略优化(GRPO)算法。GRPO通过一个联合奖励函数来平衡任务质量、处理速度和协调成本。其独特之处在于采用“留一”对比来分配贡献值,有效解决了多智能体学习中常见的信用分配难题。这种机制能够公正评估每个智能体的决策,即使奖励信号延迟发放,也能抑制团队内部的重复性沟通,促使协作风格更为简洁高效。

性能提升

在协作写作和编程的基准测试中,该框架表现卓越。写作任务里,产出内容的结构一致性达到98.7%,处理速度是单智能体方案的3倍。在编程任务上,代码的测试通过率达到74.6%。更重要的是,框架成功将冗余的交互成本降低了20%至35%,证明了其在提升效率和减少沟通开销方面的双重优势。

自适应与展望

研究还发现,不同任务对协作模式有特定需求。框架通过自适应奖励权重动态调整优化重点,如在技术报告中固话大纲,在编程中强化即时测试反馈。这种自适应能力确保了方法的泛化性,为解决更长时间跨度的复杂工作流提供了可靠路径,未来可探索更细粒度的角色分工。

该研究成功将多智能体强化学习原理适配于语言智能体协作,为构建高效可靠的自动化工作流提供了新思路。未来的多智能体系统是否能变得更加智能和自主?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章