张大妈

Dr. MAS:解决多智能体LLM系统端到端RL后训练

源自知乎:Lorne

02-13 12:44

Dr. MAS 框架正式发布,专为解决多智能体 LLM 系统在强化学习后训练中面临的性能不稳定问题。该框架历经一年研发与底层重构,通过端到端的训练方案,支持异构模型协作与精细化配置,为复杂推理任务提供了稳定高效的训练范式。

Dr. MAS:解决多智能体LLM系统端到端RL后训练智能速览

  • 针对多智能体 LLM 系统 RL 训练的不稳定性问题提供解决方案。

  • 支持完全自定义的编排与异构模型混合部署。

  • 允许对每个 Agent 单独配置超参数,适应不同学习节奏。

  • 通过共享资源池与 SGLang 结合,显著提升硬件利用率。

  • 兼容 Qwen、LLaMA 等主流模型及 PPO、GRPO 等多种算法。

Dr. MAS:解决多智能体LLM系统端到端RL后训练精华内容

面对多智能体系统训练的困境,Dr. MAS 通过底层架构的深度重构,为开发者提供了一套稳定、灵活且高效的训练工具。

研发背景与挑战

该项目始于去年六月,初期实验显示多智能体系统的 RL 后训练存在明显的不稳定性,甚至性能不及单智能体。

团队并未止步于撰写失败原因分析,而是坚持进行了四个月的底层重构和算法调优,最终解决了这一核心痛点,确保了训练效果的稳定性。

灵活的智能体编排

Dr. MAS 设计了一套轻量级的注册机制,开发者能轻松封装自定义 Prompt、模型配置及逻辑。

系统支持完全用户自定义的编排模式,打破固定交互模式的限制,使得拥有不同专长的 Agent 能够灵活协作,攻克复杂的推理与决策难题。

精细化单体配置

考虑到不同 Agent 角色的学习难度和收敛速度存在差异,框架支持为每一个 Agent 单独配置超参数,如学习率。

这种设计赋予了每个 Agent 更独立的调优空间,使其能以更适合自己的节奏进行训练,从而提升整体系统的协作效率。

异构模型与资源池

支持异构模型混合部署是该系统的刚需功能,允许不同模型在同一框架下协同工作。

为缓解资源闲置,系统引入共享资源池设计,将多个 LLM worker groups 映射到共享 GPU 资源池,并配合底层 SGLang 进行推理,最大化硬件利用率与推理吞吐。

广泛的生态兼容

在模型支持上,兼容 Qwen2.5、Qwen3、LLaMA3.2 等原生 verl-agent 模型。

算法层面,支持 GiGPO、GRPO、PPO、GSPO、RLOO、DAPO 等多种算法,并内置 Search 和 Math 等训练环境,配合完整的开发指引,降低了上手门槛。

Dr. MAS 的出现为多智能体 LLM 系统的强化学习训练提供了稳定可靠的实践路径。通过解决异构模型协作与资源调度难题,它将帮助开发者在复杂推理任务中少走弯路,探索更多 SOTA 可能。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章