张大妈

✨ROME!阿里发布首个端到端智能体生态系统

源自小红薯:AI极客熊

01-22 20:39

面对AI智能体训练不稳定、缺乏统一生态的挑战,阿里推出了ROME模型及其背后的Agentic Learning Ecosystem (ALE)。这一端到端的生态系统整合了从数据生成、训练到执行的全流程,通过创新的IPA算法和高质量数据协议,显著提升了长时程任务的稳定性和性能,为开源社区构建强大可靠的智能体提供了新的基石。

✨ROME!阿里发布首个端到端智能体生态系统智能速览

  • ROME模型在SWE-bench Verified上准确率达57.4%,性能超越同规模模型。

  • 推出Agentic Learning Ecosystem (ALE),整合了ROLL、ROCK和iFlow CLI三大核心组件。

  • 提出IPA算法,在语义交互块层面进行信用分配,解决了长时程任务训练不稳定问题。

  • ROME已在生产环境中成功部署,证明了其生态系统的实用性和可扩展性。

✨ROME!阿里发布首个端到端智能体生态系统精华内容

ROME的诞生并非一蹴而就,其背后是一个精心设计的端到端生态系统,它如何从根源上解决了智能体开发的多个痛点?

性能表现亮眼

ROME模型基于Qwen3-MoE架构,在超过100万条轨迹上完成训练。其性能在多项关键基准测试中得到了验证。在SWE-bench Verified测试中,ROME取得了57.4%的准确率,显著超越了同等参数规模的模型。在更具挑战性的Terminal-Bench 2.0上,它获得了24.72%的成绩,这一性能甚至可以媲美参数量超过100B的更大模型,展现了其在复杂任务处理上的强大潜力。

ALE生态系统构建

为支持ROME的训练与部署,阿里构建了Agentic Learning Ecosystem (ALE)。这是一个端到端的基础设施,包含三个核心组件:ROLL,一个用于权重优化的后训练框架;ROCK,一个可配置的环境执行引擎;以及iFlow CLI,一个统一的智能体交互框架。该生态系统将智能体的数据生成、模型训练和实际执行优化无缝衔接,形成了一个高效闭环的开发流程。

IPA算法稳定训练

长时程任务训练的不稳定是智能体开发的一大难题。ROME通过引入IPA(Inter-action chunking Policy Assignment)算法来攻克此问题。不同于传统的在单个Token级别进行信用分配,IPA算法在语义交互块的层面上进行优化。这种方法更贴合人类解决问题的逻辑,显著提升了强化学习在长跨度任务中的训练稳定性,有效减少了算法“翻车”的概率。

数据与安全双重保障

高质量的数据是模型成功的基石。为此,团队精心设计了一套数据组合协议,覆盖了从静态代码片段到动态智能体行为的完整场景。更重要的是,这套协议内置了对安全性、有效性的验证机制,确保智能体在训练和执行过程中不会产生未授权的恶意行为,为构建安全可靠的AI应用提供了坚实保障。

ROME及其ALE生态系统的开源,为AI智能体领域提供了一个从理论到实践的完整范本。它不仅是一个高性能模型,更是一套可复现、可扩展的基础设施。未来,这一生态能否催生出更多专业化的智能体,推动整个行业进入一个协同发展的新阶段?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章