张大妈

周靖人署名,通义实验室开源智能体自进化系统:让模型学会“自我反思”,14B也能越级打怪

源自公众号:量子位

01-27 18:21

阿里通义实验室开源了名为AgentEvolver的智能体自进化系统,它通过让模型学会自我提问、导航和归因,实现了无需人工干预的自主能力演化。该系统能显著提升模型在复杂任务中的表现,并为解决AI训练中的数据依赖和高成本问题提供了新方案。

周靖人署名,通义实验室开源智能体自进化系统:让模型学会“自我反思”,14B也能越级打怪智能速览

  • 阿里通义实验室开源了智能体自进化系统AgentEvolver。

  • 该系统能让14B模型性能近乎翻倍,媲美更大参数模型。

  • 核心机制包括自我提问、自我导航与自我归因。

  • 系统学习效率高,训练步数大幅减少,算力消耗低。

  • 仅用合成数据训练,也具备强大的跨域泛化能力。

周靖人署名,通义实验室开源智能体自进化系统:让模型学会“自我反思”,14B也能越级打怪精华内容

智能体的进化不再依赖人工喂食数据,而是转向了更高级的自我反思与探索。AgentEvolver正是这一变革的产物,它赋予了AI独立学习和成长的能力。

性能飞跃

AgentEvolver在性能提升上表现惊人,它让模型的任务完成率实现了近乎翻倍的增长。以14B模型为例,其平均完成率从基线的29.8%大幅提升至57.6%,最佳尝试甚至达到了76.7%。

这种提升同样体现在7B等更小规模的模型上,证明了框架的普适性。更值得关注的是,经过该系统优化的14B模型,在特定任务上的表现已经超越了未经优化的32B乃至更大规模的模型,真正实现了“越级挑战”。

效率革命

除了效果拔群,AgentEvolver的学习效率也极高。实验显示,系统在达到基线模型90%的性能水平时,所需的训练步数大幅减少。在AppWorld任务中,训练步数减少了55.6%,在BFCL任务中则减少了66.7%。

这意味着用更少的时间和算力成本就能训练出更强的模型。此外,其自进化获得的能力具备极强的跨域泛化性,仅用合成数据训练的模型,在迁移到全新领域时性能衰减微乎其微,表明其掌握了通用的推理能力。

自我提问

面对新环境无任务可做的冷启动难题,AgentEvolver通过自我提问机制来破解。系统利用大语言模型的理解能力,结合在环境中感知到的特征,主动合成具有挑战性且逻辑合理的候选任务,从而自动构建训练课程。

这一过程有效打破了对外部数据的依赖,让智能体能够自我创造学习材料,解决了强化学习中环境适应性差的痛点。

自我导航

为避免在复杂环境中的盲目试错,系统引入了自我导航机制。该机制将历史上的成功轨迹和失败教训,抽象成结构化的文本经验。

当执行新任务时,智能体能检索相似的过往经验,利用上下文学习来指导当前决策,避免了从零开始探索。这赋予了智能体“举一反三”的能力,使其能主动避开已知的错误路径,显著提高了探索的成功率。

自我归因

针对长程任务中奖励信号稀疏的痛点,AgentEvolver设计了自我归因机制。系统引入了基于LLM的过程奖励模型,对轨迹中的每一个动作步骤进行细粒度的因果分析和打分。

它不再仅仅依赖最终结果来判断成败,而是将粗粒度的结果奖励转化为细粒度的过程监督信号。这种方式极大地提升了策略优化的样本效率,确保每一次尝试都能转化为有效的学习信号。

AgentEvolver为构建更强大、更自主的AI智能体提供了全新思路,显著降低了训练门槛。当模型学会自我反思和进化,我们离通用人工智能是否又近了一步?这无疑是值得期待的探索方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章