腾讯联合高校推出AT²PO框架,解决了AI智能体训练中的三大核心难题:探索不充分、奖励信号稀疏和学习方式不匹配。通过熵引导树扩展、逐步奖励分配和专用策略优化,让AI能够像人类一样逐步思考和行动,在复杂任务中表现显著提升。
智能速览
AT²PO框架解决AI智能体探索不充分、奖励稀疏、学习不匹配三大问题
熵引导树扩展机制让AI智能选择最值得探索的决策点
逐步奖励分配为每一步行动提供精细化反馈
专用策略优化方法匹配智能体实际工作方式
在七个问答基准测试上平均性能提升1.84个百分点
精华内容
现有的AI智能体就像刚学会使用工具的学徒,能够与外界工具互动解决复杂问题,但在学习过程中面临探索保守、反馈滞后、训练不匹配等挑战。AT²PO框架的出现为这些问题提供了系统性的解决方案。
智能探索机制
传统AI训练就像在黑暗中摸索,基本靠随机尝试。AT²PO引入熵引导树扩展机制,为智能体配备智能探索指南针。系统使用熵值指标衡量每个决策点的不确定性,优先探索那些最让智能体"犹豫不决"的地方。这些高熵值节点往往蕴含最大学习潜力。
整个探索过程被组织成树状结构,从不确定性最高的节点开始扩展新分支。为了防止过度探索单个节点,系统还引入分支惩罚机制,当某节点被探索次数过多时自动降低其优先级,确保探索的全面性和多样性。
精细化反馈
传统AI训练就像学生只能在期末考试后知道表现,无法了解每堂课的具体效果。AT²PO建立逐步奖励分配机制,让智能体为每一步行动获得针对性反馈。
通过蒙特卡洛自助采样方法计算每个决策节点的价值,将稀疏的最终奖励分解成密集的中间反馈。实验显示,基于子节点熵值的加权聚合方法表现最佳,能够更准确捕捉每个决策点的真实价值,特别适合多步骤任务。
专用优化方法
AT²PO开发专门针对多步骤智能体的策略优化方法ATPO,按照回合组织优化过程。每个回合被视为独立优化单元,有自身重要性权重和梯度更新规则。
技术实现上引入回合级别的重要性采样比率和裁剪机制,防止策略更新过于激进。研究团队还设计了"回合熵"诊断指标,结果显示ATPO能维持适中的回合熵值,既保证学习多样性又避免更新不平衡。
实验验证成果
研究团队在七个问答基准测试上验证AT²PO效果,涵盖HotpotQA、2WikiMultihopQA等多跳问答和Natural Questions、TriviaQA等单跳问答。使用Qwen3-4B、Qwen3-8B和Qwen2.5-7B三种规模语言模型进行测试。
结果显示AT²PO在绝大多数场景取得最佳性能,平均提升1.84个百分点。在多跳问答任务上优势更加明显,证明该方法特别适合处理需要多步推理的复杂任务。
模块化贡献分析
消融实验显示各组件的协同效应。基础系统加入ATPO后,多跳问答性能从45.42%提升到47.75%;加入熵引导树扩展后提升到48.33%;最终加入逐步奖励分配机制达到48.81%。这种渐进式改进证明三个组件确实形成了超越简单相加的协同效应。
研究还发现直接使用节点价值作为优势信号比复杂的差值计算方法效果更好,为未来智能体训练方法设计提供了重要指导原则。
AT²PO框架代表了智能体训练方法学的重要进步,其强调结构化学习和细粒度反馈的理念将影响未来智能体技术发展。随着代码开源,预期会有更多基于AT²PO的衍生工作和应用案例涌现,让AI助手变得更加智能和可靠。