智谱开源的GLM-5技术报告,揭示了从AI辅助编码到独立工程任务的关键转变。这份报告不仅是性能展示,更是一套完整的Agent训练方法论,从训练效率、长上下文处理到分层训练策略,为如何构建真正能干活的AI提供了可复制的工程实践,对整个AI生态具有重要意义。
智能速览
GLM-5在编码和代理能力上已进入全球第一梯队。
Slime框架解决了强化学习在Agent任务中的训练效率瓶颈。
结合DSA稀疏注意力,有效降低了长上下文处理的计算成本。
采用分层训练,避免了新技能学习对旧能力的“灾难性遗忘”。
GLM-5的训练方案已经开源,推动了Agent工程化进程。
精华内容
让AI从“辅助写代码”进化到“独立修bug”,需要解决的不仅仅是模型规模,更是训练范式的根本变革。GLM-5的报告详细拆解了实现这一跨越的核心技术。
提升训练效率
传统强化学习在处理长程Agent任务时,GPU常因等待外部环境反馈而闲置,效率低下。GLM-5为此设计了Slime异步框架,将数据生成与模型训练解耦,实现两者并行。为解决异步带来的模型版本不一致问题,框架通过TITO网关重编码Token,并采用双侧重要性采样保证训练稳定,极大提升了资源利用率。
攻克长上下文
面对Agent任务动辄数十万Token的上下文,GLM-5引入DSA稀疏注意力机制,将计算成本降低1.5-2倍。一个关键发现是,为保证强化学习训练的稳定性,团队牺牲了部分推理速度,选用了确定性的PyTorch top-k算子。此外,通过“Keep-recent-k”和混合层次管理策略,有效过滤冗余信息,使BrowseComp任务得分从55.3%提升至75.9%。
分层训练体系
GLM-5的强化学习分为三阶段:Reasoning(推理)→ Agentic(代理)→ General(通用)。这种分层设计旨在避免“灾难性遗忘”,即学习新技能时丢失旧能力。在训练新阶段时,通过“跨阶段蒸馏”技术,让前一阶段的最佳模型作为教师,确保模型在获得编程能力后,其推理能力不会退化,效果显著。
优化基础模型
在预训练阶段,GLM-5团队解决了MLA与Muon优化器的兼容冲突,通过“Muon Split”方法,在保留各自优势的同时,达到了与标准GQA相当的性能。同时,采用参数共享的多Token预测,让模型学习更通用的多步预测能力,在相同推测步数下,接受长度比DeepSeek-V3高约8%。
GLM-5的技术实践表明,AI Agent的突破不再仅仅依赖规模扩张,而是转向更精巧的工程化设计。其开源的异步训练、稀疏注意力和分层培养方案,为整个社区提供了一套宝贵的蓝图。当工程范式开放,Agent生态的爆发式增长或许才刚刚开始。