GLM-5的发布揭示了新一代大模型的训练蓝图。其核心价值在于通过精细化的多阶段训练,系统性地提升了模型的复杂推理与智能体能力,为AI技术发展提供了重要的参考路径。
智能速览
GLM-5采用从预训练到强化学习的多阶段顺序训练流程。
模型结构引入DSA、MTP等新技术,优化解码与缓存效率。
训练数据策略精细,补充大量STEM和代码数据,并增加长文本。
推理能力强化通过改进的IcePop算法,有效解决训推不一致问题。
智能体能力训练采用异步框架,解耦训推过程并优化多领域数据平衡。
精华内容
GLM-5的训练过程环环相扣,每个阶段都针对特定能力进行精准优化,其技术细节值得关注。
模型架构创新
GLM-5在模型结构上进行了创新,引入了分布式搜索注意力机制以提升模型处理长序列的能力。
同时,采用了多令牌预测(MTP)技术来加速解码过程,显著降低了生成延迟。
对多头注意力的键值(KV)缓存也进行了针对性优化,有效节省了显存占用,提高了推理效率。
数据策略与训练流程
预训练阶段,GLM-5通过补充海量Web长尾数据,并大量抽取STEM(科学、技术、工程、数学)及代码数据,为模型构建了坚实的知识基础。
进入Mid-train阶段,模型进一步增加了软件工程类代码和长文本数据,并引入少量类MRCR数据,旨在提升模型的编程与长上下文理解能力。
随后进行的DSA训练,通过两阶段预热策略,先调整lightning indexer再进行全参数训练,确保了新结构的平稳融入。
强化推理能力
为强化模型的复杂推理能力,GLM-5在SFT阶段采用了Thinking-Interleaved模式,并在Agent数据中屏蔽工具反馈的token损失。
更关键的是,在Reasoning RL阶段,团队改进了IcePop算法,直接对训练与推理引擎不一致以及策略漂移的token进行梯度屏蔽,从而保证了训练效果的有效性。
此外,通过使用torch.topk替换DSA中的lightning indexer,巧妙地解决了RL训练过程中可能由DSA引入的训推不一致问题。
智能体训练优化
在Agentic RL训练中,GLM-5提出了一个异步训练框架,成功解耦了训练与推理过程,提升了效率。
通过引入多Domain编排策略,模型能够动态平衡不同领域下的RL训练。
同时,采用Token-in-Token-out机制避免了re-tokenize带来的偏差,并引入Double-side IS技术,消除了保存多个历史策略模型的必要性,降低了计算开销。
GLM-5的全面技术展示,为理解下一代大模型的发展方向提供了宝贵视角。其在训练流程、结构设计和RL优化上的系统性创新,未来会如何影响整个AI生态?这值得持续关注。