张大妈

GLM-5技术报告精细整理

源自小红薯:小宁算法选手

03-03 15:14

GLM-5的发布揭示了新一代大模型的训练蓝图。其核心价值在于通过精细化的多阶段训练,系统性地提升了模型的复杂推理与智能体能力,为AI技术发展提供了重要的参考路径。

GLM-5技术报告精细整理智能速览

  • GLM-5采用从预训练到强化学习的多阶段顺序训练流程。

  • 模型结构引入DSA、MTP等新技术,优化解码与缓存效率。

  • 训练数据策略精细,补充大量STEM和代码数据,并增加长文本。

  • 推理能力强化通过改进的IcePop算法,有效解决训推不一致问题。

  • 智能体能力训练采用异步框架,解耦训推过程并优化多领域数据平衡。

GLM-5技术报告精细整理精华内容

GLM-5的训练过程环环相扣,每个阶段都针对特定能力进行精准优化,其技术细节值得关注。

模型架构创新

GLM-5在模型结构上进行了创新,引入了分布式搜索注意力机制以提升模型处理长序列的能力。

同时,采用了多令牌预测(MTP)技术来加速解码过程,显著降低了生成延迟。

对多头注意力的键值(KV)缓存也进行了针对性优化,有效节省了显存占用,提高了推理效率。

数据策略与训练流程

预训练阶段,GLM-5通过补充海量Web长尾数据,并大量抽取STEM(科学、技术、工程、数学)及代码数据,为模型构建了坚实的知识基础。

进入Mid-train阶段,模型进一步增加了软件工程类代码和长文本数据,并引入少量类MRCR数据,旨在提升模型的编程与长上下文理解能力。

随后进行的DSA训练,通过两阶段预热策略,先调整lightning indexer再进行全参数训练,确保了新结构的平稳融入。

强化推理能力

为强化模型的复杂推理能力,GLM-5在SFT阶段采用了Thinking-Interleaved模式,并在Agent数据中屏蔽工具反馈的token损失。

更关键的是,在Reasoning RL阶段,团队改进了IcePop算法,直接对训练与推理引擎不一致以及策略漂移的token进行梯度屏蔽,从而保证了训练效果的有效性。

此外,通过使用torch.topk替换DSA中的lightning indexer,巧妙地解决了RL训练过程中可能由DSA引入的训推不一致问题。

智能体训练优化

在Agentic RL训练中,GLM-5提出了一个异步训练框架,成功解耦了训练与推理过程,提升了效率。

通过引入多Domain编排策略,模型能够动态平衡不同领域下的RL训练。

同时,采用Token-in-Token-out机制避免了re-tokenize带来的偏差,并引入Double-side IS技术,消除了保存多个历史策略模型的必要性,降低了计算开销。

GLM-5的全面技术展示,为理解下一代大模型的发展方向提供了宝贵视角。其在训练流程、结构设计和RL优化上的系统性创新,未来会如何影响整个AI生态?这值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章