张大妈

GLM-5技术报告来了,真详细呀!

源自小红薯:刘聪NLP

02-25 13:36

智谱开源的GLM-5模型虽采用DeepSeek架构,但其技术报告揭示了多项深度改造。这份报告详细拆解了GLM-5在注意力机制、多token预测及训练工程等方面的创新,展示了如何通过精细化优化实现性能与效率的平衡,为理解模型的后发优势提供了宝贵视角。

GLM-5技术报告来了,真详细呀!智能速览

  • GLM-5通过改造MLA并采用Muon Split,性能追平GQA-8。

  • 利用3层MTP参数共享,在相同成本下将模型接受长度提升8.2%。

  • 针对DSA架构采用持续预训练,有效克服了基础模型的转换Gap。

  • 构建了完全异步的RL基础设施,推理与训练解耦以提升吞吐量。

  • 设计了精细化的Off-Policy数据处理流程,确保训练数据质量。

GLM-5技术报告来了,真详细呀!精华内容

GLM-5的技术报告并非简单复刻,而是对现有架构的深度优化与创新。从注意力机制到训练工程,多项关键改造共同塑造了其最终的模型性能。

注意力机制优化

原版MLA性能不及GQA-8,GLM-5并未直接套用。其引入Muon Split技术,将上投影矩阵按注意力头进行拆分,并对各部分独立正交化,使得不同头能以不同尺度更新。

同时,模型采用了MLA-256变体,将头维度从192提升至256,并相应减少头数。这一调整在保持训练计算量不变的同时,降低了解码计算量,最终实现了与GQA-8相媲美的性能。

效率与训练策略

在多Token预测方面,GLM-5没有沿用DeepSeek-V3的1层MTP预测2个token的方案,而是设计了3层MTP参数共享机制。在显存消耗成本保持一致的前提下,该策略将模型的接受长度从2.55提升至2.76,增幅达到8.2%。

针对其采用的DSA架构,GLM-5采用了持续预训练方式,而非从头开始训练,这有效克服了基础模型在转向新架构时可能出现的性能鸿沟。

异步RL工程

GLM-5基于slime框架,构建了一套完全异步的强化学习(RL)基础设施。该设计将推理引擎与训练引擎彻底分离,推理端持续生成数据,待数据积累到一定量后再统一发送给训练端,避免了两者互相等待,从而极大提升了整体吞吐量。

一个关键的工程细节是TITO机制,在异步传输过程中直接传递Token ID而非文本,此举避免了反复Tokenization可能导致的边界错误,确保了数据的严格对齐。

GLM-5的技术报告展现了对现有前沿架构的深度理解和精细化改造能力。它不仅在理论上进行了创新,更在工程实践中提供了高效的解决方案。这些开源的技术细节,为社区后续的大模型研发提供了宝贵的参考,未来这些优化思路会如何影响更多开源模型?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章