张大妈

解构GLM-5:开源大模型的架构新思路

源自抖音:边山李博士

02-24 11:52

智普GLM-5的发布,其意义远超参数规模的翻倍。它揭示了开源模型阵营在架构演进上的关键共识:通过MoE放大总参数、严控激活成本、革新Attention机制,并优先扩展模型宽度而非深度,为追赶顶级闭源模型提供了清晰的工程化路径。

解构GLM-5:开源大模型的架构新思路智能速览

  • GLM-5参数规模达744B,性能对标一线闭源模型。

  • 采用MoE架构,总参数翻倍但激活参数仅小幅增长,控制推理成本。

  • 引入Latent Attention与稀疏Attention,旨在降低长文本处理成本。

  • 架构优化转向“宽度优先于深度”,通过减少层数来降低推理延迟。

  • 春节已成为开源旗舰模型发布的集中窗口期。

解构GLM-5:开源大模型的架构新思路精华内容

GLM-5的发布不仅是一次规模上的跃迁,更是开源模型在工程化道路上的一次深度探索,其背后是深思熟虑的架构取舍。

规模与定位

GLM-5的参数规模从前代GLM-4.5/4.7的355B直接跃升至744B,这一体量在行业中处于DeepSeek V3(673B)和Kimi K2(1T)之间。根据公布的基准测试,其整体能力被认为可以比肩GPT-4.5、Gemini Pro 3及Claude 4.6 Opus等美国第一梯队的闭源旗舰模型,标志着开源模型在性能上正迅速追赶。

需要注意的是,基准测试的成绩并不完全等同于真实生产环境中的表现,这一点在过去两年已被反复验证。

MoE的成本魔法

GLM-5延续了MoE(Mixture of Experts)架构,但其扩展思路尤为巧妙。尽管模型总参数规模暴涨,但每个Token处理时激活的参数量仅从32B小幅增加到40B。这意味着,通过增加专家网络的数量来扩充模型的知识容量,而不是同比例增加每次推理的计算量,从而实现了在提升能力的同时,将推理成本的增幅控制在合理范围内。

Attention机制革新

面对日益增长的长上下文处理需求,Attention机制的效率成为架构竞争的焦点。GLM-5引入了两项源自DeepSeek路线的关键机制:Multi-Head Latent Attention(多头潜在注意力)和Sparse Attention(稀疏注意力)。这两项革新的核心目标非常明确,即显著降低长文本推理过程中的计算成本,提升处理效率。

宽度优先深度

此次模型规模的增长主要来自“宽度”而非“深度”。具体来看,专家数量从160个增加到256个,FFN维度从5120提升至6144,模型的投影维度也从1536增加到2048。然而,一个反直觉的调整是,Transformer的层数反而从92层减少到了78层。这种权衡是因为模型深度难以像宽度那样进行并行优化,减少层数可以有效降低推理延迟,改善吞吐量,是一种典型的推理友好型架构设计。

开源的工程共识

GLM-5的发布,代表了开源模型阵营在几个关键技术方向上形成了共识。首先,继续通过MoE放大总参数;其次,必须严格控制激活参数以控制成本;再者,Attention机制向稀疏和Latent结构演进;最后,架构优化上宽度优先于深度。过去两年,春节前后已成为开源旗舰模型的集中发布期,这一现象侧面反映了开源社区已具备媲美闭源巨头的系统工程复杂度。

GLM-5的推出,清晰地展示了开源大模型正从单纯的规模竞赛,转向更为精细的工程化权衡。它所代表的架构共识,不仅为其他开源模型指明了方向,也让外界看到了追赶甚至超越闭源巨头的可能性。下一个春节,开源社区又会带来怎样的惊喜?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章