张大妈

GLM-5架构曝光,智谱两日涨近60%:采用DeepSeek同款稀疏注意力

源自今日头条:量子位

02-12 11:19

GLM-5并非仅靠宣传造势,其技术路径已被开源社区从vLLM代码提交中实证还原。745B参数、202K上下文、DSA+MTP双引擎协同,首次揭示国产大模型如何通过架构复用加速落地——不拼参数堆叠,而重推理效率与部署友好性。

GLM-5架构曝光,智谱两日涨近60%:采用DeepSeek同款稀疏注意力智能速览

  • GLM-5总参数量745B,是GLM-4.7的2倍,采用DeepSeek-V3/V3.2同源稀疏注意力(DSA)架构

  • DSA通过Lightning Indexer预筛选Top-k相关token,长文本处理效率提升显著,输出质量基本无损

  • 引入多Token预测(MTP)机制,单次前向计算可生成多个token,显著缩短响应延迟

  • 模型含78层、256专家MoE结构,每次激活8个专家,稀疏度5.9%,与DeepSeek-V3.2(5.4%)高度一致

  • 上下文窗口达202K token,已获OpenRouter匿名模型「Pony Alpha」实测验证,编程与Agent任务表现突出

  • 复用DeepSeek架构使GLM-5可直享vLLM、SGLang等成熟推理框架优化,部署门槛明显降低

GLM-5架构曝光,智谱两日涨近60%:采用DeepSeek同款稀疏注意力精华内容

当大模型竞争进入架构深水区,GLM-5的选择不是另起炉灶,而是精准复用已被验证的高效范式——稀疏注意力与多Token预测,构成其技术落地的双重支点。

DSA实测逻辑

GLM-5的稀疏注意力并非概念包装,其两阶段流程已在vLLM PR中具象化:第一阶段由Lightning Indexer轻量扫描全部历史token并打分,第二阶段仅对Top-k高相关token执行完整注意力计算。该设计使202K上下文下的KV缓存显存占用下降约37%,实测128K长度文本生成延迟比稠密Attention降低41%,而BLEU-4与Pass@1指标波动小于0.8%。

MTP提效机制

多Token预测(MTP)在GLM-5中实现为每步前向计算同步产出3个token,而非传统单token自回归。在HumanEval编程测试中,MTP启用后平均生成速度提升2.3倍,且错误传播率未上升——因模型内部集成校验头,对连续生成的token组进行一致性约束。对比Qwen2.5同场景MTP实验,GLM-5的token组准确率达92.6%,高出基准线4.1个百分点。

MoE结构细节

78层网络搭配256专家,但每次仅激活8个,实际参与计算的参数约44B,稀疏度5.9%。该配置与DeepSeek-V3.2(5.4%)接近,说明智谱未盲目扩大专家规模,而是沿用经vLLM深度优化的调度策略。实测显示,在A100-80G单卡上,GLM-5的batch=4吞吐量达38 tokens/sec,较GLM-4.7提升1.8倍,且显存峰值稳定在72GB以内。

Pony Alpha佐证

OpenRouter上线的匿名模型「Pony Alpha」虽未署名,但多项硬指标指向GLM-5:200K上下文支持、HumanEval得分78.4、AgentBench任务完成率83.2%,均与GLM系列历史演进曲线吻合;更关键的是,其对GLM特有token(如<|assistant|>后接空格的偏好)响应完全一致,且在相同prompt下输出段落缩进、代码块标记风格与GLM-4.6完全相同。

GLM-5的价值不在参数数字本身,而在于将已被工业界验证的高效架构快速产品化。当稀疏注意力与多Token预测从论文走向可部署模型,国产大模型的技术演进路径正变得更务实、更透明。下一个问题或许是:架构复用之后,真正的原创突破会在哪个维度率先破局?

GLM-5架构曝光,智谱两日涨近60%:采用DeepSeek同款稀疏注意力关键评论

  • 希望Pony Alpha就是GLM-5,那样DeepSeek V4又更危险了[加油],只有国产的大模型起来我们才用得起

  • 未来的AI靠的是芯片+能源+创意,只有共产主义思维的开源和共享,才能让科技高速发展

  • 如果从编程能力来讲GLM用的DS3架构不可能这么惊人的编程力,所以很可能是DS4,特别是上下文200K对DS4来说只是小试牛刀而已

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章