张大妈

猜一猜DeepSeek-V4的模型架构

源自公众号:zartbot

02-24 14:36

本文基于DeepSeek过往模型的技术路线,深入剖析其研发核心脉络,并对即将发布的DeepSeek-V4模型架构进行前瞻性推测。内容聚焦于稀疏化技术的演进,从MoE到Attention的全面优化,并结合最新论文预测其可能采用的技术组合,为理解下一代大模型的技术方向提供独特视角。

猜一猜DeepSeek-V4的模型架构智能速览

  • DeepSeek的研发路线以稀疏化为核心,从MoE的持续优化到Attention的深度变革。

  • V4的Attention架构可能融合DSA、mHC和Engram三大技术以提升效率。

  • 预计模型总参数量将达到2T至2.5T,激活参数约70B,兼顾性能与部署。

  • MoE结构预计变化不大,而Engram将成为模型Scale的新突破口。

  • RL后训练或将引入流形约束(Manifolds Constraint)来提升训练效率与稳定性。

猜一猜DeepSeek-V4的模型架构精华内容

从MoE到Attention,DeepSeek的模型演进路径清晰可见。基于此,其下一代模型V4的架构轮廓也逐渐浮出水面,核心看点在于稀疏化技术的深度融合与参数规模的全新突破。

稀疏化演进之路

DeepSeek的模型迭代始终围绕“稀疏”这一主旋律展开,旨在突破内存墙的限制。在FFN部分,其MoE(Mixture of Experts)结构历经三代演进:V1引入64个路由专家和2个共享专家;V2将路由专家增至160个,并优化了路由与负载均衡策略;V3则将专家数扩展至256个,通过专家分组和新通信范式DeepEP,实现了更高效的训练。

在攻克FFN后,稀疏化的焦点转向了计算复杂度随序列长度平方增长的Attention机制。从压缩KV访存带宽的MLA,到原生稀疏注意力NSA,再到V3.2采用的简化版DSA,DeepSeek通过滑动窗口与Token选择机制,在保持性能的同时显著降低了计算成本。

V4架构核心猜想

预测DeepSeek-V4的Attention模块将是一个组合体,核心包括DSA、mHC和Engram。DSA(Dynamic Sparse Attention)负责高效地筛选重要Token,保证注意力计算的稀疏性。mHC(Manifolds Constraint Head)则可能通过双随机矩阵约束,解决了类似哈希聚类技术在训练中的稳定性问题,为模型性能提供保障。

Engram作为条件记忆机制,是此次Scale的关键。它通过将N-gram信息嵌入上下文,并以门控方式与原始注意力结合,为复杂Token分配更多计算资源。其多头哈希设计的低复杂度特性,甚至允许部分计算被卸载到CPU,从而在不显著增加GPU算力负担的前提下,实现模型规模的扩张。

参数规模与部署

基于Engram的技术特性,DeepSeek-V4的总参数量有望达到2T至2.5T的规模。其中,核心的Attention与MoE模块预计在1.5T左右,激活参数量维持在70B附近,以保证推理速度。配合DSA,模型的Hidden_size可能扩展至12K至16K,进一步挖掘性能潜力。

Engram部分因可利用CPU内存,其参数规模或达到1T。这种设计使得模型总规模虽大,但核心计算压力可控。同时,也存在推出一个200B至300B参数“小尺寸”模型的可能性,该模型主干和Engram均缩小规模,对单机或多卡国产算力平台更为友好,更易于大规模商用部署。

后训练技术展望

在强化学习后训练方面,DeepSeek以往的GRM和R3工作展现了其在Reward Model设计和训推对齐上的创新。展望V4,一个值得关注的方向是利用mHC背后的流形约束思想来改进RL训练。

当前主流的On-Policy RL训练方式迭代速度慢、成本高。通过引入流形约束,构建高质量的Off-Policy算法,有望在保证效果的同时,大幅提升训练效率和稳定性。这可能是DeepSeek在模型对齐和能力提升领域的下一个重要突破点。

DeepSeek-V4若真如预测般融合多项前沿稀疏技术,无疑将再次刷新大模型的性能与效率边界。这套组合拳能否在实际应用中达到预期,并推动AI基础设施的演进,值得整个行业共同期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章