本文基于DeepSeek过往模型的技术路线,深入剖析其研发核心脉络,并对即将发布的DeepSeek-V4模型架构进行前瞻性推测。内容聚焦于稀疏化技术的演进,从MoE到Attention的全面优化,并结合最新论文预测其可能采用的技术组合,为理解下一代大模型的技术方向提供独特视角。
智能速览
DeepSeek的研发路线以稀疏化为核心,从MoE的持续优化到Attention的深度变革。
V4的Attention架构可能融合DSA、mHC和Engram三大技术以提升效率。
预计模型总参数量将达到2T至2.5T,激活参数约70B,兼顾性能与部署。
MoE结构预计变化不大,而Engram将成为模型Scale的新突破口。
RL后训练或将引入流形约束(Manifolds Constraint)来提升训练效率与稳定性。
精华内容
从MoE到Attention,DeepSeek的模型演进路径清晰可见。基于此,其下一代模型V4的架构轮廓也逐渐浮出水面,核心看点在于稀疏化技术的深度融合与参数规模的全新突破。
稀疏化演进之路
DeepSeek的模型迭代始终围绕“稀疏”这一主旋律展开,旨在突破内存墙的限制。在FFN部分,其MoE(Mixture of Experts)结构历经三代演进:V1引入64个路由专家和2个共享专家;V2将路由专家增至160个,并优化了路由与负载均衡策略;V3则将专家数扩展至256个,通过专家分组和新通信范式DeepEP,实现了更高效的训练。
在攻克FFN后,稀疏化的焦点转向了计算复杂度随序列长度平方增长的Attention机制。从压缩KV访存带宽的MLA,到原生稀疏注意力NSA,再到V3.2采用的简化版DSA,DeepSeek通过滑动窗口与Token选择机制,在保持性能的同时显著降低了计算成本。
V4架构核心猜想
预测DeepSeek-V4的Attention模块将是一个组合体,核心包括DSA、mHC和Engram。DSA(Dynamic Sparse Attention)负责高效地筛选重要Token,保证注意力计算的稀疏性。mHC(Manifolds Constraint Head)则可能通过双随机矩阵约束,解决了类似哈希聚类技术在训练中的稳定性问题,为模型性能提供保障。
Engram作为条件记忆机制,是此次Scale的关键。它通过将N-gram信息嵌入上下文,并以门控方式与原始注意力结合,为复杂Token分配更多计算资源。其多头哈希设计的低复杂度特性,甚至允许部分计算被卸载到CPU,从而在不显著增加GPU算力负担的前提下,实现模型规模的扩张。
参数规模与部署
基于Engram的技术特性,DeepSeek-V4的总参数量有望达到2T至2.5T的规模。其中,核心的Attention与MoE模块预计在1.5T左右,激活参数量维持在70B附近,以保证推理速度。配合DSA,模型的Hidden_size可能扩展至12K至16K,进一步挖掘性能潜力。
Engram部分因可利用CPU内存,其参数规模或达到1T。这种设计使得模型总规模虽大,但核心计算压力可控。同时,也存在推出一个200B至300B参数“小尺寸”模型的可能性,该模型主干和Engram均缩小规模,对单机或多卡国产算力平台更为友好,更易于大规模商用部署。
后训练技术展望
在强化学习后训练方面,DeepSeek以往的GRM和R3工作展现了其在Reward Model设计和训推对齐上的创新。展望V4,一个值得关注的方向是利用mHC背后的流形约束思想来改进RL训练。
当前主流的On-Policy RL训练方式迭代速度慢、成本高。通过引入流形约束,构建高质量的Off-Policy算法,有望在保证效果的同时,大幅提升训练效率和稳定性。这可能是DeepSeek在模型对齐和能力提升领域的下一个重要突破点。
DeepSeek-V4若真如预测般融合多项前沿稀疏技术,无疑将再次刷新大模型的性能与效率边界。这套组合拳能否在实际应用中达到预期,并推动AI基础设施的演进,值得整个行业共同期待。