针对大模型追求高拓扑复杂性时面临的训练不稳定问题,深度求索DeepSeek团队提出了流形约束超连接架构。该方案通过数学约束有效平衡了模型性能与稳定性,仅增加6.7%的开销,为下一代基础模型架构设计提供了新思路。
智能速览
针对超连接架构训练不稳定问题,DeepSeek提出流形约束解决方案。
利用双随机矩阵投影,确保信号强度守恒与跨层复合稳定性。
通过算子融合等工程优化,将额外训练开销控制在6.7%以内。
27B参数模型实测显示,该架构消除了损失突增,保持平滑训练。
在多项基准测试中超越传统模型,尤其在推理任务上表现显著。
精华内容
针对超连接架构的固有缺陷,DeepSeek通过引入流形约束,实现了在极低开销下对大模型训练稳定性的根本性保障。
超连接的不稳定性
长期以来,深度网络依赖于残差连接的恒等映射特性来保证信号无损传播和训练稳定。为了挖掘模型潜力,学术界提出的超连接架构虽然通过扩展残差流宽度提升了拓扑复杂度,但引入的可学习矩阵破坏了恒等映射机制。
跨层累积的矩阵乘法导致信号出现无界放大或衰减,在实际大规模训练中引发损失突增和梯度爆炸,同时成倍增加的显存访问与通信开销。
流形约束机制
DeepSeek团队提出的MHC架构,核心在于引入流形约束。该方法将残差映射矩阵投影到由双随机矩阵构成的波利亚多胞体上。由于双随机矩阵的行和与列和均为1,信号传播从无界线性变换转变为特征组合,从根本上保证了信号强度守恒。
此外,双随机矩阵在乘法运算下的封闭性,确保了跨多层复合映射的稳定性,完美恢复了类恒等映射特性。
工程优化与低开销
针对扩展残差流带来的巨大系统开销,团队实施了算子融合、重计算策略以及计算与通信重叠设计等工程级优化。实验数据显示,在扩展率为4倍的情况下,MHC引入的额外训练时间开销被控制在仅6.7%。
这一极低的成本使得该架构在工程上具备极高的实用价值,打破了超连接架构在大规模训练中的应用瓶颈。
实测效果稳且强
在27B参数规模的模型训练对比中,原始HC架构在约12000步时出现剧烈损失突增和梯度震荡,而MHC模型的损失下降曲线保持平滑,彻底消除了崩溃隐患。性能方面,27B MHC模型在8个基准测试中全面超越基线模型,并在BBH和DROP等强推理任务上显著优于未约束HC。
从3B到27B的缩放实验进一步证实了其优越的可扩展性。
DeepSeek的MHC架构成功解决了超连接在训练稳定性和扩展性上的核心难题。这一通过数学约束与工程优化结合的方案,为业界提供了兼顾性能与稳定性的新范式,有望推动社区对模型拓扑结构的进一步探索。