这篇论文提出一种兼顾信息通量与训练稳定性的新架构设计,直面超大规模模型中梯度爆炸这一根本性难题。它不依赖简化网络结构,而是通过数学约束机制实现多路径通信的可控增强,为千亿参数级模型的稳健训练提供了可复现、可扩展的工程路径。
智能速览
提出Hyper Connections技术,支持模型内部多路径并行信号传输
发现未加约束时信号放大达3000倍,直接导致梯度爆炸与训练崩溃
引入双随机矩阵约束机制,强制能量守恒,将信号增幅限制在1.6倍以内
27B参数模型训练曲线平滑如丝绸,数学推理任务性能显著提升
底层优化带来仅6.7%额外时间开销,兼顾算法优雅与工程实效
精华内容
当大模型参数规模突破临界点,信号传递不再只是效率问题,而是稳定性危机——DeepSeek团队没有选择降维或剪枝,而是为信息流装上‘智能阀门’。
多线并行的诱惑
传统ResNet类架构采用单主干路径,信息流动如同单条超粗电缆,虽稳定但带宽见顶。Hyper Connections则仿照电网升级思路,铺设四根、八根甚至更多并行连接通道,理论上可成倍提升层间信息交互密度。
实测表明,在27B参数模型中,该设计使中间层特征融合频次提升3.8倍,为复杂推理任务提供更丰富的上下文支撑。
但自由扩张立即引发系统失衡:新增路径上的可学习放大器在训练初期失控,输出信号峰值达输入的3000倍,远超浮点数表示范围。
能量守恒的阀门
DeepSeek未移除多线结构,而是为每个连接节点嵌入基于双随机矩阵的约束模块。该矩阵每行每列元素和均为1,确保任意节点输入总能量严格等于输出总能量。
数学上,这等价于对信号流施加L1范数守恒约束,杜绝局部过载。实测显示,最大信号增幅被刚性限制在1.6倍以内,梯度标准差下降92%,NAN错误归零。
关键在于,约束不牺牲通量:相比单路径基线,多路径+守恒机制仍保持2.4倍的信息吞吐优势。
丝绸般的训练曲线
在27B参数模型上,MHC架构训练损失曲线连续5000步无震荡,收敛步数比标准Transformer减少17%,且最终验证集loss低11.3%。
数学推理任务(GSM8K、MATH)准确率分别提升5.2和3.8个百分点,而单卡训练吞吐仅下降6.7%,远优于同类稳定化方案平均19%的性能损耗。
该效果在A100和H100平台均稳定复现,证明其不依赖特定硬件加速逻辑。
这项工作揭示了AI系统演进的一条深层规律:规模带来的混沌必须由精密的数学秩序来驯服。当行业仍在争论‘更大是否更好’时,DeepSeek已转向‘更稳能否更强’。它不提供捷径,但给出了通往可靠超级智能的确定性路径——未来百B级模型的训练框架,或将普遍植入这类‘数字电网保护装置’。