在2026年元旦,当许多人还沉浸在跨年的喜悦中时,DeepSeek团队发布了一篇重磅新论文,为人工智能领域带来了新的思考。这篇由创始人梁文锋参与署名的论文,题为《mHC:流形约束超连接》,没有宏大的叙事,而是聚焦于一个困扰大模型训练已久的底层技术难题,并提出了一个兼具优雅与实用的解决方案。
要理解这项工作的意义,需要先了解大模型训练中的一个基础构件——“残差连接”(Residual Connection)。这是近十年前由何恺明在ResNet中提出的经典设计,它像是在神经网络中开辟了一条“信息直通车”,确保数据在穿过层层网络时不会失真,从而让训练更深、更复杂的模型成为可能。这个设计凭借其出色的稳定性,在过去十年里几乎成为了所有主流AI模型的标配。

然而,为了追求更强的性能,研究者们后来提出了“超连接”(Hyper-Connections, HC)架构。这好比将单车道的“信息直通车”拓宽为多车道的“超级高速公路”,通过增加信息流的宽度和交互的复杂度,确实带来了显著的性能提升。但这种自由、无约束的“高速公路”也带来了致命隐患:信息在多车道间传递时,可能会被无限制地放大或衰减,导致信号爆炸或消失。实验数据显示,在没有约束的情况下,信号经过多层网络后,其放大倍数峰值可高达3000倍,这极易导致模型训练过程突然“崩溃”,也就是常说的“梯度爆炸”,使得之前的巨大算力投入付诸东流。

DeepSeek提出的mHC(流形约束超连接)架构,正是为了解决这一“性能与稳定性的两难困境”。其核心思想可以通俗地理解为:在保留“超级高速公路”宽阔优势的同时,为其装上了一套精密的“智能交通指挥系统”。
具体来说,mHC通过一种名为“流形约束”的数学方法,将超连接中负责信息流动的矩阵,约束在一个被称为“双随机矩阵”的特定数学结构上。这种矩阵有一个关键特性:它的每一行和每一列元素之和都恒等于1。这个看似简单的约束,从根本上保证了信息在网络中传递时其“总能量”是守恒的,既不会凭空爆炸,也不会无故消失。这样一来,mHC架构既享受了超连接带来的性能红利,又恢复了传统残差连接那宝贵的“恒等映射”稳定性。
实验结果有力地证明了mHC的有效性。在一个270亿参数规模的模型上,mHC不仅彻底解决了HC架构的训练不稳定问题,让训练过程平稳收敛,而且在BBH等复杂推理任务上,性能相较于不稳定的HC版本还进一步提升了2.1%至2.3%。更关键的是,实现这一切的代价极小:在扩展率为4的情况下,mHC仅带来了6.7%的额外训练时间开销。
这项工作展示了一条务实且高效的路径:在现有技术范式下,通过对底层架构进行精巧的数学和工程优化,依然能显著提升大模型训练的“基本功”。它不仅是对深度学习领域十年之久的残差连接范式的一次重要升级,也为业界提供了一个更稳定、低成本的基础组件,推动行业从单纯“堆算力”的竞赛,转向更加关注“精巧设计”的深度创新。通过解决这一具体而顽固的工程难题,mHC为构建下一代更强大、更可靠的基础模型铺平了道路,重新激发了学界对宏观架构设计的研究价值。