开年伊始,人工智能公司DeepSeek接连发布重磅研究论文,引发业界广泛关注。这些研究并非简单地追逐模型参数的增长,而是深入AI架构的底层,针对大规模模型训练中的稳定性、效率和推理能力等核心痛点,提出了一系列创新解决方案。
最新的一篇论文于元旦发布,由创始人梁文锋参与署名,提出了一种名为“流形约束超连接”(mHC)的全新神经网络架构。这项研究旨在解决一个困扰大模型训练的顽固问题。过去,为了提升模型性能,研究者们尝试了“超连接”(HC)技术,即拓宽网络中的信息通道。这好比将原来的一条数据管道扩建成多条并行管道,虽然增强了信息处理能力,但也带来了严重隐患:由于缺乏约束,信息在多层传递中容易被无限放大或衰减,导致训练过程极不稳定,甚至崩溃。

DeepSeek提出的mHC架构,巧妙地解决了这一矛盾。它沿用了拓宽通道的设计,但引入了一套“交通规则”——通过名为“双随机矩阵流形”的数学结构进行约束。一个通俗的比喻是,传统的超连接就像一个可以随意调节音量的调音台,很容易导致声音失真或消失;而mHC则好比一个总音量恒定的调音台,你可以调整不同音轨的分配,但整体能量保持不变。这种设计恢复了传统残差连接的“恒等映射”特性,确保了信号在深层网络中稳定传播。实验证明,mHC在仅增加约6.7%的训练时间开销下,就实现了显著的性能提升和卓越的训练稳定性,为更大规模模型的开发铺平了道路。
mHC的发布只是DeepSeek近期一系列技术突破的缩影。不久前,其关于DeepSeek-R1推理模型的研究成果登上了国际顶级期刊《自然》(Nature)的封面。这不仅是中国大模型研究首次获此殊荣,也标志着主流大语言模型首次通过完整的同行评审并发表于权威期刊,打破了AI行业长期以来依赖技术博客和排行榜发布成果、缺乏独立验证的“黑箱”模式。《自然》杂志对此评价称,这一空白“终于被DeepSeek打破”。该论文详细披露了仅靠强化学习(RL)就能激发大模型复杂推理能力的方法,并公开了其训练成本远低于业界普遍预期的数字,挑战了“只有巨额投入才能打造顶级AI”的传统认知。
除了在模型推理和架构稳定性上取得进展,DeepSeek还针对大模型处理长文本的效率瓶颈,发布了另外两项关键研究。

一项是名为“上下文光学压缩”(Contexts Optical Compression)的创新思路,体现在其DeepSeek-OCR模型中。面对长文本输入导致计算量和内存需求呈指数级增长的难题,DeepSeek反其道而行之:不再让模型逐字“阅读”文本,而是先将整页文字渲染成一张图像,再让视觉模型去“看图识字”。由于图像能以更少的“视觉Token”包含海量文字信息,这种方法实现了惊人的压缩效果。实验数据显示,在10倍压缩率下,文字识别准确率仍能保持在97%。这一思路不仅为OCR(光学字符识别)提供了新范式,更被特斯拉前AI总监Andrej Karpathy等专家看好,认为其可能从根本上改变AI处理信息的方式,为解决超长上下文问题开辟了全新路径。

另一项则是DeepSeek稀疏注意力(DSA)机制,其理论基础源自北大与DeepSeek合作并获得ACL 2024(注:原文有2025年的笔误)最佳论文奖的“原生稀疏注意力”(NSA)研究。该技术通过一个“闪电索引器”快速定位文本中的关键信息节点,让模型只与这些少数关键节点进行精细的注意力计算,从而将处理长文本的计算复杂度从平方级大幅降低到接近线性级。这一机制已应用于DeepSeek-V3.2等新模型中,在几乎不损失性能的前提下,显著提升了长文本的训练和推理效率。

综合来看,DeepSeek开年发布的系列新论文,展现出一条清晰的技术路线:聚焦于AI基础架构的核心问题,通过底层算法和工程优化,系统性地解决模型训练的稳定性、效率和可扩展性难题。从改造残差连接到革新注意力机制,再到探索全新的信息压缩范式,这些研究共同指向一个目标——构建更强大、更高效、更经济的下一代基础模型。