当前主流的混合专家模型虽能扩展容量,但在知识查询上存在固有短板。DeepSeek 团队提出的 Engram 模块,通过引入“条件记忆”这一全新稀疏维度,不仅在知识检索上提升了模型表现,更在通用推理、代码数学及长文本处理等领域带来意想不到的显著增益,为下一代大模型设计提供了新视角。
智能速览
Engram模块通过“条件记忆”弥补了Transformer的知识查询短板。
研究发现一条U型scaling law,可优化神经与静态存储的权衡。
该模块在通用推理和代码数学等任务上表现提升尤为突出。
机理分析表明其能释放网络深度,增强注意力全局处理能力。
Engram实现了高效运行,额外开销几乎可以忽略不计。
精华内容
Engram 的核心在于对传统计算模式的颠覆性思考,它并非单纯增加参数,而是通过引入静态记忆,让模型学会“查字典”而非“死记硬背”。
记忆即稀疏
传统混合专家模型通过条件计算扩展容量,但缺乏原生的知识查询机制,导致计算效率低下。DeepSeek 团队为此引入了“条件记忆”概念,并通过 Engram 模块实现。该模块改造了经典的 N-gram 嵌入,实现了 O(1) 复杂度的快速查询。这相当于为模型配备了一个高效的外部记忆体,使其能直接检索静态知识,而非通过冗余计算来模拟。
超越MoE的增益
为验证效果,研究团队构建了“稀疏性分配”问题,并发现了一条 U 型 scaling law,用于指导神经计算与静态存储的最优配比。据此他们将 Engram 扩展至 270 亿参数。在参数量和计算量一致的前提下,其表现全面优于纯 MoE 基准模型。尤其在知识检索上,MMLU 提升 3.4,CMMLU 提升 4.0。
推理能力跃升
最令人意外的是,Engram 的增益远不止于知识记忆。在通用推理任务上,BBH 提升 5.0,ARC-Challenge 提升 3.7。在代码与数学领域,HumanEval 提升 3.0,MATH 提升 2.4。这表明,通过将局部依赖和静态知识重构任务交给 Engram,主干网络的前几层被解放出来,从而有效增加了网络处理复杂推理的深度。
释放注意力
机理分析进一步揭示了 Engram 的优势。通过将局部依赖关系交由查询处理,模型的注意力机制被释放出来,可以更专注于处理全局上下文信息。这一改变显著提升了模型的长文本检索能力,例如在多查询的“大海捞针”测试中,准确率从 84.2 大幅提升至 97.0。
高效且实用
Engram 不仅在理论上先进,在工程实现上也极具优势。其确定性的寻址方式,允许系统从主机内存进行运行时预取,使得产生的额外开销几乎可以忽略不计。这种基础设施感知的高效率设计,让 Engram 具备了大规模部署的实用潜力。
DeepSeek Engram 的探索,证明了静态记忆与神经计算结合的巨大潜力。它不仅为现有大模型性能瓶颈提供了突破性的解决方案,更可能成为下一代稀疏模型不可或缺的建模原语。未来,这种“会查字典”的模型会如何改变我们与AI的交互方式?