传统大模型在处理静态模式化知识时,常因动态重建而消耗大量计算资源。DeepSeek-AI的最新研究提出了一种颠覆性的解决方案,通过将静态知识存储与动态计算分离,引入了名为Engram的条件记忆模块,显著提升了模型处理效率与性能,为大规模语言模型的稀疏化设计开辟了新维度。
智能速览
DeepSeek提出新稀疏化技术Engram,将静态知识与动态计算分离。
Engram通过哈希查找直接检索静态知识,避免逐层重建的低效。
实验表明,将部分稀疏预算分配给Engram能显著提升模型性能。
Engram与MoE技术互补,共同构成更高效的稀疏模型架构。
该研究使用了新型优化器Muon进行模型训练。
精华内容
大语言模型在处理模式化知识时,是否必须消耗大量计算进行重建?DeepSeek的研究给出了否定的答案,并提出了一种全新的架构设计,将记忆与计算分而治之。
静态知识的困境
传统Transformer架构在处理高度模式化的静态知识时效率较低。例如,为了理解“Diana, Princess of Wales”这样的实体,模型需要在多个网络层中费力地组合和重建token,将有限的计算深度消耗在繁重的记忆任务上,而非复杂的逻辑推理。这种动态重建静态知识的方式,被认为是造成计算资源浪费的关键原因之一。
Engram的解法
Engram模块的核心是结构性分离。它采用可扩展的N-gram查找机制,将输入token序列规范化压缩后,通过确定性哈希函数直接在稀疏嵌入表中查找对应的静态知识,实现了O(1)的复杂度检索。为解决哈希冲突与多义词噪声,Engram引入了上下文感知门控机制,利用当前隐藏状态动态调制检索结果,确保只在语义对齐时融合,让模型更专注于推理。
与MoE的协同效应
论文通过严谨的实验量化了Engram与MoE的协同关系。在固定总参数和激活参数(约3.8B)的约束下,研究发现验证损失与分配给MoE专家的稀疏容量比例呈显著的U形缩放定律。这意味着纯MoE模型并非最优解,将大约20%-25%的稀疏参数预算重新分配给Engram记忆模块,能取得最佳性能,证明了两者结构上的互补性。
Muon优化器的角色
在训练配置上,该研究同样体现了前沿性。所有对比模型均在2620亿token的相同数据集上训练。模型主干网络(注意力、MoE专家等)均采用了新型优化器Muon,而Engram模块的大规模稀疏嵌入参数则使用Adam,并设置了基线5倍的学习率且不施加权重衰减,确保了训练的高效与稳定。
DeepSeek的研究为大规模语言模型的设计提供了“分而治之”的新思路。通过Engram将静态记忆与动态计算解耦,不仅提升了模型效率,也为未来探索更优的稀疏化架构指明了方向。这种结构性分离是否会成为下一代大模型设计的标准范式,值得持续关注。