DeepSeek新架构Engram,破解Transformer记忆难题

源自公众号:36氪Pro

01-14 11:31

Transformer架构因缺乏原生记忆机制,大量计算被用于模拟检索,效率低下。DeepSeek提出的Engram模块,通过一个高效的确定性知识查找系统,将静态模式记忆与动态推理解耦,显著提升了模型在知识、推理等任务上的表现,并为大模型发展开辟了新路径。

DeepSeek新架构Engram,破解Transformer记忆难题

DeepSeek新架构Engram,破解Transformer记忆难题智能速览

  • Engram模块通过确定性知识查找,解决了Transformer的记忆难题。

  • 它将语言建模拆分为“组合推理”和“模式检索”两类任务。

  • 实验发现MoE与Engram之间存在U型扩展定律,需找到最优资源配比。

  • 在等参数等算力下,Engram-27B模型全面超越MoE基线。

  • 该架构有望被集成到DeepSeek下一代模型V4中。

DeepSeek新架构Engram,破解Transformer记忆难题精华内容

Transformer模型的记忆缺陷,是限制其效率和容量的核心瓶颈。DeepSeek的Engram模块,正是针对这一问题的创新解法,它通过引入独立的记忆轴,重塑了大模型的架构蓝图。

记忆的困境

当前大模型主流的MoE架构本质仍是Transformer,其核心问题在于缺少原生“知识查找”能力。许多本该像检索一样以O(1)复杂度解决的事,被迫用大量计算去模拟,效率极其低下。模型为识别“戴安娜,威尔士王妃”这样的固定实体,需要消耗多层注意力和FFN来逐步组合特征,计算成本高昂,且挤占了宝贵的表达空间。

Engram解法

Engram模块旨在将语言建模中的“模式检索”任务分离出来,交由一个可扩展的查表模块承担。它将经典哈希N-gram嵌入现代化,通过分词器压缩、多头哈希和上下文感知门控三个关键设计,实现了近似O(1)的确定性知识查找。门控机制能够智能判断是否采纳检索到的信息,从而将Transformer主干从记忆静态关联中解放出来,专注于更高级的组合与推理。

U型定律

研究意外发现,MoE(负责计算)与Engram(负责记忆)之间存在“U型scaling law”。当稀疏预算100%分配给MoE时,模型缺乏专用记忆,效率低下;当100%分配给Engram时,模型则损失了动态推理能力。两者之间存在一个最优分配比例ρ,使得模型性能达到峰值。实验还表明,在同等参数下,激进扩展Engram的内存容量能持续且可预测地带来收益。

性能实证

基于U型定律训练的Engram-27B模型,在严格的等参数、等FLOPs设定下,全面超越了MoE-27B基线。提升不仅体现在知识密集型任务上(MMLU+3.0, CMMLU+4.0),更体现在通用推理(BBH+5.0)、代码和数学(GSM8K+2.2, MATH+2.4)等领域。这证明了专用的知识查找原语比将所有稀疏预算都投入计算更高效。此外,长上下文性能也因注意力机制被解放而显著提升。

架构前瞻

DeepSeek Engram开辟了稀疏化的第二条路,让大模型进入“计算+记忆”双轴时代。MoE负责动态推理,Engram负责静态记忆,二者互补。该架构的确定性查表特性非常适合系统优化,可实现计算与存储的解耦。外界普遍预测,这项技术有很大概率被集成到春节档发布的DeepSeek V4中,若能实现,将是超越参数规模的架构范式跃迁。

DeepSeek Engram的提出,为大模型架构的演进提供了全新的“计算+记忆”双轴思路,在提升效率的同时增强了综合能力。若V4成功集成,将是一次重要的范式跃迁。这种架构变革,是否会成为下一代大模型的主流选择?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章