近期,人工智能公司DeepSeek发布了一篇由其创始人梁文锋署名、与北京大学合作的技术论文,并开源了名为“Engram”的全新架构模块,引发了业界的广泛关注。由于时间点临近传闻中DeepSeek V4模型的发布,外界普遍猜测,这一技术突破可能提前揭示了V4的核心架构。
这项研究直面了当前主流大模型架构(包括混合专家模型MoE)的一个根本性难题。尽管MoE通过“条件计算”让模型在不显著增加计算量的情况下扩展了参数规模,但其本质仍是Transformer架构。这类架构缺乏原生的“知识查找”机制,导致模型在处理事实性、静态的知识时效率低下。例如,当模型被问及“法国的首都是哪里?”时,它并非像人一样直接从记忆中提取答案,而是通过多层神经网络进行复杂的矩阵运算来“推导”或“重建”这个事实。这种方式好比每次计算都得先重背一遍乘法口诀,是对宝贵计算资源的极大浪费。

DeepSeek提出的Engram模块,旨在通过“查算分离”的思路来解决这一问题。其核心思想是为大模型外挂一个高效的“记忆体”或“电子脑”,专门负责存储和检索静态知识。这个记忆体被命名为Engram,源于神经科学中的“记忆痕迹”。
具体而言,Engram模块将传统的N-gram(一种统计语言模型方法)与现代哈希技术结合,构建了一个庞大的、可扩展的知识查找表。当模型遇到固定的词组、实体名称或常见模式时,它不再需要通过复杂的神经网络去“计算”答案,而是通过Engram进行近似O(1)时间复杂度的哈希查找。O(1)复杂度意味着,无论这个“记忆体”存储的知识有多庞大,检索速度几乎是恒定的,这极大地提升了效率。
这种设计使得大模型的内部职责分工更加明确:Engram模块负责“死记硬背”,承担起知识存储和快速检索的任务;而Transformer和MoE专家则从繁重的记忆负担中解放出来,可以专注于它们更擅长的动态计算、逻辑推理和创造性生成等复杂任务。简而言之,MoE解决了“怎么少算”的问题,而Engram则解决了“别瞎算”的问题,让模型“该查的查,该算的算”。
实验结果验证了这一架构的巨大潜力。在参数总量和计算量(FLOPs)严格相等的情况下,集成了Engram的27B(270亿)参数模型,其综合性能显著优于纯MoE架构的基线模型。有趣的是,这种提升不仅体现在知识问答等“记忆型”任务上,在通用推理、数学和代码生成等需要复杂逻辑能力的领域,性能增益甚至更为显著。研究分析认为,这是因为Engram接管了早期网络层的模式重建工作,相当于为模型处理复杂任务“有效加深了网络深度”,使得注意力机制能更专注于全局和长程的依赖关系。
更具颠覆性的是Engram在工程实现上带来的优势。传统MoE模型的专家路由选择依赖于前一层的计算结果,因此所有专家参数都必须存放在昂贵的GPU显存中。而Engram的查找索引仅由输入文本决定,具有“确定性”。这一特性使得庞大的Engram记忆表可以被卸载到成本更低、容量更大的主机内存(CPU RAM)中,在推理时通过预取机制异步加载,几乎不增加GPU的推理开销。这意味着,未来大模型的“知识容量”可以低成本地大规模扩展,而不再被昂贵的GPU显存“卡脖子”。
在研究中,团队还发现了一个有趣的“U型缩放定律”(U-shaped scaling law)。该定律揭示了在固定的参数预算下,将资源在负责计算的MoE专家和负责记忆的Engram模块之间进行分配时,存在一个最优的“黄金比例”。这为未来稀疏大模型的设计提供了科学的指导原则,证明了“计算”与“记忆”的协同是比单一路径更优的扩展方向。
综合以上信息,外界普遍认为,Engram模块很可能成为DeepSeek下一代模型V4的核心技术基础。从V2的MLA注意力机制到V3的MoE优化,再到如今的Engram,DeepSeek展现出一条清晰的、通过架构创新提升模型效率和能力的演进路线。如果V4成功集成这一“查算分离”的架构,它不仅将在性能上实现飞跃,更有可能在部署成本和可扩展性上建立起新的行业标杆,推动大模型技术从“算力竞赛”走向更加智能和高效的架构设计时代。