大模型普遍采用的MoE架构存在原生缺陷,缺乏高效的知识查找机制,导致记忆与计算相互干扰。DeepSeek新开源的Engram模块直面此痛点,通过分离记忆与计算,为大模型引入“条件记忆”能力,有望从根本上提升模型处理知识的效率,开启“记忆-计算协同”的新范式。
智能速览
DeepSeek发布新论文并开源核心模块Engram,梁文锋参与署名。
当前主流的MoE架构存在缺陷,缺乏原生的知识查找机制。
Engram通过分离记忆与计算,为大模型引入“条件记忆”新维度。
该架构转变被视为大模型从计算密集走向记忆-计算协同的范式革命。
业界普遍猜测,Engram或将成为DeepSeek V4模型的核心技术。
精华内容
DeepSeek开源的Engram模块,不仅仅是一次技术优化,更可能是一次深刻的范式变革。它试图解决大模型发展中一个根深蒂固的矛盾。
MoE的内在矛盾
过去两年,MoE(混合专家模型)成为大模型扩容的主流方案。其原理是通过激活不同“专家”来处理不同任务,实现模型容量与计算成本的平衡。然而,MoE架构存在一个根本性缺陷:Transformer本身不具备原生的知识查找机制。这意味着模型就像一个博学的天才,脑中却没有一本字典,每次调用知识时都需要从零开始推理,无法像查字典一样快速获取。静态知识的存储与动态推理的计算被混杂在同一个参数空间,二者相互干扰,限制了模型的知识处理效率。
记忆与计算的解耦
DeepSeek提出的Engram模块,其核心思路是“把记忆和计算分开”。如果说MoE解决的是“条件计算”问题,即决定何时调用哪个专家,那么Engram则旨在解决“条件记忆”问题,即决定何时检索哪条知识。它为模型构建了一个可扩展的外部记忆系统,让模型能够像查表一样直接访问知识,而无需每次都进行复杂的参数推理。这种设计使得知识存储与逻辑推理各司其职,互不干扰,从而极大地提升了处理效率。
新架构的深远影响
这不仅仅是一次技术层面的优化,更是一次深远的范式转变。Engram的引入,标志着大模型架构正从过去纯粹的“计算密集”模式,迈向“记忆-计算协同”的新阶段。通过为模型增加一个全新的“记忆稀疏性”维度,它有望解决长期以来困扰大模型的知识更新成本高、幻觉频发等问题。这一架构创新为构建更强大、更高效、更可靠的下一代人工智能模型提供了全新的技术路径。
DeepSeek开源Engram,为AI社区提供了一个解决大模型知识处理瓶颈的全新思路。这次从“计算”到“记忆”的架构演进,是否会成为下一代大模型的标配?它将如何重塑AI应用的未来?这些都值得持续关注。