DeepSeek开源新论文与模块Engram,提出“查—算分离”机制,通过引入可扩展查找记忆结构,在同等算力下显著提升模型表现。这一架构创新有望解决传统大模型参数与算力难以平衡的痛点,或成为下一代模型的核心技术。
智能速览
DeepSeek开源Engram模块,提出“查—算分离”新机制
Engram利用哈希N-Gram嵌入,实现O(1)复杂度的快速记忆检索
该机制将记忆职责从神经网络计算中卸载,大幅提升参数效率
Engram与MoE协同工作,分别负责记忆查找与逻辑推理
网友推测该架构可能被DeepSeek V4模型采纳
精华内容
现有的大模型架构往往混淆了记忆与计算,DeepSeek Engram试图打破这一僵局,重构模型底层逻辑。
传统架构困境
现有主流大语言模型基于Transformer和MoE结构,将事实性记忆与逻辑推理计算混合在一起。当模型需要存储更多知识时,必须增加参数量,导致计算成本同步激增。MoE架构虽然缓解了算力压力,但在处理“死记硬背”任务时效率依然低下,本质上是用高成本的矩阵运算模拟简单的查表检索,造成极大的算力浪费。
查算分离机制
Engram意为“记忆痕迹”,采用了现代化的哈希N-Gram嵌入技术。它将输入的Token序列进行切片,通过哈希算法映射到可学习的查找表中。这种查找具有确定性且时间复杂度为O(1),意味着无论存储多少记忆片段,检索速度几乎恒定,算力消耗极低,实现了将记忆职责从深度神经计算中卸载。
双系统协同
Engram提供了一个新的稀疏性轴,与MoE形成互补。Engram负责海量知识的存储与快速检索,位于架构早期;MoE专家则摆脱记忆负担,专注于深层推理与合成。两者分工明确,在27B实验模型中,Engram占用大量参数但推理消耗极少,优化了整体参数效率。
架构级提升
这种设计不仅优化了参数效率,还开启了从纯参数扩张向高效架构设计的转变。通过将静态记忆查找与神经推理结合,模型在知识调用、代码和数学等任务上表现显著提升,为本地部署高性能模型提供了新的技术路径,被视作更“智能”的架构设计。
Engram的发布标志着大模型架构设计进入新阶段,通过“查算分离”实现了效率与能力的双重突破。若DeepSeek V4确实采用此架构,将预示着推理性能的质变。这种技术路线是否会被业界广泛跟进,值得持续关注。