张大妈

DeepSeek新论文曝光Engram架构,或为V4基础

源自公众号:数据派THU

01-14 10:33

DeepSeek开源新论文与模块Engram,提出“查—算分离”机制,通过引入可扩展查找记忆结构,在同等算力下显著提升模型表现。这一架构创新有望解决传统大模型参数与算力难以平衡的痛点,或成为下一代模型的核心技术。

DeepSeek新论文曝光Engram架构,或为V4基础智能速览

  • DeepSeek开源Engram模块,提出“查—算分离”新机制

  • Engram利用哈希N-Gram嵌入,实现O(1)复杂度的快速记忆检索

  • 该机制将记忆职责从神经网络计算中卸载,大幅提升参数效率

  • Engram与MoE协同工作,分别负责记忆查找与逻辑推理

  • 网友推测该架构可能被DeepSeek V4模型采纳

DeepSeek新论文曝光Engram架构,或为V4基础精华内容

现有的大模型架构往往混淆了记忆与计算,DeepSeek Engram试图打破这一僵局,重构模型底层逻辑。

传统架构困境

现有主流大语言模型基于Transformer和MoE结构,将事实性记忆与逻辑推理计算混合在一起。当模型需要存储更多知识时,必须增加参数量,导致计算成本同步激增。MoE架构虽然缓解了算力压力,但在处理“死记硬背”任务时效率依然低下,本质上是用高成本的矩阵运算模拟简单的查表检索,造成极大的算力浪费。

查算分离机制

Engram意为“记忆痕迹”,采用了现代化的哈希N-Gram嵌入技术。它将输入的Token序列进行切片,通过哈希算法映射到可学习的查找表中。这种查找具有确定性且时间复杂度为O(1),意味着无论存储多少记忆片段,检索速度几乎恒定,算力消耗极低,实现了将记忆职责从深度神经计算中卸载。

双系统协同

Engram提供了一个新的稀疏性轴,与MoE形成互补。Engram负责海量知识的存储与快速检索,位于架构早期;MoE专家则摆脱记忆负担,专注于深层推理与合成。两者分工明确,在27B实验模型中,Engram占用大量参数但推理消耗极少,优化了整体参数效率。

架构级提升

这种设计不仅优化了参数效率,还开启了从纯参数扩张向高效架构设计的转变。通过将静态记忆查找与神经推理结合,模型在知识调用、代码和数学等任务上表现显著提升,为本地部署高性能模型提供了新的技术路径,被视作更“智能”的架构设计。

Engram的发布标志着大模型架构设计进入新阶段,通过“查算分离”实现了效率与能力的双重突破。若DeepSeek V4确实采用此架构,将预示着推理性能的质变。这种技术路线是否会被业界广泛跟进,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章