张大妈

Engram架构-这是一种基于可扩展查表的条件记 大家好。今天我们将深入探讨由DeepSeek-AI与北京大学联合提出的Engram架构1,2。这是一种基于可扩展查表的条件记忆机制1。我们的核心观点是:在大语言模型不断追求规模化的今天,除了传统的“条件计算”,我们还需要引入一个全新的维度——条件记忆,以开启模型稀疏性的新维度

源自抖音:向前的时代

02-19 13:35

在大语言模型追求规模化的背景下,传统的计算模式正面临效率瓶颈。Engram架构的提出,为这一挑战带来了全新的解决方案。它引入“条件记忆”概念,通过可扩展查表机制,高效处理静态知识,弥补了Transformer架构的短板,为模型稀疏性设计开辟了新维度,实现了计算与存储的深度解耦,让模型变得更智能、更高效。

Engram架构-这是一种基于可扩展查表的条件记 大家好。今天我们将深入探讨由DeepSeek-AI与北京大学联合提出的Engram架构1,2。这是一种基于可扩展查表的条件记忆机制1。我们的核心观点是:在大语言模型不断追求规模化的今天,除了传统的“条件计算”,我们还需要引入一个全新的维度——条件记忆,以开启模型稀疏性的新维度智能速览

  • Engram架构通过可扩展查表实现条件记忆。

  • 作为旁路模块,它实现了计算与存储的结构化分离。

  • 词表压缩与上下文感知门控是其性能关键。

  • 研究发现,20%-25%的参数预算用于记忆模块时模型性能最优。

  • 它能将长文本检索准确率从84.2%提升至97.0%。

  • 无限记忆范式提供了通过扩展存储持续提升模型上限的路径。

Engram架构-这是一种基于可扩展查表的条件记 大家好。今天我们将深入探讨由DeepSeek-AI与北京大学联合提出的Engram架构1,2。这是一种基于可扩展查表的条件记忆机制1。我们的核心观点是:在大语言模型不断追求规模化的今天,除了传统的“条件计算”,我们还需要引入一个全新的维度——条件记忆,以开启模型稀疏性的新维度精华内容

Engram的核心在于其精巧的设计哲学,它并非要取代Transformer,而是作为强大的辅助,通过结构化的分离与融合,让模型回归高效的本源。下面将深入其架构与优势。

架构设计

Engram作为一个旁路模块,与Transformer主干网络并行运作,其流程分为两个核心阶段。首先是基于多头哈希的确定性检索,随后通过上下文感知门控将检索结果与当前隐藏状态动态融合。这种设计实现了存储与计算的结构化分离。

该架构的性能源于两大创新。其一是词表压缩,通过满射投影函数,将原始Token映射为规范化ID,此举有效减少了23%的有效词表大小,显著提升了语义密度。其二是上下文感知门控,它利用当前隐藏状态作为Query来过滤检索噪声,当检索内容与上下文冲突时,门控信号会趋向于0,确保模型只吸收有效知识。

极致效率

Engram在工程上实现了计算与存储的深度解耦,带来了极致的系统效率。与MOE依赖运行时状态进行路由不同,Engram的检索索引仅取决于输入Token序列,具有强预测性。

这一特性使得系统能够从廉价的CPU内存中一步预取海量参数,并通过PCIE传输与GPU计算完全重叠。得益于此设计,即使是高达100B规模的参数,其卸载开销也能被控制在3%以下,极大地降低了推理成本。

性能验证

研究通过实验得出了一个核心科学发现:纯粹的计算并不足够,存储是必要的补充。在固定预算下,研究MOE专家与Engram记忆的分配比例,实验揭示了一条明显的U型曲线。当将约20%至25%的参数预算分配给Engram记忆时,模型性能达到最优,证明了简单查表机制的价值。

Engram也是长文本处理的神兵利器。通过将局部依赖卸载给查表模块,Attention机制得以更专注地处理全局上下文。在“大海捞针”测试中,Engram-27B模型将准确率从84.2%提升至97.0%,显著增强了长距离检索的稳健性。机理分析发现,它有效增加了模型的有效深度,使骨干网络能更早进入深层推理状态。

总而言之,Engram架构通过引入条件记忆,为AI模型的稀疏化设计开辟了新路径。它不仅性能超越同规模MOE模型,更通过高效知识检索释放了深层推理潜力。未来,将静态知识存储于廉价内存,算力专注于核心逻辑,这种模式或许正是构建高效AI的关键。我们是否正站在一个新架构时代的开端?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章