Transformer模型处理固定知识时存在计算浪费。DeepSeek新论文提出的‘条件记忆’及Engram模块,通过高效查表机制为模型装上‘记忆库’。此设计在同等算力下显著提升知识、推理等任务表现,并能利用CPU内存解决大模型存储瓶颈,为下一代稀疏模型提供了新思路。
智能速览
DeepSeek新论文提出“条件记忆”,为Transformer模型引入高效查表机制。
Engram模块将模型静态记忆与动态计算分离,显著提升知识、推理和代码能力。
实验发现,MoE与Engram的最佳资源分配遵循U型规律,混合模型性能最优。
该设计可将巨大记忆表置于CPU内存,利用计算重叠隐藏通信延迟,几乎不影响速度。
Engram模型在长文本处理任务上表现更优,能释放注意力机制关注全局信息。
精华内容
传统模型靠计算硬“记”,新架构则教模型如何聪明“查”。Engram模块的提出,正是为了解决这一核心痛点,它通过分离存储与计算,让模型的每一份算力都用在刀刃上。
Engram工作原理
Engram模块的核心思想是为模型增加一个高效的查表功能。它在特定Transformer层后插入分支,分为检索与融合两步。检索阶段,模型会根据当前输入的后缀n-gram(如最近2-3个词),通过多级哈希函数从一个巨大的静态嵌入表中快速定位对应的向量。为解决哈希冲突和一词多义问题,模型会利用Transformer层的隐藏状态作为上下文,通过一个门控机制计算出一个0到1的标量,动态判断检索到记忆的可靠性并进行加权融合,最终将结果残差连接回主干路径。
性能提升关键
研究通过严谨的稀疏预算分配实验发现,模型性能呈现一个U型曲线。纯MoE模型或纯Engram模型并非最优选择,二者存在互补性。当将约20%到25%的稀疏参数预算分配给Engram时,模型综合性能达到峰值。基于此构建的Engram-27B模型,在各项任务上均超越了同参数量同FLOPs的MoE-27B模型。例如,在常识知识测试MMLU上高出3.0分,在复杂推理任务BBH上提升更是高达5.0分,证明该架构能显著增强模型的知识调用与推理能力。
系统实现优势
Engram模块在系统层面具有独特优势。由于其检索过程是确定性的,CPU可以提前预取后续计算所需的嵌入向量,与GPU的Transformer层计算实现时间重叠,从而隐藏通信延迟。更重要的是,这使得规模巨大的Engram记忆表可以放置在成本更低的CPU内存中,而非昂贵的GPU显存。实验证明,即便将千亿参数的Engram层放在CPU内存,推理吞吐量也仅下降不到3%。这种存储与计算的分离,为扩展大模型容量提供了极具性价比的方案。
对长上下文的影响
Engram模块对模型处理长文本的能力也有显著提升。通过将识别局部固定模式(如人名、地名、成语)的任务交给高效的Engram模块,Transformer的注意力机制被解放出来,使其能够更专注于理解更长距离的依赖关系和全局语义结构。在长上下文扩展训练后,同等训练损失的Engram-27B模型在长文本检索与理解任务上,全面超越了MoE-27B模型,证明该架构在处理长序列信息方面具有内在优势。
DeepSeek的这项工作,不仅在模型架构上提出了创新的“条件记忆”维度,更在系统层面实现了算法与硬件的高效协同。它证明了通过巧妙的稀疏设计,可以在不增加计算成本的前提下,大幅提升大模型的能力。未来,这种计算与记忆分离的范式或将引领新一轮大模型架构的演进。