DeepSeek提出Engram架构,通过条件记忆机制将动态推理与静态知识分离,在同等参数和计算量下显著提升模型性能。这一创新为大语言模型的稀疏化提供了全新维度。
智能速览
Engram通过条件记忆实现动态推理与静态知识分离
在同等参数量下全面超越MoE模型,多项任务提升显著
采用哈希N-gram技术实现O(1)复杂度的知识检索
上下文感知门控机制确保知识精准融合
U型缩放定律揭示MoE与Engram的最优配比
确定性检索机制实现几乎无损的内存卸载
精华内容
Engram架构巧妙融合了经典N-gram与现代神经网络,通过条件记忆机制实现了模型能力的根本性突破。
架构原理
Engram的核心创新在于引入了条件记忆机制,将语言模型的双重特性分离处理。该架构设计了两个独立计算路径:一个负责逐步推理,另一个用于快速检索已学知识。这种设计让模型能针对不同任务选择更高效的计算方式,避免了传统MoE模型在处理常见模式时的计算浪费。
关键技术
Engram采用哈希N-gram技术,将N-gram映射到巨大嵌入表中,实现O(1)复杂度的快速查找。通过分词器压缩和多头哈希等技术,既保证了检索速度又提高了准确性。上下文感知门控机制根据当前语境动态调整知识融合比例,确保只有相关记忆被激活。
性能表现
在严格的同等参数(26.7B)和计算量条件下,Engram-27B全面超越MoE-27B。通用推理(BBH)提升5分,知识推理(ARC)提升3.7分,代码生成(HumanEval)提升3分,数学推理(MATH)提升2.4分,知识问答(MMLU)提升3分,中文知识(CMMLU)提升4分。
系统优势
Engram的确定性检索机制允许CPU与GPU并行工作,超过97%的参数可存储在CPU内存中。这种设计实现了几乎无损的内存卸载,显著提高了系统吞吐量,为模型扩展提供了可行性路径。
理论贡献
研究揭示了U型缩放定律,证明纯MoE并非最优解。在固定总参数和计算量下,MoE与Engram按特定比例混合可达到最佳性能,为稀疏模型设计提供了重要理论指导。
条件记忆为大语言模型稀疏化开辟了新方向,Engram架构证明了其在性能和效率上的双重优势。这一创新有望成为下一代稀疏化大模型的标准配置,推动语言模型向更高效、更强大的方向发展。