大模型在处理静态知识时常浪费算力。DeepSeek开源的Engram框架通过分离静态记忆与动态推理,以极低成本提升模型效率,为构建更强大的AI提供了新思路。
智能速览
Engram框架将静态记忆与动态推理分离,实现O(1)知识查找
三项关键创新:分词器压缩、多头哈希、上下文感知门控
U型缩放定律:约25%参数分配给Engram,性能最优
系统级优化:可将100B参数的嵌入表卸载到主机内存
实证结果:逻辑推理与长文本处理能力大幅提升
精华内容
Engram究竟如何通过分离记忆与计算,实现效率与性能的双重飞跃?下面将深入其核心机制与实证成果。
什么是Engram
Engram的核心思想是将“静态记忆”与“动态推理”分离,作为一个独立模块为AI提供O(1)级知识查找能力。它通过三项创新实现:分词器压缩将有效词汇量减少23%,提升查找密度;多头哈希利用确定性函数映射上下文,避免内存爆炸和哈希冲突;最关键的是上下文感知门控,它利用当前隐藏状态过滤检索到的记忆,抑制与上下文冲突的噪声,确保集成的高精度。
U型缩放定律
在固定参数预算下,DeepSeek发现参数在“大脑”(MoE计算)和“书本”(Engram记忆)间的分配存在U型缩放定律。纯MoE模型会浪费参数记忆静态事实,而记忆模块过大会损害推理能力。实验表明,将约20%-25%的稀疏参数预算分配给Engram,能达到最佳性能平衡点。基于此定律扩展的270亿参数模型,在同等算力下表现远超传统MoE基准。
突破显存瓶颈
Engram不仅是算法革新,更是工程胜利。与MoE的动态路由不同,Engram的确定性查找使系统能预知所需内存槽。这允许将高达1000亿参数的嵌入表完全卸载到更便宜的主机内存(CPU DRAM)中。系统通过PCIe总线异步预取数据,实验证明其吞吐量损失可忽略不计(<3%),从而突破了昂贵的GPU显存限制,近乎无限地扩展了模型的“记忆”容量。
推理能力实测
Engram虽为记忆设计,却意外地大幅提升了模型的推理能力。在BBH逻辑推理任务上,Engram-27B模型提升了+5.0分,MATH任务提升+2.4分。其原理是Engram分担了早期层的记忆重构压力,让网络能专注于复杂逻辑推导,相当于增加了“有效深度”。在长文本“大海捞针”测试中,其准确率从84.2%飙升至97.0%,因为注意力机制被释放去处理全局长程依赖。
Engram框架的出现,标志着稀疏模型架构进入新阶段。它证明了将记忆与计算解耦是构建更高效、更强大AI的关键路径。未来,这种设计思路或将成为下一代模型的标准配置。