Transformer架构因缺乏原生知识检索机制而效率低下。DeepSeek与北京大学联合提出的Engram模块,通过引入条件记忆,为模型配备了一个可高效查询的外部知识库,在多项测试中显著超越传统模型,或引发下一代AI建模范式的变革。
智能速览
Engram是模型的外部知识库,实现O(1)常数时间复杂度查找。
通过U型缩放定律,优化神经计算与静态内存的权衡。
270亿参数Engram模型在同参数同算力下性能优于传统MoE模型。
该模块不仅提升知识检索,也增强了推理、编程和数学能力。
Engram解放了注意力机制,大幅提升长上下文处理能力。
精华内容
Engram模块的核心突破在于其高效的检索机制与模型计算路径的深度融合,这背后是精巧的工程设计与 scaling law 的发现。
O(1)常数时间检索
Transformer模型检索知识如同翻阅无索引的百科全书,效率低下。Engram模块通过对经典N-gram嵌入的改造,实现了O(1)时间复杂度的查找,即查询时间不随知识库规模增大而增加。这好比从一个可直接跳转的电子通讯录中找联系人,无论人数多少,都是瞬间完成,为模型提供了高速的外部记忆访问能力。
U型缩放定律
模型参数是有限的资源,如何在动态计算与静态记忆间分配成为关键。研究者通过构建稀疏性分配问题,发现了一个U型缩放定律。该定律揭示了神经计算与静态记忆之间存在一个最优权衡点,而非简单的此消彼长。基于此定律构建的270亿参数Engram模型,在严格的同参数、同算力条件下,其性能显著超越了传统的混合专家模型。
超越知识检索
Engram的价值不仅限于知识密集型任务。分析发现,它减轻了模型早期网络层的静态重建负担,相当于让浅层网络具备了更深层网络的表达能力,从而有效加深了复杂推理的深度。这一改变使得模型在通用推理、编程乃至数学领域也获得了显著的性能提升,证明了其架构的通用性。
解放注意力
传统注意力机制需要同时处理局部依赖和全局上下文。Engram通过将相邻词汇间的固定搭配、语法结构等局部依赖委托给高效查找操作,成功解放了注意力。这使得注意力可以更专注于全局信息处理,长上下文检索能力因此大幅增强,例如在MultiQuery NIAH任务中,准确率从84.2%提升至97.0%。
基础设施感知
Engram在设计上充分考虑了工程部署的效率。其确定性寻址机制通过哈希函数等技术,实现了可预测的内存访问模式。这使得系统可以在运行时智能预取可能需要的数据到高速缓存中,且该操作的开销可以忽略不计,确保了模块在实际应用中的高效性与可行性。
Engram模块为解决大模型知识存储与检索的瓶颈提供了新思路,其性能提升和范式潜力预示着条件记忆将与条件计算同等重要,或可从DeepSeek的布局中窥见V4模型的未来。