在大语言模型追求规模化的背景下,传统的计算模式正面临效率瓶颈。Engram架构的提出,为这一挑战带来了全新的解决方案。它引入“条件记忆”概念,通过可扩展查表机制,高效处理静态知识,弥补了Transformer架构的短板,为模型稀疏性设计开辟了新维度,实现了计算与存储的深度解耦,让模型变得更智能、更高效。
智能速览
Engram架构通过可扩展查表实现条件记忆。
作为旁路模块,它实现了计算与存储的结构化分离。
词表压缩与上下文感知门控是其性能关键。
研究发现,20%-25%的参数预算用于记忆模块时模型性能最优。
它能将长文本检索准确率从84.2%提升至97.0%。
无限记忆范式提供了通过扩展存储持续提升模型上限的路径。
精华内容
Engram的核心在于其精巧的设计哲学,它并非要取代Transformer,而是作为强大的辅助,通过结构化的分离与融合,让模型回归高效的本源。下面将深入其架构与优势。
架构设计
Engram作为一个旁路模块,与Transformer主干网络并行运作,其流程分为两个核心阶段。首先是基于多头哈希的确定性检索,随后通过上下文感知门控将检索结果与当前隐藏状态动态融合。这种设计实现了存储与计算的结构化分离。
该架构的性能源于两大创新。其一是词表压缩,通过满射投影函数,将原始Token映射为规范化ID,此举有效减少了23%的有效词表大小,显著提升了语义密度。其二是上下文感知门控,它利用当前隐藏状态作为Query来过滤检索噪声,当检索内容与上下文冲突时,门控信号会趋向于0,确保模型只吸收有效知识。
极致效率
Engram在工程上实现了计算与存储的深度解耦,带来了极致的系统效率。与MOE依赖运行时状态进行路由不同,Engram的检索索引仅取决于输入Token序列,具有强预测性。
这一特性使得系统能够从廉价的CPU内存中一步预取海量参数,并通过PCIE传输与GPU计算完全重叠。得益于此设计,即使是高达100B规模的参数,其卸载开销也能被控制在3%以下,极大地降低了推理成本。
性能验证
研究通过实验得出了一个核心科学发现:纯粹的计算并不足够,存储是必要的补充。在固定预算下,研究MOE专家与Engram记忆的分配比例,实验揭示了一条明显的U型曲线。当将约20%至25%的参数预算分配给Engram记忆时,模型性能达到最优,证明了简单查表机制的价值。
Engram也是长文本处理的神兵利器。通过将局部依赖卸载给查表模块,Attention机制得以更专注地处理全局上下文。在“大海捞针”测试中,Engram-27B模型将准确率从84.2%提升至97.0%,显著增强了长距离检索的稳健性。机理分析发现,它有效增加了模型的有效深度,使骨干网络能更早进入深层推理状态。
总而言之,Engram架构通过引入条件记忆,为AI模型的稀疏化设计开辟了新路径。它不仅性能超越同规模MOE模型,更通过高效知识检索释放了深层推理潜力。未来,将静态知识存储于廉价内存,算力专注于核心逻辑,这种模式或许正是构建高效AI的关键。我们是否正站在一个新架构时代的开端?