张大妈

DeepSeek Engram:大模型稀疏性新维度

源自小红薯:AIGC前沿派

01-15 19:16

Transformer模型因缺乏原生检索机制,在重建静态知识时效率低下。DeepSeek新作Engram通过引入条件内存,为大型语言模型稀疏性提供了全新维度,旨在与条件计算范式协同,在不牺牲效率的前提下显著提升模型性能。

DeepSeek Engram:大模型稀疏性新维度智能速览

  • Engram引入“条件内存”作为LLM稀疏性的新维度,补充现有条件计算范式。

  • 其核心模块基于现代化N-gram嵌入,支持O(1)复杂度的静态知识查找。

  • Engram-27B在知识、推理、代码等多项任务上显著超越纯MoE基线模型。

  • 通过上下文感知门控机制,动态调制检索内容,确保语义对齐。

  • 该架构将局部依赖委托给查找,释放注意力容量,极大提升长上下文处理能力。

DeepSeek Engram:大模型稀疏性新维度精华内容

Engram的核心在于将静态知识查找与动态计算分离,为大型语言模型开辟了一条新的性能提升路径。

架构革新

大型语言模型普遍采用的条件计算范式,如混合专家模型,主要在计算维度上实现稀疏。Engram的创新在于开辟了内存维度,通过引入“条件内存”与之协同。其核心是Engram模块,一个对经典N-gram嵌入的现代化改造,能够以O(1)的复杂度进行静态知识查找,有效弥补了Transformer架构因缺乏原生检索机制而导致的低效知识重建问题。

关键机制

Engram的实现依赖三大关键机制。首先是稀疏检索,它通过哈希N-gram将局部上下文映射到静态嵌入表,并利用分词器压缩和多头哈希技术减少冲突。其次是上下文感知门控,该机制利用当前隐藏状态作为查询,动态调制检索到的嵌入,当检索内容与上下文语义冲突时,门控值会趋近于零,确保了信息的一致性。最后,系统级优化通过确定性寻址,支持训练时的参数分片和推理时的预取,实现了内存与计算的高效解耦。

性能实测

在27B参数规模的模型上,Engram展现出显著的性能优势。与纯MoE基线相比,Engram-27B在知识密集型任务MMLU上提升了3.4个点,在复杂推理任务BBH上提升了5.0个点,在代码与数学任务MATH上也取得了2.4个点的提升。尤为突出的是其在长上下文场景的表现,在Multi-Query NIAH测试中,准确率从84.2%大幅提升至97.0%,证明其处理长序列信息的能力得到了质的飞跃。

深层原理

Engram之所以能带来如此显著的提升,其原理在于优化了模型内部的工作流程。它将重建局部静态模式的负担从主干网络的早期层中剥离,这使得网络的有效深度增加,浅层网络的功能等效于MoE中更深的网络。同时,通过将局部依赖的处理委托给高效的查找模块,Engram释放了宝贵的注意力机制容量,使其能更专注于处理全局的、复杂的上下文关系。

Engram通过条件内存与条件计算的成功协同,验证了内存查找可作为下一代稀疏模型的核心建模原语。这一发现不仅提升了模型性能,也为未来如何更高效地设计大模型架构提供了新方向,其可扩展性尤其值得关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章