独家解读DeepSeek推出Engram为LLM装上“记忆库”,效率革命来了

源自今日头条:turgunAI实验室

02-17 15:37

大语言模型在处理信息时,常因重复计算固定模式而浪费算力。DeepSeek提出的Engram模块,通过为模型构建一个高效的“记忆库”,让模型学会即时查找而非重新计算。这项创新不仅显著提升了模型性能,更可能改变未来大型模型的设计范式。

独家解读DeepSeek推出Engram为LLM装上“记忆库”,效率革命来了智能速览

  • Engram作为条件记忆库,解决LLM重复计算静态模式的问题。

  • 通过哈希和门控机制,实现O(1)复杂度的知识快速检索。

  • 实验表明,将20%-25%参数分给Engram能显著降低模型损失。

  • Engram-27B模型在多项基准测试中全面超越同规模MoE基线。

  • Engram通过“外包”记忆任务,让主干网络更专注于动态推理。

独家解读DeepSeek推出Engram为LLM装上“记忆库”,效率革命来了精华内容

Engram的精妙之处在于其技术实现与设计哲学。它不是一个简单的附加组件,而是深度融合进模型架构的全新维度,其工作原理揭示了高效计算的另一种可能。

痛点与革新

当前主流Transformer架构在处理固定搭配、实体名称等高频静态信息时,缺乏高效的“记忆”机制,导致计算资源的严重浪费。

Engram模块的出现正是为了解决这一问题。它并非替代混合专家(MoE)系统,而是作为一个并行的条件记忆轴,像一个专门存储和检索高频N-gram模式的“外部知识库”,从而优化模型的整体计算效率。

技术核心

Engram通过精巧的设计实现高效运作。其核心是一个基于哈希的N-gram查找表,能以O(1)复杂度快速检索信息。

它采用多头部哈希技术将输入映射到素数桶以减少冲突,并使用深度卷积对上下文进行轻量处理。最关键的是其上下文感知门控机制,会生成一个0到1的标量,智能地决定有多少检索到的信息应被注入模型主干,实现了记忆信息与动态推理的动态融合。

稀疏分配

研究提出了“稀疏分配”的核心问题:在总参数量固定的情况下,如何在MoE专家和Engram记忆体之间进行最优分配?

实验给出了明确的答案:将大约20%-25%的稀疏参数预算从MoE重新分配给Engram,可以在保持相同激活参数量的前提下,显著降低模型的验证损失。这一发现证明,条件记忆与条件计算是互补关系,为模型设计提供了新的优化“旋钮”。

大规模效果

在2620亿token的大规模预训练中,Engram展现了卓越的性能。总参数量26.7B的Engram-27B模型,其语言建模损失从MoE-27B基线的2.091显著降至1.960。

在能力评估方面,Engram模型在知识(MMLU)、推理(ARC-C)、代码和数学(GSM8K)等多项基准上全面超越基线。例如,其MMLU得分从57.4提升至60.4。即便在扩展至32K长上下文后,Engram模型在复杂任务上的表现依然更优。

机制解析

通过Logit Lens等分析工具发现,Engram能够让模型的表示更快地趋于“预测就绪”状态。具体而言,Engram模型在第5层的表示,就与MoE基线模型在第12层的表示高度相似。

这有力地证明了Engram通过将静态模式的记忆任务“外包”,等效地增加了模型的有效推理深度,从而让主干网络可以更专注于处理复杂的动态推理和长程依赖建模。

Engram为大语言模型架构带来了重要的创新,它通过引入高效的条件记忆系统,实现了计算资源的智能分配。这不仅让模型在同等算力下表现更强,也为探索更高效的模型架构开辟了新方向,未来的模型会如何进化?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章