DeepSeek最新发布的Engram架构,为大型语言模型的知识管理提供了新思路。它通过创新的“存算分离”机制,将静态知识存储与动态推理过程解耦,旨在显著提升模型性能。借助其开源代码与深度解析图,可以清晰地洞悉这一技术如何运作,以及它为LLM发展带来的潜在价值。
智能速览
Engram的核心是存算分离机制,将记忆从计算中剥离。
通过N-gram哈希从外部Embedding表中检索并注入知识。
门控机制是控制记忆信息是否流入模型的关键。
架构设计巧妙融合了外部检索与内部计算。
体现了DeepSeek坚定的稀疏化技术路线。
记忆注入后通过短卷积进行局部平滑处理。
精华内容
要理解Engram如何实现存算分离,关键在于剖析其源码所揭示的内部工作流,特别是双流交汇与门控控制。
存算分离设计
传统Transformer模型将知识压缩在权重中,而Engram架构提出了一种新的范式。它不再完全依赖模型权重存储静态知识,而是将其转移到外部的“字典”——一个巨大的Embedding表中。这种设计让模型主干专注于推理计算,实现了静态记忆与动态推理的明确分工。
这一理念与DeepSeek坚持的稀疏化路线一脉相承,此前MoE实现了条件计算,而Engram则实现了条件记忆。
核心工作原理
Engram的实现核心是一个N-gram哈希机制。当模型进行推理时,主干网络产生的隐藏状态会作为Query。同时,该机制通过N-gram哈希从外部记忆库中检索出对应的Key和Value。
这一过程是静态查找,不参与模型的梯度更新,保证了知识检索的高效性。
双流汇聚架构
Engram最精妙之处在于将“检索”与“计算”结合。在架构图中,可以清晰地看到两个信息流:上方是模型主干传递的Hidden States流,下方是Engram Memory提供的记忆流。
这两股信息流最终汇聚于一个门控机制,该机制是整个系统的决策核心。
门控与记忆注入
门控机制通过计算主干流的Query与记忆流的Key之间的相似度,来决定是否“打开闸门”。只有当两者高度相关时,对应的记忆信息才会被允许注入到模型的主干中。
这种按需检索的方式,避免了无关知识的干扰,确保了注入信息的精准性,是实现条件记忆的关键一步。
短卷积平滑处理
当记忆信息通过门控后,并不会直接输出,而是会经过一个短卷积层进行处理。这一步的主要作用是进行局部平滑,确保新注入的记忆信息能与模型原有的上下文信息更自然地融合。
这种细节处理提升了模型输出的连贯性和稳定性,是优化用户体验的重要环节。
DeepSeek Engram通过存算分离,为大型模型高效扩展知识库提供了可行的技术路径。这种架构设计不仅优化了推理性能,也为未来模型的可控性和知识更新能力带来了新的想象空间。它是否会成为下一代大模型的标准范式之一,值得持续关注。