DeepSeek提出名为Engram的新稀疏化方法,旨在弥补当前MoE模型的不足。该方法通过引入条件性记忆模块,实现了静态知识的高效检索,在知识、推理及代码任务上均有显著提升,为下一代稀疏模型的发展提供了新思路。
智能速览
Engram是一种基于哈希的静态知识检索新方法。
它弥补了MoE模型仅依赖条件计算的不足。
在27B模型上,知识任务与推理能力显著增强。
机制上,它通过记忆模块加深网络推理深度。
其确定性寻址支持计算与内存的解耦。
该技术与多模态领域的DeepStack有异曲同工之妙。
精华内容
面对Transformer在知识检索上的原生缺陷,DeepSeek的Engram技术并非简单修补,而是一次对底层架构的精巧手术,旨在开辟一条全新的模型优化路径。
核心机制
Engram的核心是引入一个条件性记忆模块,通过基于哈希的N-gram嵌入,实现了O(1)复杂度的静态知识检索。这直接解决了Transformer因缺乏原生查找机制,而不得不低效模拟检索操作的问题。该方法可以被理解为一种“空间换时间,存储换计算”的策略,为模型植入一个高效的、可扩展的记忆组件。
性能提升
在27B参数量的模型上,Engram在保持同参数量和同计算量的前提下展现了卓越性能。它不仅在MMLU、CMMLU等知识密集型任务上提升显著,更在推理、代码与数学这类需要深度逻辑思考的任务中表现优异,证明了其通用性和有效性。
深度分析
机制分析表明,Engram通过将局部依赖关系卸载至记忆模块,有效增加了网络可用的推理深度。同时,它将注意力机制从处理局部信息中解放出来,使其能更专注于建模长程上下文依赖。这种分工提升了模型整体的逻辑连贯性和处理复杂问题的能力。
架构关联
这一架构改造思路与多模态领域的DeepStack技术有异曲同工之妙。例如Qwen2-VL通过将视觉词元注入模型内部不同层,实现了高效的深度融合。Engram同样是在模型内部进行精巧的、有理论依据的改造,展示了通过优化内部架构来提升模型效率的成功范式。
DeepSeek Engram的提出,不仅是一次性能上的胜利,更揭示了条件性记忆作为下一代稀疏模型基础模块的巨大潜力。这种架构层面的创新,为大模型的持续演进提供了新的方向。未来的模型架构会如何演进?