张大妈

Deepseek最新论文Engram #deepseek #ai #模型 #engram #transformer

源自抖音:damonZhang

02-22 13:14

DeepSeek提出Engram架构,通过条件记忆机制将动态推理与静态知识分离,在同等参数和计算量下显著提升模型性能。这一创新为大语言模型的稀疏化提供了全新维度。

Deepseek最新论文Engram #deepseek #ai #模型 #engram #transformer智能速览

  • Engram通过条件记忆实现动态推理与静态知识分离

  • 在同等参数量下全面超越MoE模型,多项任务提升显著

  • 采用哈希N-gram技术实现O(1)复杂度的知识检索

  • 上下文感知门控机制确保知识精准融合

  • U型缩放定律揭示MoE与Engram的最优配比

  • 确定性检索机制实现几乎无损的内存卸载

Deepseek最新论文Engram #deepseek #ai #模型 #engram #transformer精华内容

Engram架构巧妙融合了经典N-gram与现代神经网络,通过条件记忆机制实现了模型能力的根本性突破。

架构原理

Engram的核心创新在于引入了条件记忆机制,将语言模型的双重特性分离处理。该架构设计了两个独立计算路径:一个负责逐步推理,另一个用于快速检索已学知识。这种设计让模型能针对不同任务选择更高效的计算方式,避免了传统MoE模型在处理常见模式时的计算浪费。

关键技术

Engram采用哈希N-gram技术,将N-gram映射到巨大嵌入表中,实现O(1)复杂度的快速查找。通过分词器压缩和多头哈希等技术,既保证了检索速度又提高了准确性。上下文感知门控机制根据当前语境动态调整知识融合比例,确保只有相关记忆被激活。

性能表现

在严格的同等参数(26.7B)和计算量条件下,Engram-27B全面超越MoE-27B。通用推理(BBH)提升5分,知识推理(ARC)提升3.7分,代码生成(HumanEval)提升3分,数学推理(MATH)提升2.4分,知识问答(MMLU)提升3分,中文知识(CMMLU)提升4分。

系统优势

Engram的确定性检索机制允许CPU与GPU并行工作,超过97%的参数可存储在CPU内存中。这种设计实现了几乎无损的内存卸载,显著提高了系统吞吐量,为模型扩展提供了可行性路径。

理论贡献

研究揭示了U型缩放定律,证明纯MoE并非最优解。在固定总参数和计算量下,MoE与Engram按特定比例混合可达到最佳性能,为稀疏模型设计提供了重要理论指导。

条件记忆为大语言模型稀疏化开辟了新方向,Engram架构证明了其在性能和效率上的双重优势。这一创新有望成为下一代稀疏化大模型的标准配置,推动语言模型向更高效、更强大的方向发展。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章