张大妈

DeepSeek发布Engram新架构,实现查算分离或用于V4

源自今日头条:未来图灵

02-17 15:39

传统大模型将事实记忆与逻辑推理混合处理,限制了效率。DeepSeek新发布的Engram架构创新性地提出‘查算分离’,通过独立的记忆检索模块,在不增加计算负担的情况下显著扩展记忆容量,为模型性能提升开辟了新路径。

DeepSeek发布Engram新架构,实现查算分离或用于V4智能速览

  • DeepSeek开源Engram架构,核心是实现事实记忆与逻辑计算的‘查算分离’。

  • 其采用哈希N-Gram嵌入技术,查找复杂度仅为O(1),能高效扩展记忆容量。

  • 实验模型在知识、推理及代码数学等多项基准测试中表现均获显著提升。

  • 社区推测Engram或将成为下一代模型DeepSeek V4的核心技术基础。

DeepSeek发布Engram新架构,实现查算分离或用于V4精华内容

Engram架构的提出,并非简单的性能优化,而是对大模型内部信息处理逻辑的一次根本性重构。它如何将记忆与计算解耦,实现效率飞跃?

架构革新

传统大模型将事实记忆与逻辑推理混合于Transformer结构中,导致处理效率受限。Engram架构则另辟蹊径,提出‘查算分离’理念。其核心是在Transformer层早期引入一个独立的可扩展查找记忆模块,专门负责事实性知识的模式重构。

这种设计将模型功能一分为二:Engram模块承担海量知识的存储与快速检索,而后续的MoE(混合专家)网络则专注于复杂的逻辑推理任务。职责分离让各模块能更专注于自身优势,从而提升整体性能。

技术实现

Engram实现高效记忆检索的关键在于其采用的哈希N-Gram嵌入技术。该技术将知识条目编码,使得查找复杂度达到O(1)常数级别,意味着无论记忆库多大,检索速度几乎不受影响。

在27B参数的实验模型中,Engram模块虽然占据了大量参数用于存储记忆,但在实际推理时仅消耗极少的计算资源。这种“以空间换时间”的策略,使得模型能在不显著增加推理延迟和计算成本的前提下,大幅扩展其事实知识容量。

性能表现

实验数据验证了Engram架构的有效性。在同等参数规模和算力消耗的条件下,集成Engram的模型在多个标准基准测试上均表现出色。

具体来看,在MMLU、CMMLU等知识密集型任务上,模型准确率提升了3至4个百分点。更值得注意的是,在BBH、ARC-Challenge等侧重逻辑推理的任务上,提升幅度更为显著。此外,模型在代码生成与数学解题方面的能力也得到了明显改善,显示出其在通用性上的巨大潜力。

DeepSeek Engram架构的提出,为大模型发展提供了一条全新的技术路径,即在追求规模之外,通过优化内部结构实现效率与性能的双重突破。这一‘查算分离’的设计理念,或将深刻影响未来大模型的演进方向。这项技术能否成为行业标准,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章