DeepSeek V4架构提前曝光:靠“查算分离”或将终结算力竞赛

源自41位全网作者

01-15 07:26

近期,人工智能公司DeepSeek发布了一篇由其创始人梁文锋署名、与北京大学合作的技术论文,并开源了名为“Engram”的全新架构模块,引发了业界的广泛关注。由于时间点临近传闻中DeepSeek V4模型的发布,外界普遍猜测,这一技术突破可能提前揭示了V4的核心架构。

这项研究直面了当前主流大模型架构(包括混合专家模型MoE)的一个根本性难题。尽管MoE通过“条件计算”让模型在不显著增加计算量的情况下扩展了参数规模,但其本质仍是Transformer架构。这类架构缺乏原生的“知识查找”机制,导致模型在处理事实性、静态的知识时效率低下。例如,当模型被问及“法国的首都是哪里?”时,它并非像人一样直接从记忆中提取答案,而是通过多层神经网络进行复杂的矩阵运算来“推导”或“重建”这个事实。这种方式好比每次计算都得先重背一遍乘法口诀,是对宝贵计算资源的极大浪费。

DeepSeek V4架构提前曝光:靠“查算分离”或将终结算力竞赛

DeepSeek提出的Engram模块,旨在通过“查算分离”的思路来解决这一问题。其核心思想是为大模型外挂一个高效的“记忆体”或“电子脑”,专门负责存储和检索静态知识。这个记忆体被命名为Engram,源于神经科学中的“记忆痕迹”。

具体而言,Engram模块将传统的N-gram(一种统计语言模型方法)与现代哈希技术结合,构建了一个庞大的、可扩展的知识查找表。当模型遇到固定的词组、实体名称或常见模式时,它不再需要通过复杂的神经网络去“计算”答案,而是通过Engram进行近似O(1)时间复杂度的哈希查找。O(1)复杂度意味着,无论这个“记忆体”存储的知识有多庞大,检索速度几乎是恒定的,这极大地提升了效率。

这种设计使得大模型的内部职责分工更加明确:Engram模块负责“死记硬背”,承担起知识存储和快速检索的任务;而Transformer和MoE专家则从繁重的记忆负担中解放出来,可以专注于它们更擅长的动态计算、逻辑推理和创造性生成等复杂任务。简而言之,MoE解决了“怎么少算”的问题,而Engram则解决了“别瞎算”的问题,让模型“该查的查,该算的算”。

实验结果验证了这一架构的巨大潜力。在参数总量和计算量(FLOPs)严格相等的情况下,集成了Engram的27B(270亿)参数模型,其综合性能显著优于纯MoE架构的基线模型。有趣的是,这种提升不仅体现在知识问答等“记忆型”任务上,在通用推理、数学和代码生成等需要复杂逻辑能力的领域,性能增益甚至更为显著。研究分析认为,这是因为Engram接管了早期网络层的模式重建工作,相当于为模型处理复杂任务“有效加深了网络深度”,使得注意力机制能更专注于全局和长程的依赖关系。

更具颠覆性的是Engram在工程实现上带来的优势。传统MoE模型的专家路由选择依赖于前一层的计算结果,因此所有专家参数都必须存放在昂贵的GPU显存中。而Engram的查找索引仅由输入文本决定,具有“确定性”。这一特性使得庞大的Engram记忆表可以被卸载到成本更低、容量更大的主机内存CPU RAM)中,在推理时通过预取机制异步加载,几乎不增加GPU的推理开销。这意味着,未来大模型的“知识容量”可以低成本地大规模扩展,而不再被昂贵的GPU显存“卡脖子”。

在研究中,团队还发现了一个有趣的“U型缩放定律”(U-shaped scaling law)。该定律揭示了在固定的参数预算下,将资源在负责计算的MoE专家和负责记忆的Engram模块之间进行分配时,存在一个最优的“黄金比例”。这为未来稀疏大模型的设计提供了科学的指导原则,证明了“计算”与“记忆”的协同是比单一路径更优的扩展方向。

综合以上信息,外界普遍认为,Engram模块很可能成为DeepSeek下一代模型V4的核心技术基础。从V2的MLA注意力机制到V3的MoE优化,再到如今的Engram,DeepSeek展现出一条清晰的、通过架构创新提升模型效率和能力的演进路线。如果V4成功集成这一“查算分离”的架构,它不仅将在性能上实现飞跃,更有可能在部署成本和可扩展性上建立起新的行业标杆,推动大模型技术从“算力竞赛”走向更加智能和高效的架构设计时代。

内容由AI生成

精选参考来源

1. 【#DeepSeekV4架构或提前曝光#】#DeepSeek开源大模型记忆模块##DeepSeek发布梁文锋署名论文#D...

【#DeepSeekV4架构或提前曝光#】#DeepSeek开源大模型记忆模块##DeepSeek发布梁文锋署名论文#D... 【DeepSeek新论文发布了,梁文锋署名!这一次,他们联手北大直接瞄准

2. 【#DeepSeek开源大模型记忆模块# #DeepSeekV4架构或提前曝光#】#DeepSeek发布梁文锋署名论文#...

【#DeepSeek开源大模型记忆模块# #DeepSeekV4架构或提前曝光#】#DeepSeek发布梁文锋署名论文#... 【DeepSeek节前开始蓄力!最新论文直接给Transformer加上

3. 【#DeepSeek开源大模型记忆模块##DeepSeekV4架构或提前曝光#】#DeepSeek发布梁文锋署名论文#D...

【#DeepSeek开源大模型记忆模块##DeepSeekV4架构或提前曝光#】#DeepSeek发布梁文锋署名论文#D... 【DeepSeek新论文发布了,梁文锋署名!这一次,他们联手北大直接瞄准

4. #deepseekv4或引入全新记忆架构# DeepSeek V4有望搭载全新记忆架构,核心创新在于引入独立的Engra...

#deepseekv4或引入全新记忆架构# DeepSeek V4有望搭载全新记忆架构,核心创新在于引入独立的Engra... DeepSeek V4有望搭载全新记忆架构,核心创新在于引入独立的En

5. DeepSeek-V4 技术架构提前曝光! 大家都知道现在的大模型 MoE 架构是把AI的推理能力和知识都融合到了每个 ...

DeepSeek-V4 技术架构提前曝光! 大家都知道现在的大模型 MoE 架构是把AI的推理能力和知识都融合到了每个 ... DeepSeek-V4 技术架构提前曝光! 大家都知道现在的大模型 Mo

6. 【梁文锋又发论文,DeepSeek V4浮出水面?】 #ai超级工厂##梁文锋署名新论文曝光##DeepSeekV4或引...

【梁文锋又发论文,DeepSeek V4浮出水面?】 #ai超级工厂##梁文锋署名新论文曝光##DeepSeekV4或引... 【梁文锋又发论文,DeepSeek V4浮出水面?】 梁文锋昨天又发论

7. DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光? #DeepSeek发布梁文锋署名论文#Engram机制,...

DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光? #DeepSeek发布梁文锋署名论文#Engram机制,... DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光? Engr

8. 梁文锋署名新论文曝光:DeepSeek V4 或引入全新记忆架构

梁文锋署名新论文曝光:DeepSeek V4 或引入全新记忆架构 梁文锋署名新论文曝光:DeepSeek V4 或引入全新记忆架构DoNews1768265883 DoNews1月13日消息,今日凌晨

9. 有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么?

有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么? 兄弟们,坐稳了,大的真要来了。外媒《The Information》刚刚捅出一个猛料。DeepSeek V4 定

10. #DeepSeekV4被曝春节前后发布#AI圈炸了!据The Information爆料,DeepSeek V4预计2月...

#DeepSeekV4被曝春节前后发布#AI圈炸了!据The Information爆料,DeepSeek V4预计2月... AI圈炸了!据The Information爆料,DeepSeek V4

11. 梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4架构,其最大的特点,可以简单理解为给大模型装了个...

梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4架构,其最大的特点,可以简单理解为给大模型装了个... 梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4

12. DeepSeek发布Engram新架构,实现查算分离或用于V4

DeepSeek发布Engram新架构,实现查算分离或用于V4 DeepSeek发布Engram新架构,实现查算分离或用于V4未来图灵1768268453 1月13日凌晨,DeepSeek在其GitH

13. #DeepSeek新模型能否再次爆火# 继此前凭高性价比开源模型一战成名,DeepSeek近期动作频频,开源Engram...

#DeepSeek新模型能否再次爆火# 继此前凭高性价比开源模型一战成名,DeepSeek近期动作频频,开源Engram... 继此前凭高性价比开源模型一战成名,DeepSeek近期动作频频,开源E

14. 刚刚,DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光?

刚刚,DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光? 刚刚,DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光?InfoQ1768267959 作者 | 冬梅 今天凌晨,喜欢

15. 【#DeepSeek新模型能否再次爆火#】网传DeepSeek将于近期发布新模型DeepSeek V4,今日凌晨开源的全...

【#DeepSeek新模型能否再次爆火#】网传DeepSeek将于近期发布新模型DeepSeek V4,今日凌晨开源的全... 【】网传DeepSeek将于近期发布新模型DeepSeek V4,今日凌

16. #梁文锋署名新论文曝光##DeepSeekV4或引入全新记忆架构# DeepSeek节前开始蓄力!最新论文直接给Tra...

#梁文锋署名新论文曝光##DeepSeekV4或引入全新记忆架构# DeepSeek节前开始蓄力!最新论文直接给Tra... DeepSeek节前开始蓄力!最新论文直接给Transformer加

17. 【#DeepSeek新模型能否再次爆火#】 网传DeepSeek将于近期发布新模型DeepSeek V4,而在今日凌晨,...

【#DeepSeek新模型能否再次爆火#】 网传DeepSeek将于近期发布新模型DeepSeek V4,而在今日凌晨,... 【】 网传DeepSeek将于近期发布新模型DeepSeek V4,而在

18. #DeepSeek新模型能否再次爆火#网传DeepSeek即将发布新模型DeepSeek V4,而今日凌晨,官方率先释放...

#DeepSeek新模型能否再次爆火#网传DeepSeek即将发布新模型DeepSeek V4,而今日凌晨,官方率先释放... 网传DeepSeek即将发布新模型DeepSeek V4,而今日凌晨,官

19. DeepSeek发布新论文,可能是V4核心技术。DeepSeek Engram是 DeepSeek 刚刚开源的一项重要研...

DeepSeek发布新论文,可能是V4核心技术。DeepSeek Engram是 DeepSeek 刚刚开源的一项重要研... DeepSeek发布新论文,可能是V4核心技术。DeepSeek Eng

20. DeepSeek V4诞生前夜?梁文锋署名新论文发布

DeepSeek V4诞生前夜?梁文锋署名新论文发布 DeepSeek V4诞生前夜?梁文锋署名新论文发布华尔街见闻1768306664 这是一场关于AI“大脑皮层”的重构。长期以来,Transfor

21. 有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么?

有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么? 这个暗示来自于mHC的scaling实验,DeepSeek团队称:mHC在大规模场景中的有效性在他们内部的大规模

22. #deepseek新模型能否再次爆火# 从 R1 的全球爆火,到 V3.2 正面硬刚 GPT-5,DeepSeek 基本...

#deepseek新模型能否再次爆火# 从 R1 的全球爆火,到 V3.2 正面硬刚 GPT-5,DeepSeek 基本... 从 R1 的全球爆火,到 V3.2 正面硬刚 GPT-5,DeepSe

23. DeepSeek论文上新!下一代大模型实现“记忆分离”,V4不远了?

DeepSeek论文上新!下一代大模型实现“记忆分离”,V4不远了? DeepSeek论文上新!下一代大模型实现“记忆分离”,V4不远了?第一财经1768274790 继去年底发布一篇新论文后,1月1

24. 刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了

刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了 刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了机器之心Pro1768270157 机器之心编辑部就在十几个小时前,D

25. 【手撕 mHC】详解DeepSeek残差链接mHC进化之路(超长文、附代码)

【手撕 mHC】详解DeepSeek残差链接mHC进化之路(超长文、附代码) 小冬瓜AIGC | X-R1开源框架 | 现高校LLM对齐研究 原创课程帮助学员拿下OpenAI, Meta, 字节SEE

26. #DeepSeekV4架构或提前曝光#【#DeepSeek开源大模型记忆模块##DeepSeek发布梁文锋署名论文#】D...

#DeepSeekV4架构或提前曝光#【#DeepSeek开源大模型记忆模块##DeepSeek发布梁文锋署名论文#】D... 】DeepSeek于12日晚发布新论文《Conditional Memo

27. DeepSeek又发新论文了,也是有梁文峰署名的一篇!github.com/deepseek-ai/Engram/看上去...

DeepSeek又发新论文了,也是有梁文峰署名的一篇!github.com/deepseek-ai/Engram/看上去... DeepSeek又发新论文了,也是有梁文峰署名的一篇!github.co

28. DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危 DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危新智元1768011475 编辑:桃子 定慧【新智

29. 如何评价DeepSeek发布梁文锋署名论文,提出「条件记忆」及Engram记忆检索架构?有哪些亮点?

如何评价DeepSeek发布梁文锋署名论文,提出「条件记忆」及Engram记忆检索架构?有哪些亮点? 理论上不如字节 Seed 的 UltraMem 优雅。我读 UltraMem 论文的时候就和 Ge

30. 科技昨夜今晨0111:DeepSeek V4大模型被曝春节前后发布

科技昨夜今晨0111:DeepSeek V4大模型被曝春节前后发布 科技昨夜今晨0111:DeepSeek V4大模型被曝春节前后发布IT之家1768090773 “科技昨夜今晨”时间,大家好,现在是

31. #DeepSeek近期正大量招人#【#DeepSeekV4或降低显存成本#】虽然距离春节还有些时日,但国内科技圈的节奏似...

#DeepSeek近期正大量招人#【#DeepSeekV4或降低显存成本#】虽然距离春节还有些时日,但国内科技圈的节奏似... 】虽然距离春节还有些时日,但国内科技圈的节奏似乎已经提前进入了假期模式,

32. Deepseek-ai深夜开源Engram存算分离模块-技术解析与工程实践指南

Deepseek-ai深夜开源Engram存算分离模块-技术解析与工程实践指南 看到网上不少人都在谈论deepseek开源的Engram,刚好最近某微服务社区也有找我咨询过AI推理面建设相关,也谈一下

33. DeepSeek 计划二月中旬发布新模型 DeepSeek-V4,有哪些技术亮点?能第二次震惊世界吗?

DeepSeek 计划二月中旬发布新模型 DeepSeek-V4,有哪些技术亮点?能第二次震惊世界吗? DeepSeek绝对会在2月份发布新模型,就像黑神话在8月份绝对会放发布新的游戏信息,中国人就喜

34. DeepSeek开启大规模招聘 论文暗示DeepSeek V4雏形?

DeepSeek开启大规模招聘 论文暗示DeepSeek V4雏形? DeepSeek开启大规模招聘 论文暗示DeepSeek V4雏形?CNMO科技1768384475 【CNMO科技消息】1月14

35. 梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷

梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷 编辑:编辑部刚刚 ,DeepSeek新论文发布了,梁文锋署名!这一次,他们联手北大直接瞄准了「记忆」,是Trans

36. DeepSeek V4深夜炸场!CPU能当GPU用,AI部署成本直接砍90%?

DeepSeek V4深夜炸场!CPU能当GPU用,AI部署成本直接砍90%? DeepSeek V4深夜炸场!CPU能当GPU用,AI部署成本直接砍90%?在书斋沉浸知识的海洋1768389540

37. DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危 编辑:桃子 定慧每逢假期,必发新品。Information爆料称,DeepSeek将计划在2月中旬,也正是春节前后,正式发布

38. 为V4铺路?DeepSeek开源记忆模块刺痛硅谷,国外网友:我放弃抄谷歌了

为V4铺路?DeepSeek开源记忆模块刺痛硅谷,国外网友:我放弃抄谷歌了 为V4铺路?DeepSeek开源记忆模块刺痛硅谷,国外网友:我放弃抄谷歌了智猩猩1768332698 智猩猩AI整理编辑:

39. DeepSeek发布梁文锋署名新论文 开源相关记忆模块Engram

DeepSeek发布梁文锋署名新论文 开源相关记忆模块Engram DeepSeek发布梁文锋署名新论文 开源相关记忆模块Engram财联社1768266308 【DeepSeek发布梁文锋署名新论文

40. DeepSeek V4爆料:春节档GPT/Claude编程危

DeepSeek V4爆料:春节档GPT/Claude编程危 春节临近,今年DeepSeek又要给世界一点震撼了。外媒The Information消息称,两位直接了解该计划的知情人士向其透露,2月中

41. 梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷

梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷 梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷36氪1768267586 刚
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章