张大妈

模创观察 | DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?

源自公众号:MIC模创社区

01-16 18:45

DeepSeek最新发布的Engram技术开创性地提出了"查—算分离"机制,通过可扩展的查找记忆结构,在同等参数和算力条件下显著提升模型性能。这一架构创新有望重新定义大语言模型的设计范式,为AI领域带来重要突破。

模创观察 | DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?智能速览

  • Engram实现查算分离,用O(1)复杂度处理知识检索任务

  • 通过现代化哈希N-Gram嵌入,大幅降低记忆检索成本

  • 与MoE架构形成互补,MoE负责推理,Engram负责记忆

  • 在27B实验模型中展现了优异的参数效率

  • 确定性寻址技术可将嵌入表卸载到主机内存

  • 可能是DeepSeek V4模型的核心技术基础

模创观察 | DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?精华内容

传统大模型将记忆和计算混合处理,导致算力浪费。Engram通过分离这两种职责,让模型既拥有高效的记忆检索能力,又保持强大的推理能力,开启了大模型架构的新维度。

查算分离原理

Engram的核心创新在于将模型职责明确分工。传统Transformer架构中,参数同时承担事实记忆和逻辑推理双重职责,造成效率低下。Engram通过现代化的哈希N-Gram嵌入技术,将连续N个词组成的片段映射到可学习的查找表中,实现O(1)时间复杂度的确定性检索。

这种设计本质上是将"记忆职责"从深度神经计算中卸载出来。当模型需要回答"法国首都是哪里"这类事实性问题时,直接通过查表获得答案,而非通过昂贵的矩阵运算模拟。对于复杂的逻辑推理任务,则交由MoE专家系统处理。

实验数据显示,这种分离机制在不增加总参数量的前提下,显著提升了模型在知识调用、推理、代码、数学等任务上的表现。

技术架构设计

Engram模块位于Transformer层的早期阶段,负责"模式重构"功能。它根据当前上下文的隐向量,条件化地提取相关记忆片段,作为后续计算的"素材"。

架构上,Engram与MoE形成互补的双系统。MoE负责"计算密集型"的神经推理与复杂组合功能,Engram则处理"记忆查找型"的固定模式识别与重建。两者协同工作,既保证了计算效率,又维持了模型的知识容量。

在27B实验模型中,Engram模块可占用大量参数用于记忆存储,但实际推理时仅消耗极少算力。这种设计实现了参数与计算量的解耦,为大模型的高效部署提供了新思路。

与MoE的对比

Engram和MoE虽然都实现了稀疏性,但作用机制完全不同。MoE通过条件激活神经专家来降低活跃计算量,属于计算层面的优化;Engram则通过条件触发静态记忆查找来减少神经计算,属于记忆层面的优化。

从目标维度看,MoE追求条件激活,Engram实现条件触发;计算方式上,MoE进行dense计算,Engram执行O(1)查表;优化方向上,MoE降低神经计算量,Engram减少模式重建;作用位置上,MoE位于深层推理层,Engram在早期模式重建。

研究发现,MoE和Engram之间存在U形缩放规律,为两者之间的容量分配提供了理论指导。这种组合设计被认为是下一代大模型架构的重要发展方向。

实际应用价值

Engram的确定性寻址特性使其在本地部署场景中具有独特优势。由于查找表可以卸载到主机内存而不会显著增加推理开销,即使在GPU资源有限的环境下也能实现高效运行。

这种设计理念实际上是对传统NLP技术的现代化升级,将经典的n-gram嵌入与高效寻址机制、神经推理模块相结合,在技术可行性上具备明显优势。

业内观察者普遍认为,Engram很可能会成为DeepSeek V4模型的核心技术基础,预示着下一代AI模型将在记忆与推理协同方面实现架构级突破。

Engram技术标志着大模型架构设计从纯参数扩张向智能化分工的转变。通过查算分离的创新思路,它不仅解决了当前模型的效率瓶颈,更为未来AI系统的发展开辟了新路径。随着技术的成熟,我们能否期待更多类似的专业化架构创新?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章