张大妈

DeepSeek新论文揭秘V4架构,条件记忆机制突破

源自公众号:维科网AI前沿社

01-14 13:44

DeepSeek最新发布的论文揭示了V4架构的技术突破,引入条件记忆作为下一代稀疏模型的核心建模原语。通过Engram模块实现的高效知识查找机制,在270亿参数规模下展现出超越传统MoE模型的性能,尤其在长上下文检索和通用推理领域表现突出。

DeepSeek新论文揭秘V4架构,条件记忆机制突破智能速览

  • DeepSeek引入条件记忆作为稀疏模型新轴

  • Engram-27B性能超越等参数等FLOPs的MoE基线

  • 训练与推理阶段分离的设计实现高效扩展

  • 多级缓存层次结构支持海量内存容量

  • 长上下文检索能力显著提升

  • 通用推理和代码数学领域提升明显

DeepSeek新论文揭秘V4架构,条件记忆机制突破精华内容

通过将静态模式存储与动态计算结构分离,Engram模块为Transformer主干网络提供了全新的增强机制,实现了计算效率与模型性能的双重突破。

架构设计创新

Engram模块的核心创新在于引入条件记忆机制,通过词汇投影层标识符实现规范化文本等价性处理。对于128k分词器,该设计使有效词汇量减少23%,大幅提升计算效率。模块采用受注意力机制启发的上下文感知门控机制,并引入短深度因果卷积扩展感受野和增强非线性表达能力。

系统分为训练和推理两个阶段:训练阶段将海量嵌入表分片到可用GPU,采用全对全通信原语跨设备检索;推理阶段则将Engram表卸载到主机内存,利用确定性检索逻辑实现异步预取传输。

扩展性能分析

研究团队基于经验推导的分配规则,将Engram扩展到数十亿参数规模,训练了四个模型进行对比实验。结果显示,Engram-27B仅使用82%的预训练FLOPs即可达到基线LongPPL性能,在RULER任务上准确率显著提升。

在相同预训练损失和FLOPs设置下,Engram-27B在所有指标上均显著优于基线模型。值得注意的是,这些提升不仅限于知识密集型任务,在一般推理以及代码和数学推理领域同样表现出色。

机制深度解析

通过LogitLens分析发现,Engram通过显式访问外部知识,减少了网络早期层获得高置信度预测所需的计算步骤,在功能上等同于增加模型有效深度。消融实验表明,随着Engram插入点深入,性能逐渐下降,证明其在网络早期层的重要性。

参数敏感性测试显示,完全抑制稀疏嵌入输出会使基准测试性能降至29%-44%,证实记忆痕迹模块是参数知识的主要存储库。而阅读理解任务保留81%-93%性能,说明基于上下文的任务主要依赖主干网络注意力机制。

工程效率优化

Engram将基础设施感知效率作为首要设计原则,其确定性寻址实现存储与计算解耦,能够将海量参数表卸载到宿主内存而推理开销可忽略不计。实际测试中,卸载100B参数嵌入表对8B主干网络吞吐量影响仅为2.8%。

自然语言的N-gram遵循齐普夫分布特性,促使团队采用多级缓存层次结构,使Engram能够扩展到海量内存容量同时将有效延迟影响降至最低。

DeepSeek这项研究为下一代稀疏模型指明了技术方向,条件记忆机制的价值不仅体现在性能提升,更在于为大规模模型的高效部署提供了新思路。随着这类架构创新不断涌现,AI模型的推理能力和部署成本平衡问题或许将迎来新的解决方案。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章