大模型扩展现有方法遇到瓶颈,DeepSeek提出Conditional Memory机制,通过Engram模块实现高效知识存储。在固定计算预算下,合理分配计算与记忆稀疏性,可显著提升模型性能,为AI架构优化提供新思路。
智能速览
Transformer缺乏原生查找机制,导致事实性知识处理低效
Engram模块实现可扩展的条件记忆,降低神经计算依赖
研究发现计算与记忆稀疏性存在U型最优分配曲线
新方法在知识检索、复杂推理等任务上表现优异
精华内容
现有大模型过度依赖神经计算,而DeepSeek的创新在于引入记忆稀疏性作为第三维度,通过Engram模块实现高效的知识检索与模式复现。
核心痛点
Transformer架构存在根本性缺陷:缺乏原生的symbolic或associative lookup机制。这意味着模型在处理事实性知识、模板化语言模式和局部依赖时,必须通过堆叠神经计算进行低效模拟。MoE虽然实现了计算稀疏化,但仅优化了组合式推理任务,对记忆与局部模式复现缺乏结构性支持。
这种异构性导致资源分配不合理,部分任务用错了计算方式。
Engram设计
Engram是对经典N-gram embedding的现代化重构,构建了大规模、可扩展的参数化key-value记忆结构。其核心创新在于条件寻址机制,每次仅激活极少量记忆单元,计算复杂度显著低于Transformer前向计算。
模块主要负责三类任务:局部语言模式捕获、高频事实存储、可直接复用的中间表征。通过离散查找替代部分神经计算,大幅提升效率。
稀疏性权衡
研究提出了Sparsity Allocation Problem,深入分析计算稀疏性(MoE)与记忆稀疏性(Engram)的权衡关系。实验发现存在一个U型最优分配曲线,过度依赖任一维度都会导致性能下降。
这一发现对模型架构设计具有重要指导意义,表明未来大模型需要在神经计算与符号记忆间找到最佳平衡点。
DeepSeek的研究为解决大模型扩展瓶颈提供了新范式,证明了引入记忆稀疏性的必要性。随着模型规模持续增长,如何高效分配计算与记忆资源将成为关键问题,这条U型曲线或将成为AI架构优化的新标尺。