DeepSeek新论文提出的Engram架构,通过将记忆与推理分离,解决了AI用宝贵算力处理常识性知识的问题。这一创新不仅在多项基准测试中显著提升模型性能,还为降低AI推理成本提供了新思路,值得深入探讨。
智能速览
DeepSeek开源了新架构Engram的核心实现,旨在分离记忆与推理。
Engram将查表型记忆从算力型推理中分离,形成互补机制。
该架构解决了Transformer缺乏原生知识查找能力的根本痛点。
实测表明,新架构在知识、推理、代码、数学等任务上性能均有提升。
Engram有望降低对GPU显存的依赖,用更便宜的内存替代部分存储功能。
精华内容
面对AI在处理常识性知识时的算力浪费,DeepSeek提出了一个颠覆性的解决方案:Engram架构。它让模型不再去“计算”知识,而是直接“查询”。
记忆与推理分家
DeepSeek此前的混合专家架构通过条件计算,让模型在处理问题时“按需”调动专家,解决了算得贵的问题。而Engram则在此基础上更进一步,引入了“条件记忆”。它的核心逻辑是把需要死记硬背的固定知识或常见片段,做成可直接查询的笔记,模型无需每次都通过复杂的矩阵运算去重新推理。
这就好比让大脑专注于思考难题,而不是用来背诵电话号码。像“1+1=2”这类常识,模型可以直接从Engram中查到结果,而非调动多层Attention和FFN进行计算,从而极大释放了宝贵的算力资源。
性能实测飞跃
DeepSeek的实验数据显示,将20%至25%的参数用于Engram专门做记忆,其余参数交给MoE做计算,模型的综合性能达到了顶峰。这种分工模式的效果明显优于纯粹的MoE架构。
具体来看,在多个关键基准测试中,性能提升显著:MMLU(知识密集综合能力)从57.4提升至60.4;BBH(通用推理)从50.9提升至55.9;HumanEval(代码生成)从37.8提升至40.8;MATH(数学推理)从28.3提升至30.7。这表明,记忆与推理的分离不仅提升了知识型任务,对代码和数学这类强推理任务也有积极的促进作用。
算力成本优化
Engram架构的另一大价值在于其潜在的降本增效能力。传统的模型需要将大量参数和表格常驻于昂贵的GPU显存中,显存不足则需追加硬件投入。
而Engram的查表地址由输入token的哈希索引确定,具有可预测性。这使得系统可以提前预知下一步需要的数据,允许将庞大的Engram记忆表主要存储在成本相对低廉的主机内存中,推理时仅将当前请求所需的少量表项预取到GPU。这意味着,企业或许无需再为更大的“记忆”容量而采购更多昂贵的显卡,从而有效控制硬件成本。
从混合专家到记忆分工,AI架构正趋近于人类社会的协作模式。Engram的出现不仅是一次技术革新,更预示着未来AI在效率与成本控制上的新可能。这项技术将如何重塑未来的AI应用场景?