大语言模型常因过度计算而效率低下,且受限于昂贵的GPU显存。DeepSeek最新论文提出的Engram技术,通过引入记忆检索机制,不仅有望提升模型推理能力,更尝试用廉价CPU内存替代GPU显存,为AI部署成本带来革命性变化。
智能速览
DeepSeek新论文提出Engram模块,用检索替代计算来提升AI效率。
Engram能让模型利用廉价的CPU内存替代昂贵的GPU显存。
实验显示,该技术使千亿参数模型运行成本大幅降低。
该技术解放了模型深层网络,显著提升推理与代码能力。
此举可能是下一代模型V4实现能力飞跃的关键。
精华内容
当前大模型通过复杂计算模拟记忆,不仅效率低下,也限制了性能的进一步提升。DeepSeek的新研究,试图通过一种复古而创新的方式,彻底改变这一现状。
AI的笨拙计算
当前大模型在处理信息时存在一种固有的低效。当被问及“莎士比亚的全名”时,模型并非直接调取,而是消耗多层网络进行复杂的矩阵运算来“拼凑”答案。
论文举例,识别“Diana, Princess of Wales”需要前6层网络协同,从理解“Wales”到“Princess of Wales”,最终才确认是“戴安娜王妃”。这种用深度计算模拟记忆检索的过程,极大地浪费了模型宝贵的推理能力,尤其是在处理代码这类包含大量固定语法的任务时。
Engram超级字典
为解决此问题,DeepSeek复用了NLP领域古老的N-gram概念,并创新地改造成现代化的Engram模块。它如同一个“超级字典”,通过哈希函数将固定短语映射到巨大的嵌入表中,实现语义向量的直接提取。
为应对语境干扰,团队引入了上下文感知的门控机制。该机制能动态判断检索内容与当前上下文的匹配度,不匹配时则抑制噪声。实验热力图显示,模型在处理“Alexander the Great”时精准激活,成功识别并检索固定实体的语义表示,让模型能专注于逻辑而非语法。
CPU变“显存”
Engram最具突破性的应用,在于其破解了GPU显存瓶颈。DeepSeek尝试用便宜量大的CPU内存(DRAM),去存储本应占据昂贵GPU显存(HBM)的嵌入表。
其核心在于Engram的检索逻辑完全由输入token序列决定,可实现“计算与传输重叠”,有效掩盖了CPU内存读取速度慢的缺陷。实验构建了一个1000亿参数的Engram词表并完全置于CPU内存中,结果显示,相比纯GPU运行,整体吞吐量损耗小于3%,在工业部署中几乎可以忽略不计。这意味着未来运行千亿模型或许只需一张消费级显卡加几根大容量内存条。
数据验证飞跃
论文的实验数据有力印证了关于V4能力的传闻。在知识密集型任务上,Engram-27B相比MoE-27B在MMLU上提升3.4分。更关键的是推理能力的显著飞跃:在BigBench Hard上提升5.0分,HumanEval代码任务提升3.0分,MATH数学任务提升2.4分。
长文本处理能力同样惊人,在32k上下文测试中,多查询任务准确率从84.2%跃升至97.0%。研究发现,Engram在浅层网络就处理了记忆工作,解放了深层网络专注于复杂推理,这与爆料中V4“回答更有条理”的特点完全吻合。
DeepSeek通过Engram技术,展示了一条不同于单纯追求模型规模的道路。它通过优化架构效率,用巧思降低算力成本,这不仅能推动超大规模模型的普及,也为AI在更多垂直领域的应用扫清了障碍。当算力不再是唯一门槛,未来的AI世界将迎来怎样的变革?