张大妈

Engram技术:如何让AI推理与记忆兼得?

源自抖音:idefav

02-17 15:39

当前大语言模型在记忆名字和术语时效率低下,常依赖蛮力计算而非直接检索,造成算力浪费。DeepSeek联合北大提出的Engram技术,通过创新的“条件记忆”机制,引入高效查表方式,不仅显著提升了模型的准确率,更意外地解放了其深度推理能力,为AI架构带来了重大变革。

Engram技术:如何让AI推理与记忆兼得?智能速览

  • Engram通过条件记忆技术,解决了大模型靠蛮力计算模拟记忆的效率瓶颈。

  • 其核心是升级版N-gram,通过上下文感知门控确保知识被精准调用,避免噪音干扰。

  • 研究发现了U型缩放定律,计算与记忆的最佳资源配比约为75%:25%。

  • Engram不仅提升了知识储备,更解放算力使模型推理能力实现“功能上的加深”。

  • 工程设计巧妙,将千亿参数记忆库置于内存中,推理速度损失可忽略不计,极大降低了硬件成本。

Engram技术:如何让AI推理与记忆兼得?精华内容

当前主流的混合专家模型,如同用法拉利取快递,用复杂计算模拟简单记忆,效率极低。Engram技术的提出,正是为解决这一核心痛点,它为AI模型外挂了一个高效的“字典”,彻底改变了记忆的实现方式。

记忆的瓶颈

现有大模型在处理“戴安娜王妃”这类固定知识时,并非直接查询,而是调用多层神经网络进行复杂的推理和拼凑。这个过程消耗了大量宝贵的GPU算力,就像每次需要朋友电话时,都重新用公式计算一遍,而非直接翻阅通讯录。这种资源浪费限制了模型将算力用于更高级的逻辑推理和创意生成,成为其能力提升的一大瓶颈。

Engram的巧思

Engram的核心是复兴并魔改了经典的N-gram技术。它将“亚历山大大帝”等固定短语视为钥匙,在海量嵌入表中进行瞬时查找。为实现这一目标,它加装了三个现代化插件:分词器压缩,合并大小写等变体,提升效率;多头哈希,减少查询冲突;最关键的是上下文感知门控,它能智能判断当前语境,过滤掉无关信息,确保只有相关知识被激活,完美解决了传统Ngram的噪音问题。

U型黄金配比

在有限的模型资源下,如何分配给计算单元和记忆单元?研究将此定义为吸收性分配问题,并通过大量实验发现了清晰的U型缩放定律。完全依赖计算或完全依赖记忆的两个极端都非最优解。实验数据表明,当将约20%至25%的参数预算从计算的MoE转移给记忆的Engram时,模型的综合性能达到最佳平衡点。

免费的性能午餐

令人意外的是,Engram带来的提升远不止知识储备。在衡量逻辑推理的BBH基准上,模型得分飙升了50分,代码和数学能力也显著增强。原因是,Engram接管了处理固定短语的琐碎任务,将模型前几层神经网络解放出来,使其能专注于更复杂的抽象逻辑。这种“增加油效深度”的现象,让一个5层的Engram模型在功能上等同于12层的标准模型,实现了性能的免费飞跃。

工程学的胜利

Engram最巧妙的设计在于其工程实现。记忆查找是确定性的,系统可以提前预知需要调用哪些数据。这允许GPU在计算浅层网络时,系统后台从容地将所需数据从廉价的内存或硬盘预加载到显存中,实现无缝流水线操作。实验证明,将高达1000亿参数的记忆库放在内存而非昂贵的显存中,整体推理速度损失不到3%,成功将模型记忆容量与硬件成本解耦。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章