张大妈

DeepSeek 下一代架构前瞻:Engram - 给 AI 装上知识库

源自UP主:陈兴AI

02-24 14:13

DeepSeek提出Engram架构,通过外挂静态知识库解决大模型计算冗余问题,用低成本存储换取高效推理,性能显著提升。

DeepSeek 下一代架构前瞻:Engram - 给 AI 装上知识库智能速览

  • Engram架构通过外挂静态知识库,直接检索固定搭配,避免复杂计算。

  • 采用多头哈希技术解决存储冲突,实现2-gram和3-gram的高效查表。

  • 引入上下文感知门控机制,动态注入知识并抑制无关噪声。

  • 在模型第2层和第15层部署Engram,平衡了早期减负与精准推理。

  • 测试显示Engram模型全面超越纯MoE模型,长文本检索能力大幅提升。

DeepSeek 下一代架构前瞻:Engram - 给 AI 装上知识库精华内容

Transformer模型虽强大但存在计算冗余,DeepSeek Engram架构巧妙引入静态知识检索,重塑了模型推理范式。

解决计算冗余痛点

大语言模型本质上是复杂的函数计算器,面对“法国首都是哪里”这类简单事实,依然需要经过几十层神经网络计算,存在“大材小用”的问题。DeepSeek提出的Engram架构相当于给模型装了一个“物理外挂”,建立静态知识库,让模型能直接检索常见固定搭配和实体名词,将复杂的计算转化为简单的查表操作,极大降低了推理成本。

多头哈希与存储优化

理论上2-gram和3-gram的组合数量是天文数字,无法全量存储。DeepSeek采用固定容量加哈希压缩的方案,建立了约400万行的压缩表。为解决哈希冲突,设计了8个不同的哈希函数进行“多头哈希”,将检索到的向量拼接成高维指纹,有效区分不同词组。此外,通过分词器压缩,将大小写不同但语义相同的Token合并,使词表大小减少了23%,显著提升了存储效率。

上下文感知门控机制

仅能检索还不够,需确保知识注入的准确性。Engram借鉴注意力机制设计了上下文感知门控,将当前隐藏状态作为Query,检索到的N-gram作为Key和Value。通过计算QK点积得出门控权重:若语义匹配则权重接近1,完全吸收;若不相关则权重趋近0,有效抑制噪声。例如在聊美食时,能精准避开“苹果公司”的干扰,只检索水果相关信息。

架构部署与性能提升

论文建议在第2层和第15层双重部署Engram。第2层部署旨在早期减负,通过并行读取数据减少延迟,让后续网络专注于深层推理;第15层部署则利用模型对语境的充分理解,配合精准门控解决歧义知识。测试结果表明,在相同参数量下,Engram模型得分全面超越纯MoE模型,长上下文的大海捞针测试得分更是从84分提升至97分。

Engram架构通过解耦计算与检索,为大模型发展提供了新思路。让我们期待搭载该技术的DeepSeek V4早日到来。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章