张大妈

越过"遗忘"的边界—大模型记忆的三层架构

源自小红薯:奥森木

03-04 16:11

大模型的记忆能力正成为AI发展的关键瓶颈。本文深入剖析大模型记忆的三层架构体系,从短期KV Cache优化到中期RAG演进,再到长期记忆突破,揭示了AI如何逐步跨越遗忘边界,为Agent应用铺平道路。

越过智能速览

  • 短期记忆:PagedAttention将KV Cache利用率从不到40%提升至96%+

  • 中期记忆:MemoryOS实现主动记忆管理,准确率提升43.7%

  • 长期记忆:内隐参数、外显语义、参数化查表三条路径并行

  • 硬件映射:热数据→HBM,温数据→DRAM,冷数据→SSD

越过精华内容

大模型的记忆架构正在经历一场深刻变革,从单纯依赖算力硬扛遗忘,转向构建分层次、智能化的记忆体系。

短期记忆优化

短期记忆的核心载体KV Cache面临两大挑战:随上下文线性膨胀和显存碎片化严重。传统方式下,KV Cache利用率不到40%,显存浪费率高达60-80%。

Berkeley团队的PagedAttention创新性地将KV Cache切分为虚拟页管理,这一机制使利用率跃升至96%以上。

Google DeepMind的Infini-attention更进一步,通过将旧KV Cache压缩成固定大小的记忆状态,实现了114倍的压缩比,这才支撑起Gemini百万token上下文的处理能力。

工程层面的PD分离方案让预填充和解码各司其职,显著提升了整体效率。

中期记忆演进

中期记忆解决的是跨会话连续性问题。没有它,Agent每次启动都需要从头读取上下文,造成巨大资源浪费。

RAG技术经历了三代演进:初代向量RAG解决了信息检索问题,但无法处理新旧信息冲突;GraphRAG引入知识图谱进行结构化推理,实现了上下文token压缩9-43倍。

MemoryOS代表了当前最前沿的思路——不再是被动检索,而是主动管理记忆生命周期。系统仅在出现认知缺口时才调取相关记忆,并自动将高频对话内容提炼为长期知识。实测显示,该方案使准确率提升43.7%,token消耗减少35%。

长期记忆突破

长期记忆让模型摆脱了预训练截止时间的限制,实现真正的持续学习。目前有三条技术路径并行发展。

内隐参数路径通过LoRA微调和持续学习,将新知识融入模型参数;外显语义路径采用知识图谱存储结构化知识;参数化查表路径以DeepSeek的Engram条件记忆为代表。

值得关注的是推理中训练这一新范式,它正在模糊训练和推理的边界,让模型在实时交互中不断更新记忆。

硬件架构映射

AI记忆架构在硬件层面的映射非常清晰,形成了一个完整的存储层次体系。

短期对应热数据,主要依靠HBM高带宽内存、SRAM高速缓存和NVLink高速互联;中期对应温数据,使用DRAM内存、NVMe SSD以及向量和图数据库;长期对应冷数据,依托SSD和存算一体技术。

这种分层设计使得AI竞争正从单纯的算力竞赛,转向更加复杂的存储架构竞赛。

大模型记忆架构的三层体系为AI突破遗忘边界提供了系统性解决方案。随着短期、中期、长期记忆技术的不断完善,AI将真正实现持续学习和个性化交互。未来的竞争焦点将是如何在效率、成本和性能之间找到最佳平衡点,这会是AI基础设施领域的重要命题吗?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章