大模型如何高效检索知识?DeepSeek与北大的最新合作给出了答案。他们提出“条件记忆”新思路,并开源了270亿参数的Ngram模块,为模型配上了一个高速记忆库,显著提升了推理和检索效率,为AI模型发展指明了新方向。
智能速览
传统Transformer模型存在原生知识查找效率低的痛点。
DeepSeek提出“条件记忆”新维度,并开源核心Ngram模块。
该模块实现了O(1)级别的快速知识查找,如同模型的外置高速缓存。
在MMLU、BBH等多项测试中取得显著提升,长上下文检索准确率飙升至97%。
团队发现U型缩放定律,完美平衡了神经计算与静态记忆的关系。
该技术已开源,有望成为下一代稀疏模型的核心建模工具。
精华内容
这项突破的核心在于一种全新的“条件记忆”机制,它如何为大模型减负增效,并带来如此大幅度的性能飞跃?其背后的技术逻辑值得深入探究。
核心思路
传统Transformer模型缺少原生的知识查找功能,即使通过混合专家模型扩容,仍需依赖低效计算来模拟检索过程。针对这一痛点,研究团队提出“条件记忆”这一全新稀疏性维度,通过Ngram模块升级经典的N-gram嵌入技术,实现了O(1)级别的快速知识查找,相当于为大模型配备了一个可随时调用的高速记忆库,从根本上改变了知识获取方式。
性能飞跃
基于新发现的U型缩放定律,团队将Ngram模块扩展至270亿参数,实测结果十分亮眼。在MMLU、CMMLU等知识检索任务上,得分分别提升了3.4分和4.0分。更关键的是,在通用推理领域也实现了重大突破,BBH任务提升5.0分,ARC Challenge提升3.7分。即便在代码和数学这类高难度场景,也取得了HumanEval+3.0和MATH+2.4的优异成绩,证明了其强大的通用性。
技术原理
Ngram模块的巧妙之处在于,它为模型的backbone早期层卸下了静态重建的负担,使其能更专注于复杂的推理任务。同时,局部依赖关系被交由查找模块处理,释放出的注意力资源得以更好地捕捉全局上下文。这种设计让长上下文检索的准确率从84.2%飙升至97.0%。此外,其确定性寻址设计能实现主机内存的运行时预取,几乎没有额外开销,兼顾了高性能与高效率。
开源与影响
目前,这个强大的Ngram模块已经在GitHub上开源,为整个AI社区的研究者和开发者提供了强大的工具。从技术创新到开源共享,DeepSeek与北京大学的合作不仅解决了大模型检索效率的一个关键问题,也为下一代稀疏模型的技术发展提供了新的方向,有望推动整个领域向前迈进。
DeepSeek与北大的这项研究,通过高效的外部记忆模块,为大模型的发展开辟了一条新路径。它不仅解决了当前的技术瓶颈,更通过开源精神加速了整个社区的进步。未来,这种结合神经计算与静态记忆的模型架构,是否会成为主流?