张大妈

注意力不再下沉:扩散大模型新机制

源自小红薯:UltraRAG 研究组

01-29 20:21

传统自回归大模型的注意力常“塌缩”在序列起点,限制了对上下文的深度利用。一项新研究发现,掩码扩散模型中存在一种名为“Attention Floating”的机制,能让注意力动态漂移,显著提升了模型处理知识密集型任务的能力,为RAG等领域带来性能突破。

注意力不再下沉:扩散大模型新机制智能速览

  • MDM注意力锚点会随去噪步骤与层数持续漂移。

  • 模型浅层关注结构,深层关注语义内容。

  • Attention Floating机制使注意力分布更均匀灵活。

  • 该机制在RAG场景下性能提升最高可达2倍。

注意力不再下沉:扩散大模型新机制精华内容

传统大模型的注意力机制常“塌缩”在起点,限制了上下文理解。一种全新的Attention Floating机制被发现,它如何改变这一局面?

告别注意力下沉

在主流的自回归模型中,注意力机制存在一个普遍问题:无论输入序列多长,模型的注意力高度集中于开头的词元上,这种现象被称为“注意力下沉”。

这种刚性的注意力模式导致模型难以有效利用序列中后部的信息,尤其是在处理长文本时,上下文信息的大量流失成为性能瓶颈,限制了其在知识密集型任务中的表现。

动态的注意力漂移

研究者首次在掩码扩散模型中发现了一种颠覆性的Attention Floating机制。与自回归模型的固定锚点不同,MDM的注意力锚点并非死守序列起点,而是随着去噪过程的推进和网络层的加深,在序列中动态漂移。

这种分布式、非固定的注意力模式,使得模型能够更灵活地捕捉和整合来自序列不同位置的关键信息,从而形成一个更全面、更均衡的上下文表征。

分层理解策略

深入分析Attention Floating机制发现,模型在不同层级表现出明确的分工协作。

在网络的浅层,注意力主要倾向于依赖一些结构性词元,例如标点符号或连接词,以此来构建整个序列的全局框架。随着层数的加深,注意力逐渐转向更具语义内容的词元,从而进行深度理解和信息抽取。这种由浅入深、由结构到语义的处理路径,极大提升了模型的文本理解能力。

性能的飞跃提升

Attention Floating机制的价值直接体现在了模型性能上。由于对上下文的利用效率显著提高,该机制在知识密集型任务中表现出巨大优势。

特别是在检索增强生成(RAG)场景下,模型能更好地消化和理解外部检索到的知识片段。实验数据显示,引入该机制的模型性能最高可实现2倍的提升,绝对性能增益最高达到25个百分点,证明了其在实际应用中的巨大潜力。

Attention Floating机制为大模型的上下文理解开辟了新路径。这种动态、灵活的注意力模式,能否成为下一代模型架构的核心设计原则,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章