传统自回归大模型的注意力常“塌缩”在序列起点,限制了对上下文的深度利用。一项新研究发现,掩码扩散模型中存在一种名为“Attention Floating”的机制,能让注意力动态漂移,显著提升了模型处理知识密集型任务的能力,为RAG等领域带来性能突破。
智能速览
MDM注意力锚点会随去噪步骤与层数持续漂移。
模型浅层关注结构,深层关注语义内容。
Attention Floating机制使注意力分布更均匀灵活。
该机制在RAG场景下性能提升最高可达2倍。
精华内容
传统大模型的注意力机制常“塌缩”在起点,限制了上下文理解。一种全新的Attention Floating机制被发现,它如何改变这一局面?
告别注意力下沉
在主流的自回归模型中,注意力机制存在一个普遍问题:无论输入序列多长,模型的注意力高度集中于开头的
这种刚性的注意力模式导致模型难以有效利用序列中后部的信息,尤其是在处理长文本时,上下文信息的大量流失成为性能瓶颈,限制了其在知识密集型任务中的表现。
动态的注意力漂移
研究者首次在掩码扩散模型中发现了一种颠覆性的Attention Floating机制。与自回归模型的固定锚点不同,MDM的注意力锚点并非死守序列起点,而是随着去噪过程的推进和网络层的加深,在序列中动态漂移。
这种分布式、非固定的注意力模式,使得模型能够更灵活地捕捉和整合来自序列不同位置的关键信息,从而形成一个更全面、更均衡的上下文表征。
分层理解策略
深入分析Attention Floating机制发现,模型在不同层级表现出明确的分工协作。
在网络的浅层,注意力主要倾向于依赖一些结构性词元,例如标点符号或连接词,以此来构建整个序列的全局框架。随着层数的加深,注意力逐渐转向更具语义内容的词元,从而进行深度理解和信息抽取。这种由浅入深、由结构到语义的处理路径,极大提升了模型的文本理解能力。
性能的飞跃提升
Attention Floating机制的价值直接体现在了模型性能上。由于对上下文的利用效率显著提高,该机制在知识密集型任务中表现出巨大优势。
特别是在检索增强生成(RAG)场景下,模型能更好地消化和理解外部检索到的知识片段。实验数据显示,引入该机制的模型性能最高可实现2倍的提升,绝对性能增益最高达到25个百分点,证明了其在实际应用中的巨大潜力。
Attention Floating机制为大模型的上下文理解开辟了新路径。这种动态、灵活的注意力模式,能否成为下一代模型架构的核心设计原则,值得持续关注。