张大妈

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%

源自公众号:AI寒武纪

02-01 19:06

月之暗面推出的新型注意力架构Kimi Linear,旨在攻克大模型处理长序列时的计算效率与性能瓶颈。该技术通过创新的混合线性注意力设计,首次在多项任务上实现了对传统全注意力机制的全面超越,同时显著提升了速度并降低了内存消耗。这对于推动下一代智能体LLM的发展具有基石意义,为长文本处理和复杂推理任务提供了全新的解决方案。

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%智能速览

  • Kimi Linear是一种全新的混合线性注意力架构,专为解决长序列计算瓶颈设计。

  • 其核心KDA模块通过精细化门控机制,实现了对模型记忆的精确控制。

  • 处理百万长文本时,解码速度相比全注意力机制提升高达6.3倍。

  • 该架构能将Key-Value缓存的使用量减少高达75%,极大节省了显存。

  • 在短上下文、长上下文及强化学习等多种场景下,性能全面超越传统全注意力模型。

  • 其全局注意力层采用无位置编码设计,增强了长文本鲁棒性与外推能力。

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%精华内容

传统注意力机制在处理长文本时面临算力与内存的双重挑战,Kimi Linear正是为解决这一核心痛点而生,其精巧的架构设计是其实现性能与效率双赢的关键。

现有困境

传统Transformer模型依赖的softmax注意力机制,其计算量与序列长度的平方成正比,当处理百万级别长文本时,计算成本呈指数级增长。同时,其Key-Value(KV)缓存大小随序列长度线性增加,严重消耗显存,限制了模型的实时交互与高并发处理能力。这些瓶颈成为大模型向更强大智能体发展的核心障碍,使得研究亟需一种兼顾性能与效率的新型注意力架构。

架构创新

Kimi Linear的核心是一种精巧的混合架构。它以3:1的比例堆叠线性注意力层(KDA)与全注意力层(MLA)。KDA层负责处理大部分交互,保证高效率;而周期性插入的MLA层则作为全局信息枢纽,捕捉长距离依赖。

一个关键设计是,所有MLA层均不使用显式位置编码(NoPE),将位置感知的责任完全交给KDA层,这在长文本任务上表现出更强的鲁棒性。该架构还结合了专家混合(MoE)技术,在480亿总参数中仅激活30亿,进一步提升了效率。

KDA解析

Kimi Linear的强大根植于其核心模块Kimi Delta Attention(KDA)。它在Gated DeltaNet(GDN)的基础上进行了两大关键改进。首先是精细化的对角门控,为每个特征通道赋予独立的遗忘速率,实现了对记忆的精确控制,如同一种可学习的动态位置编码。

其次是硬件高效的块处理算法,通过约束化的数学结构简化了计算流程,并充分利用GPU的Tensor Cores。该算法的算子效率比标准DPLR提升约100%,解决了精细化门控带来的计算难题,实现了卓越的硬件效率。

性能实测

在全面的基准测试中,Kimi Linear展现了压倒性优势。在预训练和指令微调阶段,无论在通用知识、数学代码还是中文任务上,其表现均一致性地优于纯全注意力(MLA)和标准混合(GDN-H)基线模型。

在128k长上下文任务中,它以54.5的平均分领先。效率方面,在处理百万token长文本时,Kimi Linear的解码速度达到全注意力模型的6.3倍,而KV缓存用量则减少了75%,实现了速度与内存的双重胜利。

Kimi Linear的成功证明了精心设计的线性混合架构完全有能力在性能上超越全注意力模型,打破了固有印象。其核心KDA模块为长文本处理和高效推理开辟了新路径。未来,这类架构能否在更复杂的多跳推理任务中持续突破,将是决定其能否成为下一代大模型基石的关键。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章