张大妈

美团LongCat新技术解码提速10倍

源自知乎:量子位

01-14 18:51

美团龙猫LongCat系列发布全新稀疏注意力机制LoZA,专注解决长文本任务的理解和算力难题。新技术在保持性能的同时,将解码速度提升10倍,还能处理1M超长文本,为AI长文本处理带来新突破。

美团LongCat新技术解码提速10倍智能速览

  • LoZA稀疏注意力机制解码速度提升10倍

  • 支持1M超长文本上下文窗口

  • 256K文本预加载提速超50%

  • 计算复杂度从平方级降至线性级

  • 性能超越同类型Qwen-3模型

  • 支持动态稀疏比例,适配多模态

美团LongCat新技术解码提速10倍精华内容

LoZA如何在不损失性能的前提下实现10倍速度提升?关键在于精准识别和替换模型中的低效模块。

算力瓶颈突破

传统全注意力机制的算力瓶颈在于平方级计算复杂度O(L²),导致长文本处理对显卡要求高且推理延迟明显。LoZA专注处理重要内容,对不重要部分采用轻量化计算方式,有效降低了算力消耗。

这种思路让模型在处理长文本时不再受制于算力限制,为实际应用扫清了障碍。

智能模块筛选

团队先给多头潜在注意力模块MLA添加可学习权重α,通过冻结其他参数、只更新α梯度的专门校准训练,让模型自主学习每个模块的重要性。

α值越高的模块越关键,简化容易丢失性能;α值越低的模块可替代性强,适合用轻量计算替换。按α值排序后,找出50%低性能模块作为优化目标。

ZigZag交错结构

将筛选出的50%低性能MLA模块替换为流式稀疏注意力SSA,形成交错结构。SSA计算复杂度为线性O(L·S),S固定为1024Token,远低于全注意力的O(L²)。

这种设计既避免了过度简化导致模型变笨,又将计算复杂度降至线性级别,大幅节省算力。

局部全局兼顾

LoZA设计了1024Token稀疏窗口,每个窗口包含1个负责抓整体关联的全局块和7个负责盯附近内容的局部块,单块大小128Token。

这种结构让模型在关注局部细节的同时不忽略整体逻辑,确保对长文本的全面理解。改造无需从头训练,在中期训练阶段即可完成,成本较低。

实测性能提升

测试数据显示LoZA实现更快且未变笨。处理128K上下文时,解码速度比原来快10倍;256K上下文预加载提速50%,后续解码省30%算力,同样硬件可处理两倍以上长文本任务。

LongCat-Flash-Exp因此解锁1M上下文窗口。日常任务与原版持平,长文本任务表现更好,在MRCR测试中反超Qwen-3模型。

LoZA的成功展现了AI工程优化的精妙之处,未来支持动态稀疏比例后,将能根据文本长度自动调整策略,进一步拓展到长视频、长图文等多模态场景。长文本处理的效率革命才刚刚开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章