张大妈

多模态大模型中的Token压缩技术综述

源自知乎:简枫

02-27 12:03

多模态大语言模型在处理高分辨率图像与长视频时,生成的海量Token带来了严峻的计算与显存挑战。Token压缩技术作为关键解决方案,通过在训练或推理阶段精简Token数量,有效缓解了这一问题。本文将系统梳理该领域的核心分类法与关键机制,为理解和应用这一技术提供清晰的路线图。

多模态大模型中的Token压缩技术综述智能速览

  • Token压缩直接减少序列长度,与稀疏注意力机制有本质区别。

  • 不同模态存在不同冗余类型,如图像的空间冗余与视频的时空冗余。

  • 压缩机制可归纳为下采样、合并、裁剪和查询四大类。

  • Token压缩与传统模型剪枝正交,联合使用可实现乘数级加速。

多模态大模型中的Token压缩技术综述精华内容

面对不同模态数据带来的独特冗余挑战,Token压缩技术发展出多元化的应对策略。其核心在于如何在减少Token数量的同时,最大限度地保留原始信息。

核心定义

首先明确Token压缩的数学目标:将输入序列X压缩为更短的序列Y,同时保留核心语义。这需要与传统稀疏注意力机制区分开来,后者仅稀疏化计算图,并未减少传递给下一层的Token数量,因此对显存的优化有限。Token压缩则直接作用于序列长度N,是更直接的优化路径。

冗余类型

有效的压缩策略源于对数据冗余的深刻理解。不同模态的冗余特性各异:图像主要表现为空间冗余,即相邻像素或区域信息高度相关;视频则在空间冗余之上增加了巨大的时间冗余,相邻帧内容变化微小;音频信号因高采样率而产生极长序列,并包含频谱冗余、时间冗余以及大量的静音片段。

压缩机制

论文将底层算法统一归纳为四类。一是下采样,通过改变特征维度或空间结构来减少Token。二是合并,通过计算特征空间中的距离,识别并合并相似的Token,例如ToMe算法利用二分软匹配进行合并。三是裁剪,利用注意力分数的稀疏性,直接移除得分较低的非关键Token。四是查询,借助文本Prompt或可学习的查询向量,引导模型筛选出最重要的信息。

正交与联合

Token压缩与传统的模型压缩(如剪枝、量化)是结构上正交的两条优化路径。模型压缩旨在减小模型维度D,而Token压缩则直接针对序列长度N。由于LLM的FLOPs消耗与D²和N²相关,这两类方法可以结合使用。例如,将量化与Token压缩结合,可以实现接近乘数级的推理加速效果,达到更优的能效比。

Token压缩技术为解决多模态大模型的效率瓶颈提供了系统性的工具箱。通过对冗余类型的识别和多样化压缩机制的运用,它显著降低了计算成本。未来,如何更智能地适应不同任务与数据,将是该领域持续探索的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章