多模态大模型虽性能强劲,但高昂的计算成本限制了其应用。Token压缩技术应运而生,成为提升效率的关键。本文系统梳理了该领域的技术流派,并针对不同场景提供了清晰的算法选择路径,为解决部署难题提供了实用参考。
智能速览
视觉和视频Token是MLLM计算成本高昂的主要原因。
Token压缩策略可按架构位置分为视觉编码器、投影器和LLM三大类。
视频场景需采用时空联合压缩以利用帧间冗余。
文本引导压缩能筛选与任务相关的Token,与纯视觉压缩互补。
即插即用方法部署快,而重训练方法在精细任务上性能上限更高。
精华内容
面对纷繁复杂的压缩算法,如何系统归类并因地制宜地选择,是实现高效部署的核心。
按位置分类
Token压缩策略在多模态大模型中可部署于不同位置。视觉编码器作为首站,其内部的压缩能从源头减少冗余,显著降低后续模块的计算负荷。
投影器模块作为连接视觉与语言的桥梁,通过Q-Former等架构提炼查询Token,或采用基于变换和重要性驱动的方法实现细粒度压缩。
在语言模型内部,压缩主要集中于预填充和解码阶段,通过剪枝或合并KV Cache来直接降低推理成本。
视频时空压缩
针对视频输入,单纯的空间压缩无法捕捉帧间的时序冗余。因此,必须采用时空增强的Token压缩方法。
这类技术通过联合建模空间和时间维度,不仅能有效压缩单帧内容,还能利用视频的连续性特征,对超长序列进行高效建模,从而在保留动态信息的同时,大幅降低计算和存储开销。
选型关键权衡
选择压缩策略时需权衡多种因素。纯视觉压缩高效通用,而文本引导压缩能精准筛选与任务相关的Token,二者常结合使用。
Token Merging适合密集冗余信息,Token Dropping则在高层语义稀疏时更具效率。
此外,即插即用方案部署快、成本低,但性能上限有限;重训练方案虽需额外开销,却能在精细理解任务中实现更优的性能。
Token压缩技术为多模态大模型的规模化应用铺平了道路,但仍面临理论缺失与任务自适应等挑战。构建一个标准化的评估体系,将是推动该领域持续发展的关键一步。