张大妈

给多模态大模型“减负”:Token压缩技术最新进展与算法选择

源自知乎:Frank Yang

01-23 19:31

多模态大模型虽性能强劲,但高昂的计算成本限制了其应用。Token压缩技术应运而生,成为提升效率的关键。本文系统梳理了该领域的技术流派,并针对不同场景提供了清晰的算法选择路径,为解决部署难题提供了实用参考。

给多模态大模型“减负”:Token压缩技术最新进展与算法选择智能速览

  • 视觉和视频Token是MLLM计算成本高昂的主要原因。

  • Token压缩策略可按架构位置分为视觉编码器、投影器和LLM三大类。

  • 视频场景需采用时空联合压缩以利用帧间冗余。

  • 文本引导压缩能筛选与任务相关的Token,与纯视觉压缩互补。

  • 即插即用方法部署快,而重训练方法在精细任务上性能上限更高。

给多模态大模型“减负”:Token压缩技术最新进展与算法选择精华内容

面对纷繁复杂的压缩算法,如何系统归类并因地制宜地选择,是实现高效部署的核心。

按位置分类

Token压缩策略在多模态大模型中可部署于不同位置。视觉编码器作为首站,其内部的压缩能从源头减少冗余,显著降低后续模块的计算负荷。

投影器模块作为连接视觉与语言的桥梁,通过Q-Former等架构提炼查询Token,或采用基于变换和重要性驱动的方法实现细粒度压缩。

在语言模型内部,压缩主要集中于预填充和解码阶段,通过剪枝或合并KV Cache来直接降低推理成本。

视频时空压缩

针对视频输入,单纯的空间压缩无法捕捉帧间的时序冗余。因此,必须采用时空增强的Token压缩方法。

这类技术通过联合建模空间和时间维度,不仅能有效压缩单帧内容,还能利用视频的连续性特征,对超长序列进行高效建模,从而在保留动态信息的同时,大幅降低计算和存储开销。

选型关键权衡

选择压缩策略时需权衡多种因素。纯视觉压缩高效通用,而文本引导压缩能精准筛选与任务相关的Token,二者常结合使用。

Token Merging适合密集冗余信息,Token Dropping则在高层语义稀疏时更具效率。

此外,即插即用方案部署快、成本低,但性能上限有限;重训练方案虽需额外开销,却能在精细理解任务中实现更优的性能。

Token压缩技术为多模态大模型的规模化应用铺平了道路,但仍面临理论缺失与任务自适应等挑战。构建一个标准化的评估体系,将是推动该领域持续发展的关键一步。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章