多模态大模型推理成本高昂,症结在于视觉Token的冗余。浙江大学提出的VisionTrim框架,无需训练即可统一压缩全链路的视觉Token,在不牺牲性能的前提下,实现了显著的推理加速与资源节约,为多模态模型的实时应用落地提供了新思路。
智能速览
VisionTrim是一个免训练的统一视觉Token压缩框架。
框架核心为DVTS和TGVC两个即插即用模块。
在LLaVA-1.5-7B上实现了88.9%的Token缩减。
使LLaVA-NeXT-7B模型推理速度提升2.48倍。
FLOPs降低91.7%,显存占用减少93.3%。
极端压缩下,仅留1个Token仍能保持82.8%性能。
精华内容
VisionTrim的卓越性能源于其精巧的设计,它通过双模块协同与两阶段剪枝,实现了对视觉Token从全局到局部、从静态到动态的精细化压缩与管理。
统一压缩架构
VisionTrim构建了一个覆盖视觉编码到LLM解码全过程的统一压缩框架。其核心的DVTS与TGVC模块被设计为即插即用,能够灵活地嵌入到模型骨干网络的任意层间。这种设计确保了Token削减的动态性与一致性,避免了传统方法在链路不同阶段压缩策略脱节的问题,实现了端到端的优化。
双重视角评估
主导视觉Token选择模块(DVTS)创新性地结合了全局与局部两种视角来评估Token的重要性。它首先利用[CLS] token的注意力分数来衡量全局语义重要性,确保不丢失核心概念。随后,通过独特的局部Token亲和度算法,捕捉特征在空间上的连续性与相似性。最后,自适应方差加权机制将两项指标科学融合,精准筛选出既关键又具代表性的视觉信息。
文本导向互补
为解决纯视觉筛选可能导致的图文理解偏差,文本引导视觉补充模块(TGVC)应运而生。该模块利用CLIP文本编码器的语义信息,将与文本指令最相关的Token设为聚类中心,将被舍弃的Token通过加权平均的方式聚合为补充项。这一机制有效弥补了视觉筛选的盲区,缓解了“知识边界漂移”,显著提升了跨模态对齐的精度。
两阶段动态剪枝
VisionTrim采用两阶段剪枝策略,实现动静结合的高效压缩。第一阶段在视觉编码后、LLM解码前,通过DVTS和TGVC进行静态压缩,大幅降低进入LLM的初始Token数量,减轻了KV Cache的压力。
第二阶段则在LLM解码过程中,动态地利用首个生成Token的注意力分布作为全局重要性度量,实时实施剪枝。这种策略让模型能够感知文本上下文,持续优化Token结构。
VisionTrim以其无需训练、即插即用的特性,为多模态大模型的效率优化提供了一套极具实践价值的解决方案。它不仅在各项指标上展现出卓越的性能增益,更关键的是推动了MLLM走向更广阔的实时应用场景。随着这类技术的成熟,未来的多模态交互会变得多么流畅与高效?