张大妈

VisionTrim:统一视觉Token 压缩加速多模态

源自小红薯:Python 智能研习社

02-03 20:47

多模态大模型推理成本高昂,症结在于视觉Token的冗余。浙江大学提出的VisionTrim框架,无需训练即可统一压缩全链路的视觉Token,在不牺牲性能的前提下,实现了显著的推理加速与资源节约,为多模态模型的实时应用落地提供了新思路。

VisionTrim:统一视觉Token 压缩加速多模态智能速览

  • VisionTrim是一个免训练的统一视觉Token压缩框架。

  • 框架核心为DVTS和TGVC两个即插即用模块。

  • 在LLaVA-1.5-7B上实现了88.9%的Token缩减。

  • 使LLaVA-NeXT-7B模型推理速度提升2.48倍。

  • FLOPs降低91.7%,显存占用减少93.3%。

  • 极端压缩下,仅留1个Token仍能保持82.8%性能。

VisionTrim:统一视觉Token 压缩加速多模态精华内容

VisionTrim的卓越性能源于其精巧的设计,它通过双模块协同与两阶段剪枝,实现了对视觉Token从全局到局部、从静态到动态的精细化压缩与管理。

统一压缩架构

VisionTrim构建了一个覆盖视觉编码到LLM解码全过程的统一压缩框架。其核心的DVTS与TGVC模块被设计为即插即用,能够灵活地嵌入到模型骨干网络的任意层间。这种设计确保了Token削减的动态性与一致性,避免了传统方法在链路不同阶段压缩策略脱节的问题,实现了端到端的优化。

双重视角评估

主导视觉Token选择模块(DVTS)创新性地结合了全局与局部两种视角来评估Token的重要性。它首先利用[CLS] token的注意力分数来衡量全局语义重要性,确保不丢失核心概念。随后,通过独特的局部Token亲和度算法,捕捉特征在空间上的连续性与相似性。最后,自适应方差加权机制将两项指标科学融合,精准筛选出既关键又具代表性的视觉信息。

文本导向互补

为解决纯视觉筛选可能导致的图文理解偏差,文本引导视觉补充模块(TGVC)应运而生。该模块利用CLIP文本编码器的语义信息,将与文本指令最相关的Token设为聚类中心,将被舍弃的Token通过加权平均的方式聚合为补充项。这一机制有效弥补了视觉筛选的盲区,缓解了“知识边界漂移”,显著提升了跨模态对齐的精度。

两阶段动态剪枝

VisionTrim采用两阶段剪枝策略,实现动静结合的高效压缩。第一阶段在视觉编码后、LLM解码前,通过DVTS和TGVC进行静态压缩,大幅降低进入LLM的初始Token数量,减轻了KV Cache的压力。

第二阶段则在LLM解码过程中,动态地利用首个生成Token的注意力分布作为全局重要性度量,实时实施剪枝。这种策略让模型能够感知文本上下文,持续优化Token结构。

VisionTrim以其无需训练、即插即用的特性,为多模态大模型的效率优化提供了一套极具实践价值的解决方案。它不仅在各项指标上展现出卓越的性能增益,更关键的是推动了MLLM走向更广阔的实时应用场景。随着这类技术的成熟,未来的多模态交互会变得多么流畅与高效?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章