面对多模态大模型中海量视觉Token带来的计算冗余难题,中山大学提出的FlashVLM框架提供了一个轻量级且高效的解决方案。它通过显式计算文本与视觉内容的相似度,动态筛选最相关的视觉信息,在大幅降低计算成本的同时,甚至能实现超越原始模型的性能,为多模态模型的优化提供了全新视角。
智能速览
FlashVLM通过跨模态相似度计算,动态筛选与文本最相关的视觉Token。
其双重评分机制融合了视觉显著性与查询相关性,精准抑制噪声。
分区迭代剪枝策略确保了在高效压缩的同时,保留关键的全局语义信息。
该方案架构无关,可无缝适配LLaVA、Qwen-VL等多种主流视觉语言模型。
实验证明,剪枝77.8%的Token后,模型性能反而能提升至100.6%。
精华内容
FlashVLM的核心突破在于如何精准识别并保留那些真正关键的视觉信息,其技术设计环环相扣,实现了效率与性能的巧妙平衡。
精准关联
传统方法依赖模型内部不稳定的注意力图,而FlashVLM另辟蹊径。它将视觉特征直接投影到大语言模型的嵌入空间,通过计算其与文本嵌入的点积相似度,获得稳定且可解释的查询相关性信号。这种设计使得模型能够像“指哪看哪”一样,直接聚焦于文本所描述的视觉区域,实现了对视觉Token的高效筛选。
双重评分
为确保筛选的全面性,FlashVLM创新性地融合了两种评分机制。其一是基于视觉编码器注意力的“内在视觉显著性”,用于捕捉图像中固有的重点区域;其二是基于跨模态相似度的“外在查询相关性”,用于匹配文本查询内容。通过对数域权重融合与温度控制的锐化处理,该机制能有效抑制无关的背景噪声,同时确保不遗漏关键的语义锚点。
迭代剪枝
为避免过度聚焦局部细节而丢失图像的全局信息,FlashVLM设计了分区迭代剪枝策略。它首先将视觉Token划分为“重要集”和“残余集”。对残余集,算法采用迭代方式进行剪枝,在去除大量冗余背景Token的同时,保留了少量具有代表性的视觉补丁。这种设计从理论上保证了语义覆盖的完整性,防止了关键信息的丢失。
通用设计
FlashVLM的设计极具通用性,其剪枝操作仅在视觉编码器与LLM的接口处执行一次,无需修改Transformer的内部结构。这一特点使其能够与FlashAttention等现有硬件加速库完全兼容。研究团队已验证,该方案可无缝应用于LLaVA、Qwen-VL、InternVL等多个主流视觉语言模型,展现了其广泛的适用性和实际部署潜力。
FlashVLM通过其精妙的Token筛选机制,为多模态大模型的效率瓶颈提供了极具价值的解决方案。它不仅在性能上实现了“超越无损”的突破,更以其架构无关的设计,为现有模型的快速升级铺平了道路。这种思路或许会引发更多思考:未来的多模态模型,是否可以从“更多信息”转向“更精炼信息”?