传统视觉语言模型因特征融合方式单一,限制了其多模态推理能力。CLI框架为此提供了解决方案,它通过构建动态“多对多”的连接桥梁,让模型能根据上下文灵活调用各层级视觉信息,显著提升性能且参数高效,为VLM的深度优化开辟了新路径。
智能速览
传统VLMs因静态连接导致视觉特征利用不充分。
CLI框架构建了动态“多对多”的视觉-语言连接。
通过AMP和AGF两个协同模块实现高效特征适配与融合。
在18个多模态基准测试上均取得显著性能提升。
该方案参数效率高,无需大量额外训练成本。
精华内容
CLI框架的核心创新在于打破静态连接的束缚,其精巧的设计是如何实现视觉特征的动态、高效利用的呢?
打破静态范式
传统VLMs普遍采用“一对一”的静态连接模式,即将视觉编码器最后一层的特征,一次性输入给语言解码器。这种方式忽略了视觉编码器其他层级所包含的丰富信息,无法满足复杂推理对不同粒度视觉信息的需求,导致模型的多模态能力受限,如同只看总结而忽略了过程细节。
动态多对多桥梁
CLI框架构建了全新的动态“多对多”连接。它不再局限于最后一层特征,而是将视觉编码器的全层级特征与语言解码器的多个层面进行动态对接。这种设计支持分层对齐与交叉对齐,让模型在面对不同任务时,能够按需抽取最合适的视觉信息粒度,极大地增强了特征利用的灵活性。
双模块协同工作
为实现高效的动态融合,CLI设计了两个核心模块。首先是自适应多投影(AMP)模块,它利用LoRA技术,为不同视觉层级的特征适配专属的投影器,高效地将多粒度视觉信息统一到语言模型能理解的嵌入空间,避免了全量微调的巨大开销。其次是自适应门控融合(AGF)模块,它能根据实时的解码上下文,动态计算权重,智能地筛选并融合最相关的视觉特征,有效过滤了干扰信息。
普适性与高性能
CLI框架的强通用性体现在其成功集成到了LLaVA-OneVision和LLaVA-1.5两种主流但架构差异较大的VLM中。在文档理解、图表推理、视觉感知等多类任务的18个基准测试上,集成CLI的模型均取得了显著的性能提升。这一切都建立在高效的参数利用之上,无需大量额外训练成本,为VLMs的性能升级提供了一个可复用的轻量级解决方案。
CLI框架为视觉语言模型的深度融合提供了轻量级且高效的全新思路,显著提升了模型的多模态推理上限。这种动态融合机制,未来是否会成为新一代VLMs的标配设计?