跨模态模型CLIP的文本能力是其性能提升的关键瓶颈。微软亚洲研究院的LLM2CLIP项目,通过创新的两阶段训练策略,成功将大语言模型的知识潜力高效融入,不仅大幅提升了图文检索性能,还显著降低了训练成本,为多模态学习的发展开辟了新路径。
智能速览
CLIP的文本编码器存在上下文窗口窄、容量有限等问题,限制了跨模态性能。
直接用LLM替换CLIP文本编码器会失败,因为其特征不具备跨模态对齐所需的判别性。
LLM2CLIP提出Caption-Contrastive微调,赋予LLM判别能力,是成功的关键。
新方法仅需少量数据(3-15M图文对)即可实现对现有模型的超越。
引入LLM后,更强的文本监督反向驱动了视觉编码器的深度进化。
精华内容
如何在不进行昂贵重训的前提下,将大语言模型的能力高效引入CLIP?LLM2CLIP给出的答案并非简单的替换,而是一套精巧的、赋予模型判别性的两阶段策略。
CLIP的文本困境
CLIP模型虽是跨模态领域的里程碑,但其文本能力的滞后正成为性能天花板。主要体现在三方面:其一,文本编码器上下文窗口极窄,仅支持77个token,难以处理长文本和复杂描述;其二,文本编码器参数量通常只有视觉编码器的十分之一,容量有限,难以吸收丰富语言知识;其三,与大语言模型相比,其在语义理解和推理上差距显著,无法有效利用语言先验。
赋予判别性
直接用LLM替换CLIP文本编码器几乎总是失败,因为LLM的生成式特征不具备跨模态对齐所需的判别性。LLM2CLIP的第一阶段创新性地引入了Caption-to-Caption对比学习。该阶段使用高质量图像描述数据对LLM进行微调,使其在嵌入空间中能精准区分语义相近但指向不同的图像描述。这一步成功将LLM从生成模型转变为适合跨模态学习的文本嵌入模型,为后续对齐奠定了坚实基础。
高效对齐与收益
第二阶段,将经过微调的LLM与CLIP的视觉编码器进行跨模态对齐。该方法冻结LLM主体,仅通过轻量级适配器实现特征映射,同时对视觉编码器进行微调。这种设计带来了巨大的工程优势,以8B参数LLM为例,训练速度提升13倍,显存占用缩减至1/20。更重要的是,它打破了传统CLIP对海量数据的依赖,仅用3-15M图文数据即可实现对现有SOTA模型(如SigLIP-2)的性能超越。
视觉能力的进化
LLM2CLIP的价值不止于文本。实验发现,引入LLM后,更细粒度和结构化的文本监督信号反向驱动了视觉编码器的进化。在零样本目标检测、图像分割及ImageNet线性探测等任务上,均取得稳健性能增长。甚至在将LLaVA-1.5的视觉编码器替换为LLM2CLIP训练后的版本后,在超过87.5%的多模态基准测试中,性能都得到了全面提升,证明其构建了一个更强大的视觉表征基础。
LLM2CLIP的意义在于,它从底层解决了CLIP的文本短板,并提出了一种高效引入LLM能力的范式。将语言视为引导表征学习的“知识中枢”,这为多模态模型建立对世界更深邃的洞察提供了可能,未来的应用场景值得期待。