张大妈

LLM2CLIP:以大语言模型重塑跨模态表征学习的文本基石

源自今日头条:微软亚洲研究院

01-31 19:02

跨模态模型CLIP的文本能力是其性能提升的关键瓶颈。微软亚洲研究院的LLM2CLIP项目,通过创新的两阶段训练策略,成功将大语言模型的知识潜力高效融入,不仅大幅提升了图文检索性能,还显著降低了训练成本,为多模态学习的发展开辟了新路径。

LLM2CLIP:以大语言模型重塑跨模态表征学习的文本基石智能速览

  • CLIP的文本编码器存在上下文窗口窄、容量有限等问题,限制了跨模态性能。

  • 直接用LLM替换CLIP文本编码器会失败,因为其特征不具备跨模态对齐所需的判别性。

  • LLM2CLIP提出Caption-Contrastive微调,赋予LLM判别能力,是成功的关键。

  • 新方法仅需少量数据(3-15M图文对)即可实现对现有模型的超越。

  • 引入LLM后,更强的文本监督反向驱动了视觉编码器的深度进化。

LLM2CLIP:以大语言模型重塑跨模态表征学习的文本基石精华内容

如何在不进行昂贵重训的前提下,将大语言模型的能力高效引入CLIP?LLM2CLIP给出的答案并非简单的替换,而是一套精巧的、赋予模型判别性的两阶段策略。

CLIP的文本困境

CLIP模型虽是跨模态领域的里程碑,但其文本能力的滞后正成为性能天花板。主要体现在三方面:其一,文本编码器上下文窗口极窄,仅支持77个token,难以处理长文本和复杂描述;其二,文本编码器参数量通常只有视觉编码器的十分之一,容量有限,难以吸收丰富语言知识;其三,与大语言模型相比,其在语义理解和推理上差距显著,无法有效利用语言先验。

赋予判别性

直接用LLM替换CLIP文本编码器几乎总是失败,因为LLM的生成式特征不具备跨模态对齐所需的判别性。LLM2CLIP的第一阶段创新性地引入了Caption-to-Caption对比学习。该阶段使用高质量图像描述数据对LLM进行微调,使其在嵌入空间中能精准区分语义相近但指向不同的图像描述。这一步成功将LLM从生成模型转变为适合跨模态学习的文本嵌入模型,为后续对齐奠定了坚实基础。

高效对齐与收益

第二阶段,将经过微调的LLM与CLIP的视觉编码器进行跨模态对齐。该方法冻结LLM主体,仅通过轻量级适配器实现特征映射,同时对视觉编码器进行微调。这种设计带来了巨大的工程优势,以8B参数LLM为例,训练速度提升13倍,显存占用缩减至1/20。更重要的是,它打破了传统CLIP对海量数据的依赖,仅用3-15M图文数据即可实现对现有SOTA模型(如SigLIP-2)的性能超越。

视觉能力的进化

LLM2CLIP的价值不止于文本。实验发现,引入LLM后,更细粒度和结构化的文本监督信号反向驱动了视觉编码器的进化。在零样本目标检测、图像分割及ImageNet线性探测等任务上,均取得稳健性能增长。甚至在将LLaVA-1.5的视觉编码器替换为LLM2CLIP训练后的版本后,在超过87.5%的多模态基准测试中,性能都得到了全面提升,证明其构建了一个更强大的视觉表征基础。

LLM2CLIP的意义在于,它从底层解决了CLIP的文本短板,并提出了一种高效引入LLM能力的范式。将语言视为引导表征学习的“知识中枢”,这为多模态模型建立对世界更深邃的洞察提供了可能,未来的应用场景值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章