张大妈

AAAI 2026 杰出论文 | 同济&微软等提出 LLM2CLIP:补足 CLIP 难以处理长文本的遗憾

源自公众号:我爱计算机视觉

02-02 19:53

CLIP模型虽是多模态基石,但其文本编码器的77个Token长度限制,已成为理解复杂图像描述的瓶颈。LLM2CLIP方案巧妙地将大语言模型的知识注入CLIP,不仅攻克了长文本检索难题,还赋予了模型强大的多语言处理能力,同时保持了极高的训练效率,为多模态领域带来了突破性进展。

AAAI 2026 杰出论文 | 同济&微软等提出 LLM2CLIP:补足 CLIP 难以处理长文本的遗憾智能速览

  • LLM2CLIP通过注入大语言模型知识,解决了CLIP文本编码器的长文本瓶颈。

  • 采用两阶段微调方案,有效提升了LLM的特征区分度并实现了与视觉编码器的对齐。

  • 在长文本检索任务上,平均精度提升高达15个点,性能实现跨越式发展。

  • 继承了LLM的多语言能力,让英文模型能胜任中文等语言的顶尖检索任务。

  • 凭借离线特征加载策略,将模型微调时间从17小时缩短至1.3小时,效率惊人。

AAAI 2026 杰出论文 | 同济&微软等提出 LLM2CLIP:补足 CLIP 难以处理长文本的遗憾精华内容

LLM2CLIP究竟是如何巧妙地将大模型融入CLIP,并实现如此显著的性能飞跃?其背后的两阶段训练方法和高效策略,为我们揭示了提升多模态模型上限的全新路径。

CLIP的语言瓶颈

自2021年发布以来,CLIP已成为多模态领域的标配架构,但其文本编码器的局限性日益凸显。它不仅有77个Token的硬性长度限制,其较小的Transformer结构也难以胜任处理复杂、长篇的图像描述任务。

尽管大语言模型(LLM)在文本理解上已达到极高水准,但直接将其用作CLIP的文本编码器却面临两大挑战。一是特征可分性问题,原始LLM的特征空间并非为对比学习设计,在图像检索任务中准确率极低,实验显示Llama 3的Top-1准确率甚至不足6%。二是高昂的训练成本,微调一个7B或更大的LLM所带来的算力开销难以承受。

两阶段注入方案

为应对上述挑战,LLM2CLIP设计了一个精巧的两阶段微调方案。

第一阶段是LLM描述对比微调(CC Fine-tuning),旨在解决LLM特征区分度不足的问题。研究者通过移除LLM的因果掩码,改为双向注意力机制,并利用LoRA技术在高质量描述语料上进行对比学习。经过此阶段,Llama 3在COCO描述检索任务上的准确率从5.2%飙升至29.5%。

第二阶段是LLM2CLIP后微调,目标是将具备良好特征区分度的LLM与视觉编码器对齐。此阶段冻结LLM,仅在其后添加一个4层线性适配器,并采用“离线特征加载”策略,预先计算并存储所有文本特征,使训练成本几乎与普通CLIP微调持平。

跨越式性能提升

实验结果表明,LLM2CLIP在多项基准测试中均实现了全方位的性能跨越。

在检索任务上,无论是在长文本数据集(如DOCCI和Urban1K)还是短文本数据集(如Flickr和COCO)上,LLM2CLIP均展现出统治级表现。例如,在DOCCI数据集上,它使SigLIP2的平均检索精度提升了14-15个点。

此外,LLM2CLIP意外地赋予了模型强大的多语言能力。由于LLM本身在海量多语言语料上训练,原本只支持英文的EVA02模型在经过LLM2CLIP增强后,在中文检索任务上直接达到顶尖水平。

效率与通用性

LLM2CLIP的另一大亮点是其惊人的训练效率。通过“离线特征加载”策略,在两台8卡A100机器上,Stage 2的训练时间从原来的17小时大幅缩短至1.3小时,使得普通研究团队也能轻松复现。

该框架还展现出极强的通用性。研究团队测试发现,即使是像DeepSeek-R1-Distill-Llama-8B这样的最新模型,经过CC Fine-tuning后也能作为极佳的文本编码器,其平均检索精度达到了83.5/80.5。

LLM2CLIP的成功证明,多模态模型的上限取决于语言端对世界的理解深度。这种通过引入LLM知识并辅以少量高质量数据实现视觉表征质变的方案,为未来的多模态预训练开辟了新范式。当语言模型能够更深刻地理解世界,视觉表征的潜力也将被无限释放。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章