在多模态大模型的构建中,视觉编码器扮演着关键角色,其性能直接决定了模型对图像世界的理解上限。一个普遍的观察是,业界的主流选择正悄然从经典的OpenAI CLIP转向SigLIP。这一转变背后究竟是何种技术考量?本文将深入剖析这一演进路径,揭示从CLIP到SigLIP的技术迭代逻辑,为理解MLLM的最新发展提供清晰的视角。
智能速览
多模态大模型视觉backbone的主流架构是基于ViT。
早期模型普遍选用OpenAI CLIP,尤其是ViT-L/14版本。
CLIP凭借其强大的zero-shot迁移能力与文本对齐性成为首选。
当前新模型正大规模转向SigLIP,成为新的主流选择。
SigLIP通过改进损失函数,解决了CLIP的部分局限性。
精华内容
这一从CLIP到SigLIP的转变,并非简单的技术更迭,而是源于对训练效率和模型性能的深刻反思。接下来,将详细拆解两者的核心差异与演进动因。
早期的霸主CLIP
在2023年及以前,多模态大模型的视觉backbone几乎是OpenAI CLIP的天下。其中,ViT-L/14@336px版本最受青睐。该模型拥有24层Transformer block和1024的hidden size,能够处理336x336的输入图像。
选择CLIP的核心原因在于其卓越的zero-shot迁移能力。通过对比学习范式,CLIP的visual encoder在预训练阶段就天然具备了与文本模态对齐的能力,这为后续与LLM的对接铺平了道路。
其训练目标是InfoNCE loss。在一个batch内,模型会构建一个相似度矩阵,通过softmax归一化,最大化正样本对的相似度,从而学习到图像与文本的关联。
新晋的宠儿SigLIP
进入2024年,业界风向明显转变,SigLIP开始大规模取代CLIP,成为新的主流。目前,最常用的版本是SigLIP-SO400M,其输入分辨率通常为384x384。
SigLIP与CLIP最根本的不同在于其损失函数的改进。它将CLIP使用的softmax contrastive loss替换为了pairwise sigmoid loss。这意味着SigLIP不再进行batch内的全局归一化,而是将每一个图像-文本对视为一个独立的二分类问题(判断是否匹配),从而简化了训练目标。
迭代的深层逻辑
这种从softmax loss到sigmoid loss的转变,带来了显著的性能提升。pairwise sigmoid loss摆脱了batch size的束缚,使得训练过程更加灵活和高效。同时,这种二分类的设定被证明在模型性能上更具优势,能够学习到更精细的图文对齐关系。
尽管ViT架构依然统治着MLLM的视觉端,但其本身也存在计算量大、对高分辨率图像处理效率不高等局限性,这也是当前研究正积极探索的方向。
从CLIP到SigLIP的演进,是多模态模型在追求更高效率和更强性能道路上的一个缩影。技术的更迭从未停止,未来是否会出现更优的视觉backbone架构?这种持续的创新和探索,正不断推动着人工智能向着更通用、更智能的方向迈进。