传统的图片相似度搜索多关注物体与属性,但在捕捉图片间的抽象构图逻辑上存在局限。一种名为关系视觉相似度的新方法应运而生,它致力于度量图片中元素间的逻辑关联而非表面实体,为理解讽刺画、梗图等复杂视觉内容提供了新思路,并可能革新以图搜图的体验。

智能速览
关系视觉相似度旨在捕捉图片间的构图逻辑,而非实体属性。
通过人工与模型协作,从海量数据中筛选出具有内在逻辑的‘有趣图片’。
采用实体无关的‘匿名描述’来标注图片的核心关系结构。
利用视觉语言模型(VLM)的世界知识来学习高度抽象的关系特征。
实验证明,该方法在关系逻辑相似度检索上显著优于传统模型。
精华内容
要实现这种对逻辑关系的捕捉,关键在于构建合适的数据与模型。该方法并非直接套用现有数据集,而是从源头出发,设计了一套全新的数据筛选与标注流程,并选择具备世界知识的视觉语言模型作为核心。
超越实体相似
传统视觉相似度模型如CLIP,核心是度量图片中的实体、属性等表层元素的相近程度。这种训练方式源于ImageNet、CLIP等数据集本身以高频视觉概念(如物体类别、颜色)为中心构建。这种方法能轻易找到同样包含‘狗’和‘相机’的图片,但对于构图中‘A对B做C’这种逻辑关系的捕捉却力不从心。例如,一张‘狗拿着相机拍照’的图片,其逻辑类比版本可能是‘熊拿着望远镜观察’,二者实体迥异,但逻辑结构高度相似,传统模型难以关联。
筛选有趣图片
建模关系逻辑的第一步是构建合适的数据集。研究者从海量LAION-2B数据中手动标注了种子数据,标准是‘图像中是否存在可用于创作或关联其他图像的关系模式、逻辑或结构?’。随后,他们微调了Qwen2.5-VL-7B模型作为二元分类器,该模型与人类判断的一致性达到93%。利用这个高效筛选器,研究者最终成功从LAION-2B中筛选出114k张蕴含内在逻辑的‘有趣图片’。
生成匿名描述
为了让模型学习实体无关的逻辑,研究者提出了‘匿名描述’,即描述图中互动关系而不绑定具体实体。为了生成高质量描述,研究者采用了图片分组标注的方式。例如,将一组蝴蝶飞行序列图归为一类,能帮助标注者聚焦于‘物体A以特定模式运动’这一核心逻辑,而非‘蝴蝶’这一具体实体。通过‘人工分组+模型生成+人类验证’的流程,为532个图像组生成了高质量的匿名描述。
VLM的世界知识
关系逻辑的高度抽象性,要求模型不仅要懂视觉,还需具备世界知识以理解讽刺、类比等复杂内涵。研究者选择Qwen2.5-VL-7B作为骨干网络,而非纯视觉编码器。具体实现上,在图像输入后附加一个可学习的查询令牌,用于引导模型提取关系特征。消融实验明确指出,即使使用相同数据微调,CLIP、DINO等纯视觉模型的效果也远逊于VLM,因为后者拥有的世界知识是实现关系推理的关键。
新度量与新可能
通过GPT自动评分与人工双盲评估,新方法在关系相似度检索上展现出显著优势。在一个可视化分析中,横轴代表实体相似度,纵轴代表关系相似度,新方法能精准定位到逻辑相似但实体不同的图片。该技术不仅可用于以图搜图,还能应用于类比图片生成,并能更有效地关联‘梗图’及其延伸作品,为理解讽刺、暗喻等复杂视觉内容打开了新的大门。
关系视觉相似度的提出,将图片相似度的衡量从‘是什么’的层面提升到了‘怎么样’的维度,赋予了机器理解图像内在逻辑与世界知识的能力。这不仅是技术的进步,更可能改变我们与视觉信息交互的方式。未来,当AI能真正看懂一幅讽刺画的弦外之音时,我们的世界会发生怎样的变化?