多模态检索一直面临技术与数据挑战,Qwen团队推出的Qwen3-VL-Embedding与Reranker框架提供了一套新解法。该框架统一处理文本、图像、视频等多种模态,通过先进的架构设计和训练范式,在多项任务中实现了性能突破,为构建高效的多模态RAG系统提供了强有力的技术底座。
智能速览
Qwen3-VL推出统一框架,支持多模态检索与重排序。
支持32K长文本输入和30余种语言,提供2B与8B两种参数版本。
采用多阶段训练策略,从预训练到知识蒸馏逐步优化模型性能。
创新数据构建流程,通过三步法确保高质量跨模态数据对齐。
支持Matryoshka表示学习,可灵活调整嵌入维度以适配不同场景。
精华内容
要理解这一新框架的突破性,需要深入其架构设计与训练策略。下面将从技术内核、数据构建和训练方法三个层面,对其核心技术进行解析。
统一双塔架构
该框架包含两个核心模型。Qwen3-VL-Embedding采用双编码器架构,分别对查询和文档进行编码,通过计算两者向量间的余弦相似度来度量相关性,适合快速大规模检索。
Qwen3-VL-Reranker则采用交叉编码器架构,通过深度交叉注意力机制让查询与文档进行充分交互,直接输出“yes/no”的概率来判断相关性,能对召回结果进行精准重排。
核心技术创新
模型集成了多项先进技术。其中,Matryoshka表示学习(MRL)使得模型生成的向量支持灵活截断,即使用低维度的前缀也能保持较好性能,无需重新训练即可适配不同的存储和计算限制。
此外,模型还采用了量化感知训练(QAT),使用LSQ量化策略,实现了INT8量化下几乎无性能损失,大幅提升了推理效率。
精细化数据构建
高质量的数据是模型成功的基石。其数据构建流程分为三步:首先,构建种子池,从MS-COCO、Flickr30k等公开数据集中筛选高质量样本,并剔除低分辨率图像和低帧率视频,同时利用GME嵌入模型计算跨模态相似度,只保留相似度大于0.7的强相关样本。
其次,利用Qwen3-VL-32B大模型对种子池数据进行自动标注合成,生成细粒度的“指令-查询-语料-标签”格式的训练数据。最后,进行样本优化,通过召回Top-K候选并进行相关性过滤,挖掘出高质量的正样本和难负样本。
三阶段训练范式
模型训练采用精细化的多阶段策略。第一阶段是基于大规模合成数据进行对比学习预训练,让模型掌握基础的语义表示能力。
第二阶段是微调,针对嵌入模型进行多任务对比学习,并为重排模型使用检索专用数据进行微调。第三阶段则进行知识蒸馏与融合,将重排模型的精准判断能力蒸馏到嵌入模型中,再通过模型融合技术平衡多任务性能,最终得到统一的强大模型。
Qwen3-VL-Embedding与Reranker通过统一的框架设计、精细的数据处理和多阶段的训练策略,为多模态检索领域带来了新的标杆。其灵活性和强大的性能预示着更复杂、更智能的多模态应用将成为可能。这一技术将如何改变我们与多模态信息的交互方式?