张大妈

超越CLIP,北大开源细粒度视觉识别大模型,每类识别训练仅需4张图像

源自今日头条:36氪

02-16 12:28

针对多模态大模型在细粒度视觉识别任务上的不足,北京大学彭宇新教授团队提出Fine-R1模型,通过思维链推理增强技术,在每类仅需4张训练图像的情况下,实现了超越CLIP等主流模型的识别性能,为开放域细粒度识别提供了新思路。

超越CLIP,北大开源细粒度视觉识别大模型,每类识别训练仅需4张图像智能速览

  • Fine-R1突破传统方法局限,实现开放域任意类别细粒度识别

  • 采用思维链监督微调,模拟人类思考过程构建推理能力

  • 三元组增强策略同时提升类内差异鲁棒性和类间差异辨识性

  • 在6个权威数据集上超越CLIP、SigLIP等判别式模型

  • 模型主要通过提升知识运用能力而非增加知识储备实现性能提升

  • 论文已被ICLR 2026接收,代码模型已完全开源

超越CLIP,北大开源细粒度视觉识别大模型,每类识别训练仅需4张图像精华内容

传统细粒度识别方法面临数据需求大、泛化能力弱的双重挑战。Fine-R1通过创新的两阶段方案,将生成式大模型的优势引入判别式任务,实现了数据效率的显著突破。

技术框架创新

Fine-R1构建了包含两个核心步骤的创新框架。第一阶段基于Qwen2.5-VL-32B构建结构化思维链,将推理过程拆解为视觉分析、候选子类别生成、对比分析和最终预测四个步骤。

第二阶段采用三元组增强策略优化,针对细粒度识别中类内差异大、类间差异小的特点,通过正负样本对比学习,同时提升模型对类内差异的鲁棒性与类间差异的辨识性。

这种设计巧妙地将人类认知过程融入AI模型,使其能够像专家一样逐步推理得出结论。

类内类间增强

三元组增强策略是Fine-R1的关键技术创新。系统为每张输入图像匹配同一子类别的正样本和外观相似但不同类别的负样本,构成训练三元组。

类内增强利用输入图像及其正样本的思考轨迹,捕获更广泛的类内变化,使模型关注判别性特征而忽略无关特征。实验表明,这种处理有效提升了模型对同类物体不同表现形式的适应能力。

类间增强通过最大化输入/正样本与负样本输出分布的KL散度,增强模型对不同子类别的区分能力。这使得模型能够准确识别外观高度相似的不同子类别。

性能超越基准

实验结果充分验证了Fine-R1的卓越性能。在6个权威细粒度图像分类数据集的封闭式识别测试中,Fine-R1在每类仅需4张训练图像的情况下,识别准确率全面超越OpenAI的CLIP和谷歌DeepMind的SigLIP等判别式模型。

开放式识别测试结果同样令人印象深刻。在不预先给定候选类别的问答题形式下,Fine-R1依然保持了对训练集内外子类别的优秀识别能力,超越了主流通用多模态大模型与推理大模型。

这种在极少数据下的强大表现,为实际应用中的细粒度识别任务提供了可行方案。

性能提升归因

通过深入分析Fine-R1取得突破的原因,研究团队提出了三个假设并进行了验证:视觉表征辨识度提升、子类别知识储备度提升、子类别知识运用能力提升。

实验分析明确表明,Fine-R1主要通过提升模型运用细粒度子类别知识的能力来提高识别准确率,而非简单地优化视觉表征或增加知识储备。

这一发现具有重要的理论意义,说明在现有模型基础上,通过改进推理机制可以显著提升性能,为后续研究指明了方向。

Fine-R1的开源标志着细粒度视觉识别领域的重要进展。思维链推理与三元组增强的结合,不仅解决了数据稀缺问题,更展现了生成式模型在判别式任务上的巨大潜力。随着技术不断完善,这种高效识别方案将在工业质检、生物分类等领域发挥更大作用。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章