张大妈

腾讯开源Youtu-VL:AI视觉理解新范式

源自小红薯:智

03-04 17:05

当前视觉语言模型普遍存在“走马观花”的问题,难以捕捉图像细节。腾讯优图实验室开源的Youtu-VL模型,通过提出VLUAS新范式,将视觉信号作为预测目标,从根本上提升了AI的视觉理解精度,为通用视觉智能体的发展奠定了重要基础。

腾讯开源Youtu-VL:AI视觉理解新范式智能速览

  • Youtu-VL提出VLUAS新范式,将视觉信号也作为预测目标。

  • 通过统一视觉代码本,实现视觉与文本在同一框架下学习。

  • 在75项基准测试中表现优异,多项视觉任务达到领先水平。

  • 核心技术包括协同视觉标记器和端到端训练。

  • 已开源论文、代码与模型,推动技术社区发展。

腾讯开源Youtu-VL:AI视觉理解新范式精华内容

传统的视觉语言模型常因粗粒度理解而丢失图像细节,Youtu-VL的出现,正是为了从根本上改变这一现状,让AI的视觉能力向精细化迈进。

核心突破:VLUAS范式

Youtu-VL的核心创新在于提出了【视觉-语言统一自监督】范式。它实现了两大关键突破:首先,将模式从传统的“vision as input”转变为“vision as target”,强迫模型不仅要生成文本,还要重建图像细节,从而迫使AI更深入地观察视觉内容。

其次,它构建了一个统一的视觉代码本,用离散的视觉词元来扩展传统的文本词表,使得视觉信息和文本信息能够在同一个统一的框架内进行学习和表征,解决了模态间的隔阂问题。

技术亮点解析

为支撑VLUAS范式,Youtu-VL整合了多项关键技术。其中,协同视觉标记器融合了SigLIP-2的强语义信息和DINOv3的精细几何信息,能够生成既包含内容又包含结构的视觉词元。

此外,NTP-M多标签监督机制被用于处理图像中并存的多个目标,提升了模型在复杂场景下的理解能力。整个模型采用端到端训练,无需依赖任何针对特定任务的额外模块,简化了架构并增强了通用性。

性能实测与成果

Youtu-VL的性能在多达75个基准测试上得到了全面验证,覆盖了多种视觉和多模态任务。在核心的视觉中心任务上,其表现尤为突出:在COCO数据集上的目标检测任务达到了47.1%的mAP;在ADE20K数据集上的语义分割任务取得了54.2 mIoU的成绩;在NYUv2数据集上的深度估计任务达到了90.4%的δ1精度。

此外,在RefCOCO系列的视觉定位任务上,平均准确率高达91.8%,证明了其精准的区域理解能力。

未来可期

尽管已取得显著成果,Youtu-VL仍有明确的未来发展方向。研究团队计划进一步提升模型对高分辨率输入的处理能力,以捕捉更精细的视觉表示。同时,将增强其在复杂几何任务上的零样本能力,减少对标注数据的依赖。

此外,强化模型的数学推理和知识密集型任务处理能力,也是通往更通用人工智能的重要一步,旨在让模型不仅能“看”,更能“思考”。

Youtu-VL的成功证明了,一个标准的VLM架构,通过正确的训练范式革新,便可以原生支持多样化的视觉任务,而无需为每个任务单独设计模型。这项工作为构建能够理解并与视觉世界交互的通用智能体铺平了道路,或许我们离真正的AI视觉通用智能已不再遥远。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章