张大妈

用两个词就表示任何图像区域,这方法太神奇

源自小红薯:代码熊大模型论文分享

01-31 19:53

多模态大模型在像素级理解上常因架构复杂而受限。一项名为SAMTok的技术为此提供了革新方案,它能将任意图像掩码转换为两个特殊文本标记。这种“掩码语言”让大语言模型能像处理文字一样学习视觉区域信息,无需修改模型架构,为解决像素级交互难题开辟了新路径。

用两个词就表示任何图像区域,这方法太神奇智能速览

  • SAMTok将复杂图像掩码转换为两个特殊文本标记,简化了像素级理解流程。

  • 该技术让基础MLLMs无需修改架构,通过标准预测即可学习视觉能力。

  • 基于SAM2训练的SAMTok,在多项视觉任务上取得了最先进的成果。

  • 结合强化学习后,模型在分割等任务上的性能得到显著提升。

用两个词就表示任何图像区域,这方法太神奇精华内容

这项技术的巧妙之处在于,它没有选择优化复杂的模型结构,而是另辟蹊径,将视觉问题巧妙地转化为了语言问题。

像素级理解的困境

现有多模态大语言模型在实现像素级理解时面临显著挑战。它们通常需要依赖复杂的区域级编码器和专门的分割解码器,这不仅增加了模型的结构复杂性,还带来了不兼容的训练目标。由于缺乏统一的处理机制来同时支持掩码的输入和输出,模型要么需要精心设计的特征池化方案,要么依赖专门的解码器架构,导致整个系统难以扩展和优化。

掩码标记化突破

为解决上述难题,SAMTok被提出,它是一个离散的掩码标记化器。其核心创新在于将任意形状的区域掩码转换为两个特殊的文本标记,并能以高保真度重建。SAMTok建立在SAM2的基础上,利用掩码编码器和残差向量量化器,在包含2.09亿个多样化掩码的数据集上进行训练,最终生成了离散、紧凑且信息丰富的标记。

卓越性能验证

研究人员使用500万个SAMTok格式的掩码数据样本对QwenVL模型进行监督微调,得到的QwenVL-SAMTok模型在多个任务上取得了领先成果。这些任务涵盖了区域描述、区域视觉问答、参考分割、场景图解析以及多轮交互式分割等,证明了该方法的普适性和有效性,让基础模型获得了强大的像素级理解与生成能力。

强化学习的加持

得益于SAMTok将掩码表示为离散的文本标记,研究者得以探索使用强化学习来进一步突破性能上限。他们提出了一种文本答案匹配奖励函数,并应用GRPO算法进行优化。实验结果显示,在GRES验证集上,模型的gIoU提升了8.9%,N-acc提升了21.0%;在GCG验证集上,AP50提升了4.7%,Recall提升了6.6%,效果显著。

SAMTok技术通过创新的掩码标记化思路,极大地简化了多模态大模型获取像素级能力的门槛,展现了惊人的效果。这种化繁为简的方法论,或许将为未来AI的视觉乃至多模态交互方式带来哪些深远的影响?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章