多模态大模型在像素级理解上常因架构复杂而受限。一项名为SAMTok的技术为此提供了革新方案,它能将任意图像掩码转换为两个特殊文本标记。这种“掩码语言”让大语言模型能像处理文字一样学习视觉区域信息,无需修改模型架构,为解决像素级交互难题开辟了新路径。
智能速览
SAMTok将复杂图像掩码转换为两个特殊文本标记,简化了像素级理解流程。
该技术让基础MLLMs无需修改架构,通过标准预测即可学习视觉能力。
基于SAM2训练的SAMTok,在多项视觉任务上取得了最先进的成果。
结合强化学习后,模型在分割等任务上的性能得到显著提升。
精华内容
这项技术的巧妙之处在于,它没有选择优化复杂的模型结构,而是另辟蹊径,将视觉问题巧妙地转化为了语言问题。
像素级理解的困境
现有多模态大语言模型在实现像素级理解时面临显著挑战。它们通常需要依赖复杂的区域级编码器和专门的分割解码器,这不仅增加了模型的结构复杂性,还带来了不兼容的训练目标。由于缺乏统一的处理机制来同时支持掩码的输入和输出,模型要么需要精心设计的特征池化方案,要么依赖专门的解码器架构,导致整个系统难以扩展和优化。
掩码标记化突破
为解决上述难题,SAMTok被提出,它是一个离散的掩码标记化器。其核心创新在于将任意形状的区域掩码转换为两个特殊的文本标记,并能以高保真度重建。SAMTok建立在SAM2的基础上,利用掩码编码器和残差向量量化器,在包含2.09亿个多样化掩码的数据集上进行训练,最终生成了离散、紧凑且信息丰富的标记。
卓越性能验证
研究人员使用500万个SAMTok格式的掩码数据样本对QwenVL模型进行监督微调,得到的QwenVL-SAMTok模型在多个任务上取得了领先成果。这些任务涵盖了区域描述、区域视觉问答、参考分割、场景图解析以及多轮交互式分割等,证明了该方法的普适性和有效性,让基础模型获得了强大的像素级理解与生成能力。
强化学习的加持
得益于SAMTok将掩码表示为离散的文本标记,研究者得以探索使用强化学习来进一步突破性能上限。他们提出了一种文本答案匹配奖励函数,并应用GRPO算法进行优化。实验结果显示,在GRES验证集上,模型的gIoU提升了8.9%,N-acc提升了21.0%;在GCG验证集上,AP50提升了4.7%,Recall提升了6.6%,效果显著。
SAMTok技术通过创新的掩码标记化思路,极大地简化了多模态大模型获取像素级能力的门槛,展现了惊人的效果。这种化繁为简的方法论,或许将为未来AI的视觉乃至多模态交互方式带来哪些深远的影响?