张大妈

ICLR 2026 统一图像 Tokenizer:SemHiTok

源自小红薯:中山大学通用具身智能中心

02-04 18:52

多模态模型常在理解与生成间难以取舍。SemHiTok提出一种新思路,通过层级式码本设计,在不牺牲语义理解的前提下,有效补充像素细节,为统一模型的发展提供了可行方案。

ICLR 2026 统一图像 Tokenizer:SemHiTok智能速览

  • 核心问题是统一tokenizer在理解与生成任务间的平衡难题。

  • SemHiTok将语义表示与像素建模解耦,构建层级式结构。

  • 语义层使用与文本对齐的模型提取高层特征。

  • 像素层在语义空间内补充细节,不与语义竞争。

  • 该方法可兼容现有自回归多模态模型框架。

  • 实验表明其在理解、生成及统一任务上均有竞争力。

ICLR 2026 统一图像 Tokenizer:SemHiTok精华内容

如何让视觉tokenizer既能“看懂”又能“画好”?SemHiTok的答案是不搞“二选一”,而是设计一个语义引导的层级结构,让像素细节服务于语义理解。

理解与生成的冲突

多模态模型的视觉tokenizer面临一个根本性矛盾。理解任务需要高层语义特征,而生成任务则依赖于像素级的纹理与细节。现有统一tokenizer试图通过混合结构或联合训练来兼顾两者,但常导致语义信息被稀释,或是生成质量因结构限制而下降,难以两全。

层级解耦新思路

SemHiTok的创新在于承认语义与像素的信息层级差异,并据此进行设计。它首先构建语义层,利用与文本对齐的SigLIP等模型提取高层语义,并形成稳定的语义码本。这为多模态理解任务打下了坚实的基础。

语义引导的像素建模

在固定的语义空间基础上,SemHiTok引入像素层建模。针对每一个语义token,模型会构建一个对应的像素子码本。通过SGHC方法,模型在局部语义一致的空间内刻画纹理和颜色细节,使像素建模成为对语义表示的精准补充,而非相互竞争。

解耦结构与统一表示

在实现上,语义与像素分支是解耦的,并采用分阶段训练,避免了联合优化的特征冲突。尽管内部结构分层,但其输出通过维度拼接为单一离散表示,不引入双token流,也不会造成明显的token膨胀。这种设计使其能无缝接入现有的自回归多模态模型。

性能表现验证

实验数据证实了SemHiTok的有效性。在图像重建任务中,它展现出与现有方法相媲美的质量,且高分辨率下细节表现更优。在LLaVA-v1.5设定的多模态理解任务中,其在POPE、SEED、GQA、MME等基准测试上表现稳定。统一模型也证明了其在VQA、推理和文生图等任务上均处于同类方法前列。

SemHiTok为统一视觉tokenizer提供了一种克制且高效的解决方案,通过层级化设计调和了理解与生成的矛盾。这种思路或许能为未来更强大的多模态大模型的发展铺平道路,启发更多关于信息层级编码的探索。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章