张大妈

基于AR的多模态理解生成模型NextFlow来了

源自小红薯:AI小小将

02-05 16:32

字节推出的NextFlow模型,通过统一的自回归架构实现了多模态理解与生成的突破。其独特的‘下一尺度’预测技术,不仅将图像生成速度提升至5秒,更在质量上媲美专用扩散模型,为AI生成领域带来了新的范式。

基于AR的多模态理解生成模型NextFlow来了智能速览

  • NextFlow是一个统一的解码器式自回归Transformer模型。

  • 在视觉生成中采用‘下一尺度’预测,替代传统扫描方式。

  • 实现5秒生成1024×1024分辨率图像,速度数量级提升。

  • 视觉质量可与专用扩散模型相抗衡。

  • 应用覆盖图像编辑、图文交错生成及视频生成。

基于AR的多模态理解生成模型NextFlow来了精华内容

NextFlow的核心创新在于其架构设计,它巧妙地处理了文本与图像的结构差异,从而带来了性能上的飞跃。

统一架构创新

NextFlow的核心是统一的解码器式自回归架构。它通过在6万亿规模的文本-图像交错数据上进行训练,原生具备了多模态能力。该设计的精妙之处在于识别了不同模态的本质差异:文本是严格的序列结构,而图像是层级结构。因此,模型在文本生成时沿用下一token预测,在视觉生成时则创新性地采用了‘下一尺度’预测,彻底摆脱了传统逐像素或逐patch的扫描方式。

生成速度飞跃

正是基于‘下一尺度’预测的架构革新,NextFlow在生成效率上实现了突破。模型能够在短短5秒内生成一张1024×1024高分辨率图像。这一速度相较于传统的自回归模型,实现了数量级的提升,极大地缩短了用户的等待时间,让实时或近实时的图像生成应用成为可能。

质量与训练保障

在追求速度的同时,NextFlow并未牺牲生成质量。为了解决多尺度生成可能带来的不稳定性,研发团队提出了一套稳健的训练方法,并引入了面向强化学习的前缀微调策略。实验结果表明,NextFlow的视觉质量已经可以与当前主流的专用扩散模型相抗衡,在统一多模态模型领域达到了业界领先水平。

NextFlow模型为多模态领域提供了一个高效且强大的新选择。它证明了自回归架构在视觉生成上的巨大潜力,未来能否在更多模态和任务中展现其优势,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章