张大妈

简析 GLM-Image 推理链路与开源适配工程

源自小红薯:zR(忙着开源版)

01-17 17:59

GLM-Image作为首个国产链路训练的工业级离散自回归图像生成模型正式开源,在文字生成领域达到SOTA水平。该模型采用创新的双模块架构设计,结合自回归和扩散解码技术,实现了高质量图像生成,并已适配Ascend NPU和NV GPU双平台推理。

简析 GLM-Image 推理链路与开源适配工程智能速览

  • GLM-Image是首个国产链路训练的工业级离散自回归图像生成模型

  • 模型采用AR模块+Diffusion Decoder双模块架构设计

  • AR模块新增16512个视觉token,实现离散视觉token生成

  • 开源实现基于transformers+diffusers框架

  • 首发支持Ascend NPU和NV GPU双平台推理

  • 正在与vLLM、SGLang合作优化推理速度

简析 GLM-Image 推理链路与开源适配工程精华内容

GLM-Image的开源标志着国产图像生成技术的重要突破,其独特的双模块架构设计为工业级应用提供了新的技术范式。

双模块架构

GLM-Image采用创新的双模块架构设计,将图像生成过程拆分为两个关键阶段。Autoregressive(AR)模块负责生成离散视觉token,本质上是一个多模态理解+生成系统。该模块包含GLM-4-0414-9B结构的语言模型、X-Omni-En的ViT和VQVAE,在原词表前新增了16512个视觉token,这也是模型lm head的大小。AR模块的输出结果不是直接出图,而是先产出一串离散视觉token,作为后续处理的中间表示。

Diffusion Decoder模块则负责将token转换为高质量图像,包含DiT(Diffusion Transformer)Glyph和VAE,与去年发布的CogView4相似,采用经典的Diffusion结构。这种设计实现了生成过程的可控性和质量的平衡。

图生图实现

在图生图和多图生图功能上,GLM-Image采用了统一的处理机制。不管输入多少张图以及什么比例,AR模块的ViT会先将所有参考图编码成Image Token。这种处理方式与GLM-V类似,确保了多模态信息的有效融合。

编码后的token不仅给AR模块使用,还会复用到DiT模块中作为condition_token(条件输入),让生成结果更贴近参考图的特征。这种设计实现了图像到图像的精准转换,保持了参考图的核心特征同时允许创意性的生成变化。

开源适配

GLM-Image的开源实现采用了业界主流的transformers+diffusers组合。开发者分别为transformers和diffusers提交了PR,在transformers中集成了AR部分,在diffusers中集成了DiT+VAE,并组装成完整的Pipeline。这是目前提交过最大的一组PR,得到了Hugging Face团队的大力支持。

由于模型就是在Ascend NPU上训练的,适配NPU的过程工作量相对较少,实现了首发即支持Ascend NPU和NV GPU的推理。目前团队正在与vLLM、SGLang的开发者积极沟通,重点优化AR模型的推理加速,以实现更快的推理速度。

GLM-Image的开源为国产AI图像生成领域注入了新的活力,其独特的双模块架构和全链路国产化训练具有重要的技术价值。随着推理优化的持续推进,这一模型有望在工业级应用中发挥更大作用,推动认知型生成技术的发展。

简析 GLM-Image 推理链路与开源适配工程关键评论

  • 全在国产卡上训的,nb,难度不得拉大了

  • 今天在910B上试了下文生图,速度比较慢,耗时160秒左右,请问楼主有什么方法优化提升速度吗

  • 你好,很棒的工作。可以请教一下模型架构上面,GLM-Image和blip3o-next比的优势有哪些

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章