GLM-Image作为首个国产链路训练的工业级离散自回归图像生成模型正式开源,在文字生成领域达到SOTA水平。该模型采用创新的双模块架构设计,结合自回归和扩散解码技术,实现了高质量图像生成,并已适配Ascend NPU和NV GPU双平台推理。
智能速览
GLM-Image是首个国产链路训练的工业级离散自回归图像生成模型
模型采用AR模块+Diffusion Decoder双模块架构设计
AR模块新增16512个视觉token,实现离散视觉token生成
开源实现基于transformers+diffusers框架
首发支持Ascend NPU和NV GPU双平台推理
正在与vLLM、SGLang合作优化推理速度
精华内容
GLM-Image的开源标志着国产图像生成技术的重要突破,其独特的双模块架构设计为工业级应用提供了新的技术范式。
双模块架构
GLM-Image采用创新的双模块架构设计,将图像生成过程拆分为两个关键阶段。Autoregressive(AR)模块负责生成离散视觉token,本质上是一个多模态理解+生成系统。该模块包含GLM-4-0414-9B结构的语言模型、X-Omni-En的ViT和VQVAE,在原词表前新增了16512个视觉token,这也是模型lm head的大小。AR模块的输出结果不是直接出图,而是先产出一串离散视觉token,作为后续处理的中间表示。
Diffusion Decoder模块则负责将token转换为高质量图像,包含DiT(Diffusion Transformer)Glyph和VAE,与去年发布的CogView4相似,采用经典的Diffusion结构。这种设计实现了生成过程的可控性和质量的平衡。
图生图实现
在图生图和多图生图功能上,GLM-Image采用了统一的处理机制。不管输入多少张图以及什么比例,AR模块的ViT会先将所有参考图编码成Image Token。这种处理方式与GLM-V类似,确保了多模态信息的有效融合。
编码后的token不仅给AR模块使用,还会复用到DiT模块中作为condition_token(条件输入),让生成结果更贴近参考图的特征。这种设计实现了图像到图像的精准转换,保持了参考图的核心特征同时允许创意性的生成变化。
开源适配
GLM-Image的开源实现采用了业界主流的transformers+diffusers组合。开发者分别为transformers和diffusers提交了PR,在transformers中集成了AR部分,在diffusers中集成了DiT+VAE,并组装成完整的Pipeline。这是目前提交过最大的一组PR,得到了Hugging Face团队的大力支持。
由于模型就是在Ascend NPU上训练的,适配NPU的过程工作量相对较少,实现了首发即支持Ascend NPU和NV GPU的推理。目前团队正在与vLLM、SGLang的开发者积极沟通,重点优化AR模型的推理加速,以实现更快的推理速度。
GLM-Image的开源为国产AI图像生成领域注入了新的活力,其独特的双模块架构和全链路国产化训练具有重要的技术价值。随着推理优化的持续推进,这一模型有望在工业级应用中发挥更大作用,推动认知型生成技术的发展。
关键评论
全在国产卡上训的,nb,难度不得拉大了
今天在910B上试了下文生图,速度比较慢,耗时160秒左右,请问楼主有什么方法优化提升速度吗
你好,很棒的工作。可以请教一下模型架构上面,GLM-Image和blip3o-next比的优势有哪些