智谱开源的GLM-Image图像生成模型,凭借混合自回归与扩散解码器架构,在文本渲染和知识密集型场景中优势显著。该模型不仅支持高分辨率文生图,还覆盖多种图生图任务,为开发者提供了功能强大的新选择。下文将深入其技术核心与性能表现。
智能速览
采用混合自回归与扩散解码器架构,提升生成质量。
在文本渲染和知识密集型生成任务中优势显著。
单一模型同时支持文生图和多种图生图任务。
引入解耦强化学习后训练,优化细节与语义对齐。
推理时需要超过80GB显存的GPU,硬件门槛较高。
精华内容
GLM-Image的核心创新在于其独特的架构设计与训练策略,这使得它在处理复杂文本和知识信息时,相比主流扩散模型有了质的提升。
混合架构设计
GLM-Image采用了混合自回归与扩散解码器的创新架构。其自回归生成器是一个基于GLM-4-9B的90亿参数模型,负责生成约256个token的紧凑编码,随后扩展至1K-4K token,为高分辨率图像打下基础。
扩散解码器则是一个70亿参数的单流DiT架构模型,用于在潜在空间中解码图像。它特别配备了Glyph Encoder文本模块,专门用于提升图像中文本渲染的准确性。
强化训练策略
模型训练中引入了基于GRPO算法的解耦强化学习后训练方法,这是一种模块化的反馈策略。自回归模块接收低频反馈信号,专注于提升图像的美学质量和语义对齐度。
解码器模块则接收高频反馈信号,专门优化图像的细节保真度和文本的准确性,从而生成高度逼真的纹理和精确的文本。该策略显著提升了模型的指令遵循能力和艺术表现力。
性能基准对比
在文本渲染能力上,GLM-Image表现突出。在LongText-Bench测试中,其Word Accuracy达到0.9116,超越了对比的开源模型如Qwen-Image和Z-Image。在NED(越低越好)指标上,其0.9557的成绩也接近最优水平。
在常规文生图任务(如TIIF-Bench)中,GLM-Image的得分为0.511,与Qwen-Image等主流开源模型性能相当,但在处理包含复杂知识或密集文本的提示词时,其优势更为明显。
使用门槛与注意
使用GLM-Image需要较高的硬件配置,目前推理需要单张显存超过80GB的GPU,或采用多GPU配置,这限制了其在个人设备上的部署。同时,目标图像的分辨率必须能被32整除。
模型自回归部分的默认配置为do_sample=True,temperature为0.9,top-p为0.75。较高的温度可以生成更多样化的图像,但也可能降低输出的稳定性。开发者可通过SGLang等框架进行加速,目前相关集成工作正在进行中。
GLM-Image通过其创新的架构和训练方法,为开源图像生成领域带来了新的突破,特别是在处理复杂文本信息方面。尽管目前硬件门槛较高,但随着推理优化技术的集成,其应用潜力巨大。它能否成为下一代图像生成的主流选择之一?