张大妈

GLM-Image 发布啦!

源自小红薯:karminski

01-22 14:07

智谱新发布的文生图模型GLM-Image采用了创新的混合架构,将自回归生成与扩散解码相结合。这一设计不仅在开源模型中实现了领先的文本渲染准确率,还在多对象生成等复杂任务上超越了FLUX.1等知名模型,展现了新一代文生图技术的潜力。

GLM-Image 发布啦!智能速览

  • GLM-Image采用自回归与扩散解码的混合架构。

  • 集成Glyph Encoder模块,显著提升图像内文字生成准确度。

  • 在CVTG-2K文本生成测试中取得开源模型最高准确率。

  • 在DPG-Bench多对象生成测试中得分超越FLUX.1[DEV]。

GLM-Image 发布啦!精华内容

GLM-Image的出色表现源于其独特的混合架构设计,它在生成速度与图像质量之间找到了新的平衡点。下面具体解析其技术核心。

混合架构解析

GLM-Image创新性地结合了自回归模块和扩散解码器。自回归生成器部分拥有9B参数,基于GLM-4-9B,负责先生成低分辨率的紧凑编码草稿,再扩展为高分辨率图像的token序列。这一过程为后续精细生成奠定了基础。

扩散解码器部分则为7B参数,基于CogView4的单流DiT架构,专注于将潜空间编码解码为高质量图像,二者分工明确。

精准文本渲染

该模型的一大亮点是集成了Glyph Encoder文本模块。这一专门设计旨在解决文生图模型普遍存在的“书写”难题。通过该模块,模型在生成图像时能更准确地理解和渲染文字,显著减少了错别字和形变问题。

性能基准实测

实测数据印证了其设计优势。在专门测试文本准确率的CVTG-2K基准上,GLM-Image取得了0.9116的分数,为当前开源模型中的最高水平。在考察多对象与空间关系理解的DPG-Bench上,其得分达到84.78,表现优于FLUX.1[DEV]模型。

GLM-Image的出现,为开源文生图领域带来了新的技术路径,其混合架构设计和高精度文本生成能力值得关注。未来它能否在更广泛的应用场景中展现优势,值得持续观察。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章