张大妈

GLM-Image 发布啦!

源自小红薯:karminski

01-18 16:44

智谱新发布的文生图模型GLM-Image备受关注。它采用创新的混合架构,结合自回归与扩散模型优势,在文本渲染准确性上取得突破,为高质量图像生成提供了新的技术路径。

GLM-Image 发布啦!智能速览

  • 智谱正式发布全新文生图大模型GLM-Image。

  • 该模型采用9B自回归生成器与7B扩散解码器的混合架构。

  • 新增的Glyph Encoder模块显著提升了图像内文字生成的准确性。

  • 在CVTG-2K文字生成测试中准确率达0.9116,为开源模型最高。

  • 在DPG-Bench多对象生成测试中以84.78分超越FLUX.1[DEV]。

GLM-Image 发布啦!精华内容

GLM-Image的出色表现并非偶然,其背后是独特的架构设计与技术创新的支撑。

混合架构解析

GLM-Image的核心在于其创新的混合架构。模型由两部分组成:一个9B参数的自回归生成器和一个7B参数的扩散解码器。这种设计旨在结合自回归模型的全局理解能力与扩散模型在高质量图像生成上的优势,实现从概念到画面的高效转换。

自回归生成器

自回归生成器基于GLM-4-9B模型初始化,并扩展了词表以支持视觉token。它的工作流程是先生成约256个token的低分辨率“草稿”,然后将其扩展至1K-4K token,最终对应输出1K-2K分辨率的高清图像。这种方式有效平衡了生成速度与最终质量。

扩散解码器

扩散解码器则负责将潜空间的编码解码为最终图像。它基于CogView4的单流DiT架构,并特别配备了Glyph Encoder文本模块。这一关键模块专门用于处理文本渲染问题,能显著提升生成图像中文字的准确性和清晰度,解决了以往文生图模型在处理文字时常出现的“乱码”难题。

性能基准实测

在关键的基准测试中,GLM-Image展现了领先实力。在专门测试文字生成能力的CVTG-2K评测中,其文字准确率达到了0.9116,是目前开源模型中的最高水平。同时,在考察多对象生成与空间关系理解能力的DPG-Bench测试中,GLM-Image获得了84.78分,表现优于同期的FLUX.1[DEV]模型。

GLM-Image的推出,为文生图领域带来了新的技术思路和强有力的竞争者。其在文本渲染上的突破尤其值得肯定,未来的实际应用表现值得持续关注和期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章