张大妈

国产GLM-Image问世,精准渲染汉字不再是难题

源自今日头条:量子位

01-15 16:16

长期以来,AI生成图像中的文字常出现错漏,GLM-Image的出现有效解决了这一痛点。作为中国首个全程在国产芯片上训练的SOTA多模态模型,它在文字渲染方面尤为出色,能精准生成包含复杂汉字的图片。更重要的是,其API调用成本极低,为创意工作者和开发者提供了高性价比的新选择。

国产GLM-Image问世,精准渲染汉字不再是难题智能速览

  • GLM-Image在CVTG-2K和LongText-Bench两大评测中均取得开源模型第一。

  • 它是首个全程在华为Ascend A2国产芯片上完成训练的SOTA模型。

  • 通过API生成一张图片的成本仅为0.1元,性价比极高。

  • 采用自回归与扩散解码器混合架构,兼顾布局理解与细节生成。

  • 原生支持1024x1024至2048x2048的任意比例输出,无需重绘。

国产GLM-Image问世,精准渲染汉字不再是难题精华内容

GLM-Image如何实现精准的文字渲染?其背后“自回归+扩散”的混合架构与国产算力的深度结合,揭示了技术突破的关键。

精准的文字渲染

GLM-Image在文字渲染能力上表现突出,尤其在处理汉字时,能够做到精准无误,这对于制作AI手抄报、海报等场景极具价值。在CVTG-2K(复杂视觉文字生成)评测中,该模型以0.9116的文字准确率(Word Accuracy)和0.9557的归一化编辑距离(NED)夺得双料第一。其生成的小红书风格封面,不仅配色鲜艳、人物逼真,文字排版也与画面完美融合,直接命中了社交平台的视觉需求。

自回归+扩散架构

为兼顾全局布局与细节质感,GLM-Image采用了创新的“自回归+扩散解码器”混合架构。这种架构如同一个协同工作的团队:9B参数的自回归模型作为“大脑”,负责理解复杂的文字指令,并规划出画面的整体布局;7B参数的扩散解码器则像一支“画笔”,负责在规划好的草图上进行精细的像素填充和渲染。这种设计使其既能像自回归模型一样深刻理解语言,又能像扩散模型一样生成高质量细节。

国产算力底座

此次发布的核心亮点之一,是GLM-Image全程基于华为Ascend A2国产芯片完成训练,从数据预处理到强化学习(RLHF)的每一个环节均未依赖国外硬件。为实现这一目标,智谱与华为深度合作,优化了Mindspeed-LLM框架。特别是在RL训练阶段,通过算子级重构和大规模集群稳定性控制,解决了国产芯片在复杂计算图训练中的适配难题,证明了国产全栈算力完全有能力支撑SOTA模型的训练。

国产GLM-Image问世,精准渲染汉字不再是难题

高性价比与多场景

GLM-Image不仅技术领先,在商业应用上也极具吸引力。其API调用价格低至每张0.1元,为中小企业和开发者降低了使用门槛。该模型能够胜任商业海报设计、时尚大片摄影模拟以及高分辨率人物写真等多样化任务。此外,它原生支持从1024x1024到2048x2048的任意宽高比输出,意味着无需裁剪或重绘,就能直接生成适用于不同社交媒体的横版或竖版图片。

GLM-Image的出现,不仅是技术实力的展现,更标志着国产AI生态在关键领域实现了从追赶到引领。它开源、普惠的姿态,预示着未来将有更多基于国产算力的创新应用涌现。国产AI的下一步,会带来怎样的惊喜?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章