张大妈

刚刚,智谱联合华为突发 GLM-Image:首个国产芯片训练的开源 SOTA

源自公众号:如此肤浅

01-24 14:59

智谱AI联合华为开源了GLM-Image,这是首个在国产昇腾芯片上训练的SOTA级图像生成模型。它采用了创新的混合架构,尤其在中文文本渲染上表现突出。这次发布不仅是技术展示,更验证了国产全栈算力训练高端AI模型的可行性,对国内AI生态发展意义重大。

刚刚,智谱联合华为突发 GLM-Image:首个国产芯片训练的开源 SOTA

刚刚,智谱联合华为突发 GLM-Image:首个国产芯片训练的开源 SOTA智能速览

  • GLM-Image是首个国产昇腾芯片训练的SOTA开源模型。

  • 采用自回归与扩散混合架构,兼顾逻辑理解与画面质量。

  • 在中文文本渲染准确度上达到开源模型第一。

  • 综合评测表现略逊于国产Seedream 4.5。

  • 本地部署门槛高,但API价格低至0.1元/张。

刚刚,智谱联合华为突发 GLM-Image:首个国产芯片训练的开源 SOTA精华内容

官方参数和宣传固然亮眼,但实际表现究竟如何?通过多场景的实战对比测试,可以更清晰地看到GLM-Image的真实实力与当前定位。

实战效果对比

在三个不同风格的提示词测试中,GLM-Image展现出了鲜明的特点。在手绘风格插图中,它对复杂逻辑和中文标注的理解非常到位,构图准确。

在街头涂鸦风格人像生成时,GLM-Image对人物核心特征的捕捉和文字元素的精准嵌入能力突出,画面冲击力强。

但在包含大量细节描述的体育海报生成中,其画面整体质感和艺术处理细腻度相较Seedream 4.5稍显不足,尤其是在处理超长提示词时,对细节的刻画能力有所下降。

混合架构优势

GLM-Image的核心创新在于其“自回归+扩散”的混合架构。传统的自回归模型擅长理解复杂指令但画质有损,而扩散模型画质精细但逻辑理解较弱。

GLM-Image通过“查—算分离”机制解决了这一矛盾。自回归模块(GLM-4-9B)先理解指令,完成构图、布局和文字位置的“草稿”工作。

随后,扩散解码器(CogView4单流DiT架构)在此基础上进行“上色精修”,生成高频细节和纹理。这种分工协作,是其文本渲染能力强大的关键。

刚刚,智谱联合华为突发 GLM-Image:首个国产芯片训练的开源 SOTA

性能基准测试

官方基准测试数据量化了GLM-Image的文本渲染优势。在关键的Word Accuracy(文字准确度)评测中,GLM-Image得分0.9116,远超Nano Banana Pro的0.8754和GPT Image 1的0.7982,仅次于Seedream 4.5。

在专门针对长文本渲染的LongText-Bench测试中,它取得了0.952的高分,大幅领先于其他模型,证明了其在处理复杂文本场景时的卓越能力。

综合来看,它在文本相关指标上达到了开源SOTA水平,但在其他如图像美学(AVG)等维度上仍有提升空间。

部署与商用

目前,GLM-Image本地部署的门槛较高,官方推荐配置为80GB显存,这意味着个人玩家和普通开发者难以在本地运行,更适合企业级用户或云端部署。

然而,其商业价值依然显著。0.1元/张的API价格极具竞争力,加之MIT协议的宽松商用许可,对广大开发者和创业公司非常友好。

它的意义不在于立即成为市场上的绝对王者,而在于成功证明了国产算力从芯片到框架的全栈能力,足以训练出有竞争力的多模态大模型。

GLM-Image的出现,其最大价值在于用事实证明了国产算力全栈训练顶级AI模型的可行性。它或许还未完美,但已为国内AI生态的自立自强迈出了坚实一步,未来从“可用”到“好用”的进化令人期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章