智谱与华为合作推出GLM-Image,中国首个全程在国产芯片上训练的SOTA多模态模型,擅长文字渲染和中文处理,以极高性价比(0.1元/张)引领AI生图新方向。
智能速览
GLM-Image在CVTG-2K和LongText-Bench榜单双料第一,文字准确率达0.9116
采用’自回归+扩散解码器’混合架构,兼顾理解能力和细节生成
全程基于华为Ascend A2芯片训练,实现国产算力全栈突破
API调用仅需0.1元/张,支持1024x1024至2048x2048任意比例输出
开源模型并提供多平台接入,降低中小企业使用门槛
精华内容
GLM-Image不仅解决了AI生图’不识字’的痛点,更在技术架构和训练方式上实现突破,展现国产AI的硬核实力。
文字渲染能力
GLM-Image在复杂视觉文字生成(CVTG-2K)和长文本渲染(LongText-Bench)榜单中均排名第一。其Word Accuracy达0.9116,NED(归一化编辑距离)达0.9557,在中文、英文及平均分数上均位列开源模型首位。
实测显示,模型能精准生成包含大量汉字的AI手抄报、插画和海报,解决了行业长期存在的’文字乱码’问题。
混合架构创新
GLM-Image采用’自回归+扩散解码器’混合架构:9B自回归模型负责理解复杂Prompt和规划布局,7B DiT扩散解码器专注于细节填充。
这种设计兼具AR模型的语言理解优势和扩散模型的细节生成能力,在处理空间关系、多物体布局等复杂指令时表现优异。
国产算力突破
模型全程基于华为Ascend A2芯片训练,通过Mindspeed-LLM框架深度优化。智谱与华为合作完成算子级重构,解决了RL训练的梯度爆炸问题。
在万卡集群上实现超长时间稳定训练,通信带宽利用率显著提升,证明国产算力可支撑最前沿的模型优化路径。
多场景应用
GLM-Image能生成高质量的小红书封面、商业海报、人物照片等。实测中,模型对’东方禅意’、'国风雅韵’等复杂概念理解准确,支持双重曝光、胶片质感等专业摄影效果。
原生支持任意比例输出,无需裁剪即可生成16:9或9:16等异构尺寸图片。

GLM-Image标志着国产AI从跟跑到并跑的关键转变,其开源策略和极致性价比将加速行业普及。未来能否在更多专业领域展现优势,值得持续关注。