智谱联合华为开源首个国产芯片训练的多模态SOTA模型GLM-Image,基于昇腾芯片全程训练。实测显示其中文指令理解优秀,文字生成准确率高,特别在复杂逻辑图和科普插画上表现出色。API价格仅0.1元/张,有望降低AI生图成本。
智能速览
首个国产芯片全程训练的SOTA多模态模型
中文指令理解能力强,多区域文字生成准确
复杂逻辑图和科普插画表现优异
API价格仅0.1元/张,性价比突出
采用9B自回归+7B扩散解码器混合架构
精华内容
作为首个完全基于国产芯片训练的SOTA模型,GLM-Image的技术突破值得关注。通过实测其生成能力和API调用体验,可以更全面了解这一开源模型的实际表现。
技术架构创新
GLM-Image基于昇腾Atlas 800T A2设备和昇思MindSpore AI框架完成全流程训练,采用「自回归+扩散解码器」混合架构。该架构融合了9B大小的自回归模型与7B大小的DiT扩散解码器,实现了图像生成与语言模型的联合。这是首个开源的工业表现级离散自回归图像生成模型,在文字渲染权威榜单中达到开源SOTA水平。
中文理解优势
实测发现GLM-Image在中文指令理解方面表现突出,文字生成准确率高,特别在多区域文字生成上效果显著。无论是黑板报风格的科学信息图,还是包含大量中文标注的植物光合作用图解,模型都能准确理解并生成符合要求的内容。这种优势使其在中文教育和科普场景中具有独特价值。
复杂图像生成
在绘制包含复杂逻辑的原理图、科普插画方面,GLM-Image表现出色。通过测试牛顿三棱镜实验、植物光合作用等复杂场景,模型能够准确把握图像的逻辑关系和空间布局。提示词中的多层次要求,如人物表情、光影效果、文字标注等,都能得到较好还原。
长提示词限制
GLM-Image在长提示词输入下会受到一定限制,这对于需要复杂描述的应用场景是个挑战。以专业生图应用为例,其提示词通常较长,目前模型的支持还有待优化。希望后续版本能够提升长提示词的处理能力,满足更专业的生成需求。
API成本优势
GLM-Image的API定价为0.1元/张图,相比市面上0.3-1.2元的价格区间具有明显优势。这一价格水平有望推动AI生图服务成本下降,让更多开发者和用户能够负担高质量的图像生成服务。为方便体验,基于其API的开源平台已发布,可直接使用。
GLM-Image的开源标志着国产AI生态在自主可控道路上迈出重要一步。虽然还存在长提示词处理等改进空间,但其在中文理解和成本控制上的优势已经显现。期待这一技术能催生更多创新应用,推动国产AI工具的普及和发展。