张大妈

首个国产芯片训练的多模态 SOTA 模型,已免费开源!

源自公众号:苍何

02-02 13:48

智谱联合华为开源首个国产芯片训练的多模态SOTA模型GLM-Image,基于昇腾芯片全程训练。实测显示其中文指令理解优秀,文字生成准确率高,特别在复杂逻辑图和科普插画上表现出色。API价格仅0.1元/张,有望降低AI生图成本。

首个国产芯片训练的多模态 SOTA 模型,已免费开源!智能速览

  • 首个国产芯片全程训练的SOTA多模态模型

  • 中文指令理解能力强,多区域文字生成准确

  • 复杂逻辑图和科普插画表现优异

  • API价格仅0.1元/张,性价比突出

  • 采用9B自回归+7B扩散解码器混合架构

首个国产芯片训练的多模态 SOTA 模型,已免费开源!精华内容

作为首个完全基于国产芯片训练的SOTA模型,GLM-Image的技术突破值得关注。通过实测其生成能力和API调用体验,可以更全面了解这一开源模型的实际表现。

技术架构创新

GLM-Image基于昇腾Atlas 800T A2设备和昇思MindSpore AI框架完成全流程训练,采用「自回归+扩散解码器」混合架构。该架构融合了9B大小的自回归模型与7B大小的DiT扩散解码器,实现了图像生成与语言模型的联合。这是首个开源的工业表现级离散自回归图像生成模型,在文字渲染权威榜单中达到开源SOTA水平。

中文理解优势

实测发现GLM-Image在中文指令理解方面表现突出,文字生成准确率高,特别在多区域文字生成上效果显著。无论是黑板报风格的科学信息图,还是包含大量中文标注的植物光合作用图解,模型都能准确理解并生成符合要求的内容。这种优势使其在中文教育和科普场景中具有独特价值。

复杂图像生成

在绘制包含复杂逻辑的原理图、科普插画方面,GLM-Image表现出色。通过测试牛顿三棱镜实验、植物光合作用等复杂场景,模型能够准确把握图像的逻辑关系和空间布局。提示词中的多层次要求,如人物表情、光影效果、文字标注等,都能得到较好还原。

长提示词限制

GLM-Image在长提示词输入下会受到一定限制,这对于需要复杂描述的应用场景是个挑战。以专业生图应用为例,其提示词通常较长,目前模型的支持还有待优化。希望后续版本能够提升长提示词的处理能力,满足更专业的生成需求。

API成本优势

GLM-Image的API定价为0.1元/张图,相比市面上0.3-1.2元的价格区间具有明显优势。这一价格水平有望推动AI生图服务成本下降,让更多开发者和用户能够负担高质量的图像生成服务。为方便体验,基于其API的开源平台已发布,可直接使用。

GLM-Image的开源标志着国产AI生态在自主可控道路上迈出重要一步。虽然还存在长提示词处理等改进空间,但其在中文理解和成本控制上的优势已经显现。期待这一技术能催生更多创新应用,推动国产AI工具的普及和发展。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章