百度新开源文生图模型 ERNIE-Image:8B 参数,24GB 显卡本地可跑
文生图赛道再迎重磅玩家。
百度近日在 Hugging Face 正式开源旗下文心系列文生图模型 ERNIE-Image 及其加速版 ERNIE-Image-Turbo。两款模型均采用 Apache 2.0 协议,可自由下载商用。最值得关注的是,仅需 24GB 显存即可在消费级显卡(如 RTX 4090)上本地运行,门槛远低于动辄需要数百 GB 显存的旗舰模型。

小参数,大能量
ERNIE-Image 采用单流 Diffusion Transformer(DiT)架构,主体仅 80 亿参数。百度团队坦言:"我们也没想到 8B 的 DiT 能走得这么快、这么远。"
模型支持 1024×1024 等多种分辨率输出,推荐以 bfloat16 精度运行。此次开源包含两个版本:
ERNIE-Image(SFT):50 步推理,追求极致画质
ERNIE-Image-Turbo:8 步推理,基于 DMD 蒸馏与强化学习优化,适合批量出图场景
Prompt Enhancer:一句话变长描述

ERNIE-Image 内置基于 Ministral 3B 架构的 Prompt Enhancer 模块。用户只需输入简短关键词,系统自动扩写为完整、有层次的描述语,大幅降低 prompt 工程门槛。在 Hugging Face diffusers 中调用时,只需添加 use_pe=True 即可启用。
基准测试表现亮眼
百度公布的测试成绩(均启用 Prompt Enhancer):
在英文 prompt 导向的 OneIG-Bench 中,ERNIE-Image 超越了开源阵营的 Z-Image 以及 OpenAI 的 GPT Image 1(High 设定)。而 LongTextBench 接近满分的成绩,更凸显其在海报、漫画、信息图表等文字密集型场景的优势。
文字渲染是强项
ERNIE-Image 的核心竞争力在于高密度文字生成能力。无论是英文菜单、中文海报,还是多语言混排,模型都能稳定输出清晰可读的文字。这对设计师制作双语物料、社交媒体配图、漫画分镜等场景极具实用价值。

生态整合完善
Hugging Face Space:已上线在线 Demo,无需本地部署即可体验
ComfyUI:原生支持,可载入权重进行工作流编排
开源策略的延续
过去一年,百度陆续开源了文心系列大语言模型与语音合成模型。此次将旗舰文生图模型纳入 Apache 2.0 开源范围,延续"开源 + 付费 API"双轨策略。对企业用户而言,Apache 2.0 意味着可商用、可修改、可分发,无需额外授权费用。
ERNIE-Image 以小巧的 8B 参数规模、亲民的硬件门槛、顶尖的文字渲染能力,为 2026 年开源文生图领域带来新选择。 随着 Stable Diffusion 后继者之争从欧美扩展至中国大厂,用户在海报设计、漫画创作、信息可视化等领域,将拥有更多高质量的免费开源工具。
以前总感觉百度除了OCR能力比较突出外,其它大模型能力在一众大厂总毫不起眼。这次大模型的发布,可见百度还是有点东西的。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

老周师傅
校验提示文案
老周师傅
校验提示文案