近日,OpenAI发布了其最新的图像生成模型ChatGPT Images 2.0(模型名称为GPT-Image-2),该模型在发布后迅速引起广泛关注,并凭借其强大的性能在多个评测基准中超越了谷歌的同类产品,登顶行业榜首。
北京时间4月22日,OpenAI发布了这款被认为是其迄今为止功能最强大的图像生成模型。OpenAI CEO萨姆·奥尔特曼将其形容为一次巨大的飞跃,堪比从GPT-3到GPT-5的跨越。权威评测机构Arena.ai的数据显示,GPT-Image-2在Image Arena的排行榜上迅速登顶,并在“文生图”领域以创纪录的242分优势,大幅领先排名第二的谷歌模型。

相较于前代及其他竞品,ChatGPT Images 2.0在多个关键能力上实现了质的突破:
首先是革命性的文本渲染能力。长期以来,AI图像模型在生成包含文字的图片时,普遍存在乱码、错字等问题,尤其是在处理中文等非拉丁字母语言时。而ChatGPT Images 2.0在这一点上取得了巨大进步。根据实测反馈,无论是生成包含密集小字的海报、模拟的杂志封面,还是复杂的中文漫画,该模型都能准确、清晰地渲染文字,基本解决了“AI不识字”的行业痛点。
模型首次引入了“思考能力”。在启用“思考模式”后,该模型可以连接网络搜索实时信息,对用户的复杂指令进行推理和规划,甚至在生成前预先构思图像的结构布局。这一能力使其不再是简单的“渲染器”,而更像一个能够理解任务、整合信息并进行创意执行的“视觉伙伴”。例如,它可以根据一个提示词一次性生成多张风格和角色保持一致的系列图片,这对于创作漫画、故事板或系列设计方案极为有用。
在图像的真实感和审美表现上,ChatGPT Images 2.0也迈上了一个新台阶。许多用户评价其生成的图片“AI味”大大减少,构图和视觉美感更接近经过精心设计的作品。模型对真实世界有更深刻的理解,能够生成细节丰富、逻辑严谨的复杂场景,例如高拟真度的软件用户界面(UI)截图或电商产品详情页。

当然,在与谷歌模型的对比中,一些用户指出,虽然ChatGPT Images 2.0在构图和人物真实感上普遍更胜一筹,但在某些特定场景,如光影的渲染上,谷歌的模型仍有其独到之处。同时,OpenAI官方也坦言,新模型并非完美无缺,它在处理需要精确物理世界模型的任务(如折纸指南)或极度密集的视觉细节时,仍有局限性。

ChatGPT Images 2.0的发布,凭借其在文本渲染、推理能力和生成质量上的综合表现,成功刷新了AI图像生成技术的顶尖水平,再次确立了OpenAI在该领域的领先地位。这一进展不仅为设计师、内容创作者等专业人士提供了更强大的工具,也预示着AI技术将对设计、媒体乃至更多行业产生更为深远的影响。