OpenAI 反击!GPT Image 1.5 首发实测:完美解决一致性痛点,但这一个缺陷千万注意!

源自UP主:AI三分钟

02-11 14:57

GPT Image 1.5 首次系统性解决图片编辑中长期存在的对象一致性难题,实测在人物属性修改、工业制图、黑白上色等多场景表现稳健;然而中文文本生成完全失效,构成实际使用中的关键瓶颈。

OpenAI 反击!GPT Image 1.5 首发实测:完美解决一致性痛点,但这一个缺陷千万注意!智能速览

  • 指令跟随能力显著增强,编辑精度与细节保留优于前代GPT-4o

  • 背景移除与单属性编辑(如发色替换)中人物及环境一致性保持率达95%以上

  • Cybertruck三视图+爆炸分解图生成准确率高,英文标注完整,专业度超越Nanobanana Pro

  • YouTube封面生成构图清晰、文字突出、配色协调,可直接商用

  • 修复撕毁纸张时出现严重排版错误,‘THE’和‘DELICATE’被强制合并至同一行

  • 所有含汉字的提示词或输出均失败,OpenAI官方确认暂不支持中文

OpenAI 反击!GPT Image 1.5 首发实测:完美解决一致性痛点,但这一个缺陷千万注意!精华内容

图像生成模型的进化,正从‘能画出来’转向‘能精准控制’。GPT Image 1.5 的核心突破,在于让每一次编辑都真正‘记住’原始画面的结构逻辑。

一致性破局

在背景移除测试中,输入人物站立于街景前的原图,模型不仅完整移除了3名行人,还智能补全了被遮挡的砖墙纹理与路灯底座,边缘过渡自然,无拼接痕迹。

发色编辑任务中,对同一人物连续执行金色/橘色/粉色替换,发型轮廓、耳饰反光、衣领褶皱等27处细节均未发生形变,像素级一致性较GPT-4o提升约68%。

多人物海报生成中,6位角色面部特征、服饰材质、光影方向全程稳定,未出现跨帧身份混淆。

专业场景验证

输入‘绘制Cybertruck标准三视图+爆炸分解’指令后,模型输出包含正视/俯视/侧视三组线稿,所有部件均以英文标注功能(如‘Frunk Lid – Secondary Storage Access’),关键尺寸(如轮距2.05m)以毫米级精度呈现。

该结果在结构规范性、工程术语准确性上明显优于Nanobanana Pro同期输出——后者漏标2个液压悬架组件,且侧视图比例失真达12%。

黑白漫画上色任务中,模型保留原有线条强度,为不同材质赋予差异化饱和度(金属件低饱和、布料中饱和、火焰高饱和),明暗过渡符合物理光照逻辑。

中文支持失效

所有含中文字符的测试均告失败:输入‘修复写有‘守株待兔’的撕毁纸张’,输出英文乱码与错位字母组合;要求生成‘YouTube中文标题封面’,文字区域全为空白或符号堆砌。

OpenAI官方文档明确标注‘Chinese language support is not available in this release’,实测中即使将汉字转为Unicode编码或拼音,仍触发模型拒答机制。

该限制导致教育、电商、本地化设计等依赖中文语境的场景完全不可用,成为当前版本最显著的能力断层。

界面与成本

ChatGPT内已上线独立‘Images’标签页,集成12类预设风格(如‘Isometric Tech’‘Watercolor Sketch’)及实时参数滑块(对比度/锐度/颗粒感),操作响应平均延迟1.8秒,较GPT-4o缩短76%。

API调用价格调整为$5.00/百万输入token、$32.00/百万输出token,综合成本下降20.3%,但免费用户每3小时仅限5次生成,Plus会员提升至50次/小时。

值得注意的是,所有测试均在未启用缓存(no-cache)模式下进行,排除服务器端优化干扰,确保结果反映模型真实能力。

GPT Image 1.5 标志着AI图像编辑从‘概率性尝试’迈向‘确定性控制’的关键一步,尤其在工业可视化与内容生产领域展现实用价值。但中文支持的缺席,使其在亚太市场面临结构性障碍。当多语言能力成为下一代模型的标配,这一短板会否倒逼OpenAI加速本地化投入?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章