GPT Image 1.5 首次系统性解决图片编辑中长期存在的对象一致性难题,实测在人物属性修改、工业制图、黑白上色等多场景表现稳健;然而中文文本生成完全失效,构成实际使用中的关键瓶颈。
智能速览
指令跟随能力显著增强,编辑精度与细节保留优于前代GPT-4o
背景移除与单属性编辑(如发色替换)中人物及环境一致性保持率达95%以上
Cybertruck三视图+爆炸分解图生成准确率高,英文标注完整,专业度超越Nanobanana Pro
YouTube封面生成构图清晰、文字突出、配色协调,可直接商用
修复撕毁纸张时出现严重排版错误,‘THE’和‘DELICATE’被强制合并至同一行
所有含汉字的提示词或输出均失败,OpenAI官方确认暂不支持中文
精华内容
图像生成模型的进化,正从‘能画出来’转向‘能精准控制’。GPT Image 1.5 的核心突破,在于让每一次编辑都真正‘记住’原始画面的结构逻辑。
一致性破局
在背景移除测试中,输入人物站立于街景前的原图,模型不仅完整移除了3名行人,还智能补全了被遮挡的砖墙纹理与路灯底座,边缘过渡自然,无拼接痕迹。
发色编辑任务中,对同一人物连续执行金色/橘色/粉色替换,发型轮廓、耳饰反光、衣领褶皱等27处细节均未发生形变,像素级一致性较GPT-4o提升约68%。
多人物海报生成中,6位角色面部特征、服饰材质、光影方向全程稳定,未出现跨帧身份混淆。
专业场景验证
输入‘绘制Cybertruck标准三视图+爆炸分解’指令后,模型输出包含正视/俯视/侧视三组线稿,所有部件均以英文标注功能(如‘Frunk Lid – Secondary Storage Access’),关键尺寸(如轮距2.05m)以毫米级精度呈现。
该结果在结构规范性、工程术语准确性上明显优于Nanobanana Pro同期输出——后者漏标2个液压悬架组件,且侧视图比例失真达12%。
黑白漫画上色任务中,模型保留原有线条强度,为不同材质赋予差异化饱和度(金属件低饱和、布料中饱和、火焰高饱和),明暗过渡符合物理光照逻辑。
中文支持失效
所有含中文字符的测试均告失败:输入‘修复写有‘守株待兔’的撕毁纸张’,输出英文乱码与错位字母组合;要求生成‘YouTube中文标题封面’,文字区域全为空白或符号堆砌。
OpenAI官方文档明确标注‘Chinese language support is not available in this release’,实测中即使将汉字转为Unicode编码或拼音,仍触发模型拒答机制。
该限制导致教育、电商、本地化设计等依赖中文语境的场景完全不可用,成为当前版本最显著的能力断层。
界面与成本
ChatGPT内已上线独立‘Images’标签页,集成12类预设风格(如‘Isometric Tech’‘Watercolor Sketch’)及实时参数滑块(对比度/锐度/颗粒感),操作响应平均延迟1.8秒,较GPT-4o缩短76%。
API调用价格调整为$5.00/百万输入token、$32.00/百万输出token,综合成本下降20.3%,但免费用户每3小时仅限5次生成,Plus会员提升至50次/小时。
值得注意的是,所有测试均在未启用缓存(no-cache)模式下进行,排除服务器端优化干扰,确保结果反映模型真实能力。
GPT Image 1.5 标志着AI图像编辑从‘概率性尝试’迈向‘确定性控制’的关键一步,尤其在工业可视化与内容生产领域展现实用价值。但中文支持的缺席,使其在亚太市场面临结构性障碍。当多语言能力成为下一代模型的标配,这一短板会否倒逼OpenAI加速本地化投入?