谷歌发布 Nano Banana 2.1,图像编辑与主体一致性显著提升

谷歌发布 Nano Banana 2.1,图像编辑与主体一致性显著提升

2026-10-08 18:49:50 0点赞 0收藏 0评论

根据简鹿办公了解,谷歌在昨天发布了 Nano Banana 2.1,这是其 AI 图像生成与编辑模型的升级版本。谷歌表示,Nano Banana 2.1 在多个方面都有提升,尤其在视觉设计、基于蒙版的编辑,以及主体一致性上表现更为突出。

Nano Banana 2.1Nano Banana 2.1

今年早些时候,谷歌推出了 Nano Banana 2,也就是 Gemini 3.1 Flash Image。该模型在保留谷歌 Flash 级模型生成速度的同时,提供了接近 Nano Banana Pro 的图像质量。Nano Banana 2 还把部分 Pro 级能力带到了更轻量的模型中,包括更强的现实世界知识、更好的文字渲染能力,以及更稳定的角色与物体一致性。

在此基础上,Nano Banana 2.1 主要带来了三项升级:

文字渲染与视觉设计

谷歌官方报告显示,Nano Banana 2.1 在文字渲染和版式设计方面有明显提升。在文本到图像的偏好评估中,开启思考模式的 Nano Banana 2.1 获得了 1050 ± 14 的 Elo 分数,高于 Nano Banana 2 的 990 ± 7 和 Pro 版本的 935 ± 8。需要强调的是,这些是相对偏好评分,并非质量提升的百分比。

以制作派对邀请函为例,建议将活动名称、日期、地点等具体文案单独提供,并与颜色、风格等指令分开描述。这样比笼统地要求"一张漂亮的邀请函"更容易发现错误。

不过,更好的排版能力仍需要人工校对。谷歌的模型卡片承认,模型在处理小字号文本和较长段落时仍存在困难。导出图片后,务必按实际展示尺寸检查,缩略图看起来干净的画面可能隐藏着错别字或难以辨认的细节。

参考一致性与定向编辑

API 支持最多上传 14 张参考图片,文档中明确说明可保持最多 4 个人物和 10 个物体的一致性。这使得制作广告系列变体和多主体构图成为实用的测试场景。

例如制作 LinkedIn 头像时,在评价光照或背景之前,应先对比面部特征是否与原始照片一致;对于产品图,则需检查不同版本中轮廓、标签和比例是否保持稳定。

不过,模型卡片也指出,人物一致性仍不完美,蒙版编辑中的指令遵循可能不完整,原始姿态偶尔会残留。因此,在编写提示词时,明确描述"必须保持不变的内容"与"需要修改的内容"同样重要。

全景图像与思考控制

API 文档提到,2K 和 4K 全景输出中的拼接伪影问题已得到修复,包括 8:1 等极端比例。思考设置分为最小、中等(默认)和高三个级别。

制作横幅或虚拟背景时,边缘区域需要和中心一样仔细检查,留意重复物体、生硬接缝以及裁剪后可能变得干扰视线的细节。宽画幅也需要刻意设计视觉焦点,单纯增加宽度并不能自动产生可用的构图。

建议从中等思考级别开始,在复杂构图上再尝试高级别,对比额外推理带来的效果提升是否值得增加的时间和成本。同时,事实性标签和左右方位需要单独验证。

面向开发者,Nano Banana 2.1 已以模型 ID gemini-nano-banana-2.1 正式开放,支持文本、图片、音频和视频输入,并可生成 1K、2K 和 4K 分辨率的图像。

目前,OpenAI 的 ChatGPT Images 2.5 仍是全球领先的图像生成与编辑模型。它在用户持续优化图片时,能够更好地保留此前已完成的修改,而不是反复改动未调整区域,或让原图质量逐渐下降。排在 OpenAI 之后的是微软 AI 于今年 8 月发布的 MAI-Image-2.6 模型。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松