谷歌发布 Nano Banana 2.1,图像编辑与主体一致性显著提升
根据简鹿办公了解,谷歌在昨天发布了 Nano Banana 2.1,这是其 AI 图像生成与编辑模型的升级版本。谷歌表示,Nano Banana 2.1 在多个方面都有提升,尤其在视觉设计、基于蒙版的编辑,以及主体一致性上表现更为突出。
Nano Banana 2.1今年早些时候,谷歌推出了 Nano Banana 2,也就是 Gemini 3.1 Flash Image。该模型在保留谷歌 Flash 级模型生成速度的同时,提供了接近 Nano Banana Pro 的图像质量。Nano Banana 2 还把部分 Pro 级能力带到了更轻量的模型中,包括更强的现实世界知识、更好的文字渲染能力,以及更稳定的角色与物体一致性。
在此基础上,Nano Banana 2.1 主要带来了三项升级:
文字渲染与视觉设计
谷歌官方报告显示,Nano Banana 2.1 在文字渲染和版式设计方面有明显提升。在文本到图像的偏好评估中,开启思考模式的 Nano Banana 2.1 获得了 1050 ± 14 的 Elo 分数,高于 Nano Banana 2 的 990 ± 7 和 Pro 版本的 935 ± 8。需要强调的是,这些是相对偏好评分,并非质量提升的百分比。
以制作派对邀请函为例,建议将活动名称、日期、地点等具体文案单独提供,并与颜色、风格等指令分开描述。这样比笼统地要求"一张漂亮的邀请函"更容易发现错误。
不过,更好的排版能力仍需要人工校对。谷歌的模型卡片承认,模型在处理小字号文本和较长段落时仍存在困难。导出图片后,务必按实际展示尺寸检查,缩略图看起来干净的画面可能隐藏着错别字或难以辨认的细节。
参考一致性与定向编辑
API 支持最多上传 14 张参考图片,文档中明确说明可保持最多 4 个人物和 10 个物体的一致性。这使得制作广告系列变体和多主体构图成为实用的测试场景。
例如制作 LinkedIn 头像时,在评价光照或背景之前,应先对比面部特征是否与原始照片一致;对于产品图,则需检查不同版本中轮廓、标签和比例是否保持稳定。
不过,模型卡片也指出,人物一致性仍不完美,蒙版编辑中的指令遵循可能不完整,原始姿态偶尔会残留。因此,在编写提示词时,明确描述"必须保持不变的内容"与"需要修改的内容"同样重要。
全景图像与思考控制
API 文档提到,2K 和 4K 全景输出中的拼接伪影问题已得到修复,包括 8:1 等极端比例。思考设置分为最小、中等(默认)和高三个级别。
制作横幅或虚拟背景时,边缘区域需要和中心一样仔细检查,留意重复物体、生硬接缝以及裁剪后可能变得干扰视线的细节。宽画幅也需要刻意设计视觉焦点,单纯增加宽度并不能自动产生可用的构图。
建议从中等思考级别开始,在复杂构图上再尝试高级别,对比额外推理带来的效果提升是否值得增加的时间和成本。同时,事实性标签和左右方位需要单独验证。
面向开发者,Nano Banana 2.1 已以模型 ID gemini-nano-banana-2.1 正式开放,支持文本、图片、音频和视频输入,并可生成 1K、2K 和 4K 分辨率的图像。
目前,OpenAI 的 ChatGPT Images 2.5 仍是全球领先的图像生成与编辑模型。它在用户持续优化图片时,能够更好地保留此前已完成的修改,而不是反复改动未调整区域,或让原图质量逐渐下降。排在 OpenAI 之后的是微软 AI 于今年 8 月发布的 MAI-Image-2.6 模型。
