这次谷歌的图像生成技术进步确实明显,尤其在光影和物理细节上很扎实。不过实际用起来会发现,它对日常场景的理解还是不如真人拍得自然,比如一碗拉面的热气,看着总觉得差了点烟火气
全文概述
谷歌Banana2在图像生成和编辑方面实现了显著提升,支持多轮编辑、文本+图像交错生成及多种分辨率。测试显示其在物理世界理解、镜像反射、食物光泽等方面表现出色,尤其中文处理能力大幅提升。附有体验网址供用户直接使用。
图像生成与编辑能力
Nano Banana 2(gemini-3-pro-image-preview)具备强大的图像生成和编辑功能,包括多轮编辑、文本与图像交错生成、支持1K至4K分辨率等。此外,还支持检索增强和批量处理请求,极大提升了用户体验。
物理世界的理解
通过测试物理现象如三棱镜色散、半杯水中的错位等,展示了Banana2对物理世界的深刻理解。特别是在光学测试中,AI能够准确模拟光线路径和色散效果,表现优异。
食物光泽与诱人感
测试了Banana2在生成食物图像时的表现,如豚骨拉面的油脂感、热气和食材层次感。结果显示,该模型能很好地捕捉并呈现食物的光泽和诱人特质,细节丰富。
超现实主义与逻辑融合
通过生成云朵组成的鲸鱼等超现实场景,展示了Banana2将不相关物体自然融合的能力。这些创意脑洞不仅视觉效果出色,还能保持逻辑上的合理性。
建筑空间与几何透视
测试了Banana2在生成建筑空间图像时的表现,特别是直线是否弯曲、空间纵深感和广角畸变控制。结果表明,该模型在处理复杂几何结构和透视关系时表现出色。
城市街道雨夜人像
通过生成撑伞走在雨夜街头的女性形象,展示了Banana2在处理湿发、反光皮肤和霓虹灯倒影等方面的细腻表现。整体氛围营造得非常逼真。
二次元动漫与赛璐璐风格
测试了Banana2在生成二次元动漫风格图像时的表现,如扁平化上色、线条流畅度和动漫光影效果。结果显示,该模型能很好地还原赛璐璐风格的特点,色彩鲜艳且细节丰富。
中文字测试
通过生成手冲手磨咖啡流程图,展示了Banana2在处理中文字符方面的改进。尽管仍不及国内某些模型,但已有显著提升,能够清晰呈现复杂的中文提示词。
已收藏
去我的收藏夹