谷歌推出的NanoBanana 2号称又快又好。这次评测通过9项高难度测试,对比了它与GPT、即梦等主流模型的真实表现,揭示它们在物理真实性、人物一致性、推理能力上的差异,为使用者提供清晰的选型参考。
智能速览
NanoBanana 2的核心升级在于更强的推理能力与一致性控制。
物理真实性测试中,多数模型都未能完美处理“红酒时钟”的复杂场景。
人物一致性方面,即梦在亚洲人脸的生成和一致性上表现最为出色。
NanoBanana 2新增的搜索功能在特定推理场景下,效果优于Pro版本。
文本渲染能力上,NanoBanana 2能精准模仿笔迹并续写古诗。
实用工作流推荐:用NanoBanana 2快速出图,用即梦优化人物面部。
精华内容
要真正了解一款AI生图模型的实力,必须将其置于严苛的实战中。通过多维度对比测试,可以清晰地看到各模型的优劣势和适用边界。
核心更新与基础表现
谷歌NanoBanana 2的主要更新包括:支持最多14张参考图以增强一致性、具备更强的推理能力、可调用谷歌搜索与图片搜索验证事实、更好的文本渲染能力以及支持超宽宽高比(如1:8)。
在经典的“红酒时钟”物理真实性测试中,NanoBanana 2生成的酒杯未倒满但时钟时间接近正确,Pro版本则酒杯正确但时间错误。GPT Image 1.5对酒杯的理解最好,但指针设计怪异。即梦(4.6和5.0)则在酒量和时间上均出现错误。
人物与推理能力
在人物一致性测试中,当要求生成与爱因斯坦同框的亚洲女性时,NanoBanana 2的“好莱坞特工版亚洲脸”效果不佳。尽管支持14张参考图,但单张图的学习能力仍需提升。相比之下,即梦在亚洲人像的一致性还原上表现最佳,被评测者称为“亚洲邪术”,工作流中常被用作换脸工具。
在世界知识与文本推理测试中,NanoBanana 2与Pro版本都能准确续写古诗“星垂平野阔”的下一句“月涌大江流”,且笔迹模仿效果良好。GPT Image 1.5的中文推理能力有所提升,但笔迹模仿较差。
特殊功能与创意局限
利用地图生成实景的测试中,NanoBanana 2和Pro版本生成的阿里园区建筑“乍一看那么回事,细看哪哪不对”,对国内地理信息的支持尚不完善。
在生成8:1超宽全景图“男大学生派对”时,NanoBanana 2未能正确理解“帅气”和“至少50人”的密集感,画面松散。在创意肖像测试中,GPT生成的图像更具cult感和病毒式传播潜力,而NanoBanana系列则显得中规中矩。
综合对比与选择建议
综合来看,NanoBanana 2在生图质量上与Pro版本差距不大,部分推理场景下甚至更优,且速度更快、性价比更高,其放大功能质量也优于即梦。因此,评测建议将其作为主力工具:先用512K或1K分辨率快速跑创意,满意后再进行放大。
在特定场景下,各模型各有专长:追求审美和艺术性,MidJourney依然强劲;需要高亚洲人脸一致性,即梦是首选;而追求网感和创意,GPT则更胜一筹。
这场横评揭示了AI生图模型已无绝对王者,各有胜负场。选择模型更应结合具体需求与工作流。未来的竞争,或许将是推理速度、成本与特定场景精度的综合比拼。