一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

源自5位全网作者

05:55

这周的AI生图圈,热闹得有点像手机发布会撞车:周一一个神秘模型悄悄杀进盲测榜,周二马斯克亲自在X上刷屏推销自家生图新功能,再往前倒几天,阿里Qwen-Image-3.0的实测还在各个社区吵。信息量太大,普通玩家很容易看花眼。我替大家把三个"瓜"都过了一遍,顺手说清楚:哪些值得你现在就去试,哪些先让子弹飞一会儿。

第一响:OpenAI神秘新模型"蒙娜丽莎1号",塑料感终于要没了

先说最重磅的。一款代号mona-lisa-1的匿名模型,悄悄上了LMArena大模型竞技场的盲测榜,上手测过的网友普遍反馈:出图比现在的"生图之王"GPT Image 2更真实,细节更丰富,那股一眼AI的"塑料感"明显收敛了。新智

它是怎么被扒出来的?有硬核网友把它的生成图丢进OpenAI官方验证工具,直接扫出了SynthID水印——破案了,又是OpenAI放的招。新智元

一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

不过先别急着喊"新王登基",有两点需要冷静看。其一,多轮测试显示它的知识截止停留在2025年,和GPT Image 2同代,所以社区主流判断是:这更像是同代地基上的一个新检查点,而不是换了大脑的全新架构。新智元APPSO其二,代号结尾那个"-1"几乎是明示——后面还有新checkpoint排队,现在这版大概率不是最终形态。甚至有人测完觉得它只是"Image 2.5的中杯"。

对普通人的结论很简单:看住别冲动。现在能稳定用到的天花板还是4月发布的GPT Image 2,它依然是复杂信息图、以假乱真照片的首选;mona-lisa等正式揭盖再说,届时可能还有一大截提升。

第二响:Grok的ImagineImage 2.0,靠"万物皆可表情包"出圈

马斯克这几天在X上疯狂转发的,是xAI的新模型ImagineImage 2.0。它在大模型竞技场的文生图和图像编辑两个类别都冲到了世界第二,但真正让它出圈的不是跑分,而是一个特别接地气的玩法:分层编辑。APPSO

一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

逻辑是这样的:上传一张图,Grok自动把图拆成图层——人物的脸是一个图层、手势是一个图层、背景地球是若干碎片图层。你可以点选任意图层用提示词单独修改,或者直接把某个主体导出成透明背景PNG。APPSO再配上多参考图拼接(一次最多5张),改梗图就变得极其顺手:经典的"分心男友"换元素、会议室白板图逐个气泡填字,几步就能产出自己的meme。

一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

这条路线和GPT Image 2"一切靠提示词控制"的思路不一样,交互上确实更像在用一个轻量PS。体验入口在grok.com/imagine。

但丑话说在前面:社区吐槽最集中的是审核。有用户实测上传蜘蛛侠照片就被提示"无法生成可能包含受版权保护的内容",护栏收得很紧,想做擦边内容的基本可以死心。想拿它做二创的,先想清楚你要动的IP是不是在它的黑名单里。

第三响:Qwen-Image-3.0,不卷好看,卷"能交差"

7月下旬阿里发布的Qwen-Image-3.0,官方关键词只有一个字:实。具体拆成三层:细节真实(10px小字、笔画批注都能稳住)、内容丰实(最长4.5k token输入,一张图装得下报纸、试卷、PPT这种复杂版面)、知识厚实(12国语言原生渲染,还能画网页、游戏UI)。量子位

一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

它到底实不实在?量子位扔了9道实测题,结果很分裂:学术论文公式页扛住了,排版工整字迹清晰;给《狂人日记》加学生批注的编辑题,红笔痕迹和纸张纹理融合得相当真实;九宫格知识图解也过关。量子位但——速度是真慢,论文页一张图等了约3分20秒,同样的题ChatGPT一分多钟就交卷。

一周三响,AI生图圈炸了:OpenAI偷跑新王、Grok靠梗图出圈,普通人到底该用哪个?

翻车现场在试卷题:第一次生成不理想,补充要求后模型干脆放弃生图、只给文字版试题;再喂回去,它又偷偷吞掉9道题、私自改了题目顺序。外网也有吐槽它混淆术语的,还有人发现官网封面图的阿拉伯语语法就有问题。

不过实测里挖出一个隐藏技巧:Qwen-Image-3.0似乎更吃"自家饭"——用千问大模型生成的提示词喂给它,出图稳定性明显好于第三方写的提示词。用它干活的朋友可以先让千问帮你把需求翻译成提示词,再丢去生图。

热闹背后的门道:生图竞争已经分成三条路

把三件事摆在一起看,会发现一个比"谁画得更美"更重要的变化:头部玩家已经不卷画质了,开始卷"能干什么"。

  • OpenAI走质感路线:压塑料感、抠真实感,把"以假乱真"往极限推;

  • xAI走交互路线:分层、选区、导出,把生图工具变成可动手脚的编辑台;

  • 阿里走交付路线:小字、长文本、多语言、复杂版面,目标是让图能直接拿去交差。

这对我们是好事——以后选工具不用再盯着榜单焦虑,按自己的场景对号入座就行。

抄作业时间:不同需求怎么选

  • 做梗图、改现成图、抠主体:去试Grok Imagine,分层编辑目前独一份,注意版权审核红线;

  • 追质感、要照片级真实、做信息图:现阶段还是GPT Image 2,走官方渠道;mona-lisa的正式版值得蹲一波;

  • 做海报、试卷、UI、多语言物料,不想折腾网络:Qwen-Image-3.0,国内直连就能用,代价是生成慢,记得用千问写提示词;

  • 只是日常玩玩、做个头像壁纸:国内即梦、豆包完全够用,真不用追着新模型跑。

最后提醒一句避坑:这两天微博上已经有人叫卖"比官网便宜一半的gptimage2生图软件",这类来路不明的共享账号有封号和隐私风险,省小钱吃大亏,别碰。微博

接下来值得盯的三个信号

  1. mona-lisa系列什么时候官宣、以什么形态落地(2.5还是Mini);

  2. Grok Imagine的审核会不会松动,以及分层编辑会不会下放给免费档;

  3. 即梦/Seedream这条国内线会不会跟进"可编辑"方向——毕竟B站上已经有人在喊"史诗级更新"了。

顺带一个冷知识收尾:有知乎网友整理了ByteDance Seed的对照测试,发现对多个开源文生图系统来说,把提示词扩写得越长,效果反而越差,最短版本普遍优于最长版本。知乎当然这个结论目前限于被测试的开源模型,但至少说明一件事:提示词不是越长越显得专业,把话说准比把话说多重要。

你最近在用哪个生图工具?评论区聊聊你的翻车或惊喜时刻。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章