最近盯本地 AI 生图的朋友,feed 里应该被两件事刷过屏:一是 Krea2 的图铺天盖地,漫转真、四视图定妆照、巨物美学,连复刻黑神话悟空画风的 LoRA 都冒出来了;二是 8 月 20-21 日,商汤悄悄开源了一个 8B 的统一多模态模型 SenseNova U1.5,号称原生 4K 出图、中英文文字渲染、生图改图一体,社区直接叫它"国产开源版 image-2"。哔哩哔哩微博
两个都被称为"新王",但我把 B 站、知乎、微博近两个月的实测帖翻了一遍之后,结论很明确:这俩根本不是竞品,它们服务的是两种人。下载错方向,浪费的不只是 20 到 50GB 的下载时间,还有你接下来一周的折腾。
先看两份底细
Krea2 是美国公司 Krea 的作品——就是去年和黑森林实验室(Black Forest Labs)联合调过 FLUX.1 Krea 的那家。微博模型 5 月先上线自家平台,6 月下旬开源权重:12B 参数的稠密 DiT,文本编码器用 Qwen3-VL,VAE 用 Qwen Image VAE。Turbo 蒸馏版 8 步以内就能原生输出 2K 图,按发布材料的口径,在 Artificial Analysis 文生图榜上排全球前十、独立实验室第二。知乎

SenseNova U1.5 Lite(正式编号 SenseNova-U1.5-8B-MoT)走的是完全不同的路:NEO-unify 原生统一架构,理解、生成、编辑塞进同一个模型,官方说法是不需要单独的视觉编码器和 VAE,“从像素到文字原生贯通”。知乎主打六件事:生成、文字渲染、原生 4K、图像编辑、复杂长指令遵循(3000-4000 字)、视觉控制(比如 bounding box 指定改哪块)。知乎微博

一个管"好看",一个管"能用"
注意这两个模型卖点的措辞差异,这基本就是选择答案:
Krea2 强在审美和风格可玩性。开源时官方就带了九款风格 LoRA,两个月里社区生态近乎疯狂——光是 B 站 UP 主"砚青节点"两期 Krea2 LoRA 特刊就盘点了 78 个。哔哩哔哩哔哩哔哩 8 月 23 日漫转真 V3 和姿态控制 LoRA 发布,几天内播放量各自破万。哔哩哔哩 四视图定妆照、巨物美学、风格转绘这些玩法,目前都只有 Krea2 生态里最全。
U1.5 强在"交付可用"。做海报的要文字排版,做电商图的要指哪改哪,做信息图的要长指令听得懂——这些恰好是 Krea2 最弱的地方。知乎这里必须把最关键的差异说透:Krea2 的中文字渲染基本不可用。知乎用户实测直接吐槽"中文崩坏严重"。知乎 社区的技术解释是它的描述文本训练以英文为主(Krea2 AnyPaint 的作者专门提过这一点)。想拿它出中文海报,趁早死心。而 U1.5 把中英文文字渲染写进了核心卖点,连 3000 字长指令都不崩。知乎

所以路线很清楚:做人像、漫转真、插画风格、折腾 LoRA 生态,选 Krea2;做海报、电商、信息图、要改图要文字,选 U1.5。

显存与版本对照:你的卡该下哪个文件
这是大家最关心的部分,两边策略完全不一样。
U1.5 的门槛比想象低得多。官方 bf16 权重约 50GB,普通玩家别碰;社区 GGUF Q8 量化版约 19GB,配合层级卸载(vram_mode=balanced),RTX 3060 12G 实测显存占用约 10GB 就能跑,768×1280 基准下 GGUF 比 bf16 快约 3 倍,2048×1152 的图 8 步大概一分半。这个数据目前来自一位 3060 玩家的完整实测记录,和官方"单卡流畅运行"的说法能对上,但样本还少,先按单源看待。知乎

Krea2 本体更重:bf16 原始权重 DiT 就有 26.28GB,再加约 8GB 的 Qwen3-VL 文本编码器和 VAE,24GB 显存是起步线——4090 上已经有人用 BF16X 无损压缩压到 20.61GB 加 GPU 实时解压的玩法。知乎不过不用慌,量化路线已经很成熟:
50 系显卡:原生支持 nvfp4,直接用官方 nvfp4/fp8 权重,最快;
40 系及以下:int8_convrot 是目前跑得最快的格式;
12G 左右的小显存:GGUF 是最优解,用 HuggingFace 上 gguf-org 仓库的 krea2_turbo-iq4_xs 加 qwen3vl_4b-iq4_xs 组合,50 系卡上 1280×720 一张约 30 秒,能用但不算快。知乎
这里专门圈一个坑:Krea2 用 GGUF 时,文本编码器必须从 gguf-org 的仓库下。有人换了 unsloth 的 Qwen3-VL GGUF 直接报错——Krea2 要求 12 层 Qwen3-VL 特征,结构对不上,报错信息很明确。知乎
三个坑,都是别人踩出来的
其一,U1.5 的官方 ComfyUI 节点有两个环境雷:transformers 4.57 版本有装饰器兼容问题,要么打补丁要么升到 5.x;bitsandbytes 的导入链在 triton 3.x 下会崩,需要 monkeypatch 绕过。知乎 实测帖里都给出了解法,装之前先看一眼,能省一晚上。
其二,Krea2 对 LoRA 微调比较"迟钝"。想自己训风格的朋友,目前社区反馈是要加大力度、容易崩;只是消费现成 LoRA 的话完全没影响。知乎另外社区已经有人用"听话 LoRA"这类 20 多 MB 的小东西去补它爱拒绝的毛病,生态补位的速度很快。知乎
其三,对 Krea2 生态里的社区微调模型保持清醒。有人拿官方底模和热门微调版同参数对比:官方审美本来就能打,但相当一部分高热度微调版是往特定"性感"方向特化的。微博 下哪个版本,取决于你要做什么,别只看下载量。
谁可以完全不动?
你手上的 Flux、Z-Image、Qwen-Image 如果够用,不必因为热度换模型。这两个新王的价值是拓宽能力边界,不是全面替代:Krea2 拓宽的是审美和风格玩法的上限,U1.5 拓宽的是"本地也能做生产级交付"的边界——文字、编辑、4K 这些过去只能上云端 API 的活。
留两个观察信号:一是 Krea2 官方在图像编辑和中文支持上的动作,社区已经在用 Edit-LoRA 硬 hack 编辑能力,官方一旦跟上,短板会缩得很快;二是 U1.5 的社区口碑沉淀,它才发布一周,现在的评价多少带着官方口径,真实成色要等更多独立实测。
一句话收尾:要审美、玩生态、做人像漫转真,选 Krea2,按显存挑量化版本;要文字、要改图、做生产交付,选 U1.5,12G 显存直接 GGUF Q8 起步。