如果你手里是一张6G到12G显存的旧卡,过去两年你在"本地AI"这四个字面前基本是坐冷板凳的:27B文本模型的显存账永远轮不到你,跑图的门槛也一直在16G往上。但9月下旬这一周,风向变了。9月20日晚,"千问大模型"官号官宣开源Qwen-Image-2.1,文生图与图生图集于一身,原生支持透明图生成。 ComfyUI官号紧跟着给出了口径:7B模型、RGBA四通道透明图直出、2K原生直出、最高10张输入图片。 而视频那一侧,MiniMax-H3的ComfyUI工作流也已经被卷进了GGUF档位。 本地出图、本地出片这两件事,第一次同时掉进了"甜点卡以下"的显存区间。微博微博哔哩哔哩
B站UP主"ZZ是画渣"9月21日发了本地部署实测,标题里就是"8G显存就能本地跑、评分反超闭源旗舰"。 这句话还把评论区点炸了一小片,但一周4.8万播放、3815次收藏——收藏比点赞还高,这个比例在本地部署内容里翻译过来就一句话:大家不是在看热闹,是真的准备动手。评论区同时出现了另一批人:“为啥我2070一张图要跑10分钟”“同样设置同样提示词,为什么我生成的时候图片会比别人糊,而且人物错乱呢”。哔哩哔哩
2分钟和10分钟都是真的。"免费"和"一分钱不花"也不是一回事。这篇文章做的事,就是把这一周知乎、B站、小红书、微博上能找到的真实测数据拢到一起,给你一张对得上自己显卡的速查表,再算完该不该上车之前的三笔账。

一、把散在十几个视频里的数字,拼成一张表
先声明口径:这些数字全部来自社区实测,各自的分辨率、步数、量化版本、CPU搭配都不一样,它们不是同一把尺子量出来的。但把口径差异摆出来,本身就是信息。
Qwen-Image-2.1 出图速度(文生图为主):
硬件 | 速度 | 出处/口径 |
|---|---|---|
RTX 5090 | 约20秒/张 | UP主"ZZ是画渣"实测 |
5060笔记本 | 约30秒/张(1024尺寸) | B站热评 |
RTX 4070 12G | 约200秒/张(跑满40步) | 微博用户_杨肉_ |
RTX 2070 | UP主口径2分钟/张 | “ZZ是画渣”;评论区有人同卡跑10分钟 |
8G显存+low参数+int8 | 文生图约2分钟,图生图约3分钟 | B站实测评论 |
RTX 4060 8G笔记本 | 能出图,但"比别人糊、人物错乱" | B站求助评论 |
AMD集成显卡 | 能跑,被称作"真贫民AI绘画" | 知乎专栏 |
配置要点按视频作者给的抄作业版:显存8G选int8量化、文本编码器用nvfp4,ComfyUI加low启动参数。 知乎这边一周内出现了20篇Qwen-Image-2.1相关文章。其中既有从零跑通的Diffusers实战笔记。 也有3060 12G的ComfyUI部署全记录。 甚至有人直接说"只有8G显存的我把SenseNova U1.5 Lite换成了Qwen-Image-2.1"——8G卡的观望者是这个模型最真实的受益切片。哔哩哔哩知乎知乎

MiniMax-H3 视频生成,是另一套故事。 这模型8月初开源时被叫作"本地部署最强开源视频模型",一周内B站关于它的视频滚到了37条。 跑法分两层:官方/整合包层用显存换稳定,GGUF量化层用速度换空间。UP主"小李xiaolxl"在同一张4080 SUPER上做了五档对照(864×480、73帧、20步统一口径),实测峰值分别为默认31.2G、低显存30.4G、低显存加强6.3G、缓存提速31.2G、GGUF 29.8G。 注意最后两行——GGUF文件明显更小,峰值显存却接近30G;真正砍到6.3G的是"低显存加强"档,代价是总耗时最长。哔哩哔哩哔哩哔哩
"能跑6G显存"的说法也不是假的:用户"bklgh"在RTX 3060笔记本6G显存上跑FL2VA-Q4_K_M量化版,跑3秒视频,用了18分钟。哔哩哔哩
二、为什么同一个卡,速度差5倍:三件事没人给你摆平了说
第一件:所有"X分钟一张"都藏着参数。 40步和8步、512和1024、纯文生图还是带参考图,能把同一张卡的耗时拉开一个数量级。评论区"2070跑10分钟"的问,大概率不是卡不行,是步数、采样器、CFG没对上作者那套。 看到任何速报,先找"分辨率+步数"两个字段,找不到就当它没说。哔哩哔哩
第二件:量化版本不是显存的等比缩放。 “模型文件更小,不等于实际生成时只需要同等大小的显存”——这句是五档实测作者自己写的,也是这周最有价值的一条反常识。 扩散模型生成时吃显存的大头是中间激活和文本编码器,权重量化只砍其中一块。同周还有个信号:文本圈那篇"HuggingFace趋势榜第一,27B模型压到5.95GB,还保留98.2%智商"的Bonsai量化文刷屏。 但图像侧的对应物是——Qwen-Image-2.1跑糊、人物错乱的反馈集中出现在8G卡+int8组合上,量化档位和出图质量之间的兑换率,图文两拨社区还没吵出共识(T8那期"小字崩坏原理及解决方式"拿到1.9万播放,讲的就是这类质量问题的一个具体切片)。哔哩哔哩知乎

第三件:加速层开始卷了。 "40秒变12秒"的加速LoRA已经在知乎出实测(笔记本口径)。 9月25日,Pruna开源了Qwen-Image-2.1的几步LoRA适配器,图像生成和编辑速度提升高达6.3倍。 再往前一天,Unsloth给这个图像模型放出了GGUF量化版,把文本圈的量化词表第一次完整搬进了生图圈。 MiniMax-H3那边也有4-STEP Lora压生成时间的教程。这意味着现在所有速度数字都是动态的,三周后大概率全部作废——也意味着"等等党"在这个窗口期的成本很低。知乎微博微博
三、三笔账:算完再决定今晚装不装
第一笔,钱的账。 云端不是不能用,是重度用量会痛。有人晒过对照样本:同一段动画,Seedance云端花掉63块,本地部署H3成本0。 但"0成本"要翻译成:电费+时间+硬件折旧。小红书有人自述"不知不觉已经在各个厂商消耗的Tokens,都可以上一台50系显卡了"。 那是重度文本用户;图/视频侧,如果你一个月出图不超过两三百张、出片不超过几分钟,云端按件付费几乎怎么算都比攒机器便宜。本地方案的成本拐点在"高频+批量":接商单、做账号日更、跑批量素材,才轮到电费赢。微博小红书

第二笔,时间的账。 3秒视频18分钟、图生图3分钟一张,这种速度做"玩一张"的情绪消费很爽,做"今天要交50张"的排产就是加班。同一个评论区里已经出现"稳定批量走云端API更省时间"的商家话术——别急着骂广告,它反过来说明了本地方案当前的真实边界:单张便宜、批量贵(贵在你的命)。
第三笔,授权的账,也是最容易被收藏动作淹没的一笔。 “ZZ是画渣"那条视频下54赞的提醒只有一句话:开源协议不能商用。 这批提示词包教程恨不得手把手教你出"电商产品图、广告摄影示例”,但协议不给商用就是不给。动手前先去看模型卡license那一栏,做自营商品图、接单的,没搞清楚之前老老实实用云端可商用的服务。本地部署省的是API费,别省掉了法务风险的对价。哔哩哔哩
四、谁上车、谁按兵不动
建议现在动手的: 手里有12G以上N卡、本来就装了ComfyUI的——Qwen-Image-2.1的int8+nvfp4组合是现成的,一晚上能跑通,改图能力(多图合成、局部重绘)是这代模型真正的看点,知乎那篇"真正的看点藏在改图里"是这么定性的,多个实测贴的图生图反馈也支持这个判断。知乎

建议先跑一张再说的: 8G卡用户。你的体验完全取决于参数对没对上,先按"int8+low参数+8步加速LoRA"出10张,糊和崩的容忍度你自己判断,别先看收藏数下结论。
建议按住手等的: 6G及以下显存想跑视频生成的。H3这条线的"6.3G能跑"是靠最长耗时档换来的,量化生态刚开个头,GGUF档的质量反馈还只有零星样本;同周B站已经冒出一批"Seedance 2.5发布!本地免费无限生成!!!(附安装包)"的引流视频。 新模型发布后的"免费无限"整合包,多数是API中转套壳或者拉新引流,安装包来路不明的,白嫖不成反被装机。视频生成的本地可用窗口,大概率在下一轮量化版和加速LoRA稳定之后。哔哩哔哩
继续观察的四个信号: ①Qwen-Image-2.1商用授权条款是否松动(社区已经在追问);②加速LoRA从40秒到12秒的版本是否进入整合包默认;③H3的GGUF档会不会像文本侧一样出"全档位+质量对照表";④显卡行情——9月27日已经有UP主在做"高端显卡涨疯了?统一内存+独显异构加速来袭"的选题。 如果这条路线跑通,本地推理的硬件门槛表要重画。哔哩哔哩
这一轮本地化的意义,不在于"反超闭源旗舰"这种让评论区翻车的标题——在于你那张本来只配玩老游戏的卡,第一次在AI的账本里有了名字。先把三笔账算完,再决定要不要给它一个岗位。