自从 MiniMax 在 8 月 3 日把 H3 开源,你的信息流大概率已经被"能跑"刷屏了:6G 显存能跑、笔记本能跑、Mac 也能跑;加速包视频更夸张,450%、800%、950% 提速,仿佛一夜之间每张显卡都能变成 AI 视频工厂。H3 开源后热度一度冲上 HuggingFace 全球趋势第一。微博
但点开评论区,真实的问题是另一副样子:“5060 8G+多少内存能用得比较舒服?”"16G 能跑吗?"这两个问题才是大多数人的真实状态:都说能跑,却没人告诉你,自己那张卡跑出来是什么分辨率、什么时长、等多久。我们梳理了过去九天知乎、小红书、B站上的一手实测帖,交叉官方文档,把"都能跑"的混沌整理成下面这张分档决策表。
先泼冷水:H3 开源的只是"一半"
H3 是三个模块串联的系统:Context-IR 负责多模态理解,H3-Base 负责生成,Regenerate-2K 负责把 768P 重生成到 2K。这次开源的只有中间的 H3-Base,本地能输出 768P 视频加原生立体声;前后两个模块都只走托管 API。官方明确这个模块还没准备好开源,当前只开放 API 验证效果。知乎

这意味着"本地部署 H3"的画质上限一开始就是 768P:想要 2K,得接官方 API(2K 约 0.8 元/秒),"本地跑 2K"的标题要么用了 API,要么是噱头。也别以为 H3-Base 小——单个变体 BF16 全量权重约 130GB,个人玩家能摸到的全是量化、裁剪版,这直接决定了下面每一档显存的体验差异。

显存分档:每一档的"能跑"到底是什么体验
显存 | 代表显卡 | 可达水平(量化路线) | 实测耗时参考 | 一句话判断 |
|---|---|---|---|---|
6G | 3060 Laptop 等 | 640×480、5 秒,需大内存 offload | 能出片但等待长 | 只适合验证效果 |
8G | 3060/4060/5060 | 480P 档、5-10 秒 | 5 秒约 5 分钟,原生 15-20 分钟 | 天花板清晰:15 秒必爆显存 |
12G | 4070/4070S | 0.6MP 短片 | 加速栈组合 184-324 秒 | 性价比甜点位 |
16G | 4070TiS/5070Ti/4060Ti | 768P、5-15 秒 | 5 秒约 5 分钟 | 开始谈"生产" |
24G | 4090/3090 | 768P、15 秒 | 开加速约 4 分钟,不开约 8 分钟 | 家用级自由 |
先说 6G。“6G 显存也能跑"不算骗人,但前提是 640×480 分辨率加 32GB 系统内存 offload 的组合,本质是"能出片”,离"能用"还有距离。有博主在 RTX 3060 Laptop 6GB 显存 + 32GB 内存的配置下实测本地运行,展示的就是这条下限路线。小红书
8G 是分水岭。5 秒 480P 视频叠加加速 LoRA 几分钟能出片,但拉高到 864×480 耗时就会涨到 10 分 16 秒、声音还出现断续;而 15 秒视频是 8GB 显存的天花板。知乎换哪个 LoRA、降不降分辨率都一样爆显存,想做 15 秒至少 16G 起步。
12G 是目前社区讨论度最高的一档:4070/4070S 上只把 PyTorch Attention 换成 SageAttention,同一生成任务就从约 603 秒压到约 324 秒。小红书再叠加 Turbo 四步 LoRA,0.6MP 生成能压到 3 分钟左右。
16G 开始谈"生产":同一台 4070 Ti Super 横评四套工作流,Mixed INT4/INT8 耗时 17 分 43 秒,是当前生产首选。小红书5070 Ti 用户反馈,生成一条 5 秒视频大约要 5 分钟。知乎官方 Pruned INT8+NVFP4 路线清晰度代理高 2.78% 但耗时多 6.08%,适合"只认官方权重"的人。注意这档对系统内存胃口也很大,32G 内存会被吃满。
24G 是家用级自由:社区实测 15 秒视频,RTX 4090 级别大概 4 分钟(开了加速节点后),不开加速约 8 分钟。知乎作为参照,官方在 4×B300 上生成 8.7 秒 768P 片段端到端约 87 秒。知乎家用单卡比数据中心慢几倍是常态,别拿那个数字折磨自己。
加速真假:哪些数字是实测,哪些是营销话术

市面上加速手段主要四类,按实测收益排优先级:SageAttention 最优先装,收益接近对半砍,是第一梯队;Turbo 四步加速 LoRA 把采样步数从 20+ 降到 4,但版本有坑,8GB 显卡上 lightx2v 和 turbo_v0.1 两个版本画质差、速度慢,不建议使用,v1 和 v4 才是主力选项。知乎有意思的是 10 秒长时长场景里 lightx2v 配合 TE 反而反超、最稳;LoRA 强度建议 0.75 左右,拉满 1.0 画面可能不跟提示词。缓存类加速(EasyCache 等)在 4090 级配合 SageAttention 能把 15 秒从 8 分钟压到 4 分钟,但有轻微画质下降反馈,建议先跑默认对比。至于 TE-Speed,实测叠加在 Sage+Turbo 之上只节省约 11 秒。小红书边际收益,非刚需。
拿这套实测基准,再看 B 站那些"提速 450%/800%/950%“的加速包视频:百分比基本是拿"4 步 vs 20+ 步"对最慢基准算的,置顶评论则是领整合包的引导。哔哩哔哩评论区刷满等包的"666”——本质是涨粉内容。加速本身不假,但宣传数字看看就好。
坑位清单:都是别人踩过的
ComfyUI 必须 0.30.0 以上,老版本直接报 loader 异常,升级加补齐 pip 依赖才能跑。
Turbo 和原生 LoRA 节点之间切换必须先重启 ComfyUI,显存不会自动释放,直接切换必爆显存。
8G 卡(如 5060 8G)文本编码器要用 nvfp4_awq 版本,选错跑不动。
显存不到 24G 就老实下量化版,别碰 BF16 完整版。知乎
中文口播仍不稳定,做中文短片建议单独 TTS 后期配音。
许可证是社区许可,美国、欧盟、英国、韩国用户需单独授权,国内不受影响,但出海做产品前务必读一遍条款。
官方训练提速用的稀疏注意力首版没开源,现在的全注意力推理不是完全体,速度仍有优化空间。

这三类人,先别急着装
话不好听但得说:需要 2K 商用交付的,直接用官方 API,或者"本地 768P 出草稿 + API 升 2K"的混合路线,比纯本地或纯 API 都划算;接受不了"一条视频等几分钟"的也要三思,本地 H3 的当前形态本质是"挂着抽卡、顺便干活",不是即时长出片;显存不足 8G 又不打算升级的,先花几块钱 API 验证需求,别为一时上头买卡。
至于 SGLang、vLLM 那类企业级方案,无 offload 版本起步就要 4 张 80GB 级 GPU。知乎个人用户完全可以不看,那是另一个游戏。
接下来值得盯什么
开源视频模型这场仗才打了一半:稀疏注意力的放开源时间,直接决定本地推理的提速空间;Regenerate-2K 会不会按官方说的后续开源,决定本地 2K 天花板能不能破;社区里 H3 与 Wan 3.0 的对比实测也已经开始,下半年开源视频模型的下半场值得继续追。
最后留个共创题:你的显卡和显存是多少、跑的哪条路线、几秒视频花了多久?评论区晒实测,一起把这张决策表变成持续更新的社区实测表。