MiniMax H3 八月初开源之后,本地部署圈已经热闹了快三周。B站一天能冒出来几十条相关视频,标题一个比一个猛——“8GB也能本地AI生视频”“提速1050%”“媲美Seedance”。有位一直玩本地大模型的朋友来问我:我手上是16G显存的卡,这波值不值得上?
我的回答是:值得上,但别照着教程标题上。H3 跟我们之前跑的那些本地大语言模型,账完全不是一个算法。这半个月我把知乎、B站、微博上的实测帖翻了一遍,今天把账摊开算给你看。
先泼三盆冷水:你下的不是"完整H3"
跑本地大模型久了容易形成一个错觉:开源了=全都能本地跑。H3 不是。
第一,这次放出来的是 H3-Base 权重,本地能跑到的上限是 768P 出片。知乎2K 重生成(Regenerate-2K)和多参考素材理解(Context-IR)这两块,至今还挂在 MiniMax 的云端 API 上。微博所以看到"本地免费出2K"这种标题,可以先停一停。

第二,H3 训练时用了稀疏注意力,但首个开源版本只给了全注意力推理,稀疏版"尚待后续发布"。知乎翻译一下:开源版天生就比官方在线服务慢,这正是现在社区加速插件井喷的原因,也是很多"提速XX倍"话术的生存土壤。
第三,许可证不是 MIT 那种随便用的。H3 用的是 MiniMax H3 Community License Agreement:商业产品年收入超过 2000 万美元要先拿书面授权,服务界面要显著标注"MiniMax H3",还不能拿它或它的输出去改进别的 AI 模型。自己搓漫剧玩没人管你,想商用,先把条款读完。
第一笔账:你的显存在哪一档
先说清楚你要下载的是什么。H3 是个 330 亿参数、音视频一起出的全模态模型。知乎本地部署不是下一个文件,而是一个"五件套":33B 的 DiT 主模型、Qwen3-VL-32B 文本视觉编码器、视频 VAE、音频 VAE 加配套组件。原始 BF16 精度一共 66GB,社区主流量化组合(主模型 INT8 剪枝约 19.5GB + 编码器 NVFP4 约 14.6GB)也得准备 34GB 以上的硬盘。知乎

然后是大家最关心的显存档位,下面是社区近三周实测拼出来的情况:
8G 显存档:能跑,但有三个前提。 RTX 4070 Laptop 8G + 32G 内存的实测已经跑通了 832×480 的文生视频带音轨:裸跑每步 18 秒,5 秒片子要 6 分钟;上满优化组合(PyTorch cu130 硬件反量化 + TeaCache + SageAttention)后 150 秒出一条。微博上也有 RTX 4060 8G + 16G 内存的用户,20 秒 480P 大约 11 分钟。微博三个前提是:内存最好 32G 起、分辨率只能 480P/576P 起步、模型必须放固态——8G 显存跑 20GB 的模型靠的是不停"换层",机械盘能让你等到怀疑人生。知乎对了,音频采样步数低于 12 步会爆音,这也是硬约束。
16G 显存档:能跑,但最容易翻车。 知乎有位用户在 RTX 5060 Ti 16GB 上把七个雷全踩了一遍:照抄 4080 教程大概率直接卡死,因为对方是 Ada 架构 + PyTorch cu130,你手上是 Blackwell + cu128,差一个 CUDA 版本,模型直接跑不了。知乎34GB 的五件套塞不进 16G 显存,首次提交直接 OOM,唯一稳妥的路径是 --novram 最激进卸载,权重全放内存里搬,代价是原生速度下 5 秒片子要 3 分钟。还有一个无数人栽过的坑:H3 的 patchify 要求分辨率必须是 32 的倍数,768×448、832×480 能跑,768×432 直接崩。
24G 显存档:这才开始谈得上"能用"。 4080 挂上社区加速节点,10 秒视频大约 10 分钟;4090/4090D 能跑通全流程,同样有人整理出 12 个坑等着踩。知乎
还有一个教程很少提的隐藏变量:系统内存。五件套在任何本地方案里都要部分驻留内存,32G 是门槛,64G 才从容。B站已经有人专门在 4070 Ti Super 上对比 w4a8 和 Q4 量化、32G 和 64G 内存的差异了——这才是 16G 显存档真正该抄的作业。另外给小显存党指个新东西:有个叫 ComfyUI-ClipProj 的项目,用 Qwen3-VL-4B 替换 32B 编码器,把编码器占用从 15.7GB 压到 5GB 左右,V3 版本刚出,人物和语音表现社区还在验证。知乎

第二笔账:加速数字别全信
加速生态这两周长成了丛林,帮你分个类:
实打实的收益: PyTorch 升到 cu130 走 INT8/NVFP4 硬件反量化,3-5 倍,全场最大;TeaCache 缓存约 3 倍,一根参数线的事。知乎SageAttention 再提 11%,但必须锁 1.0.6 版本,2.2.0 跟 H3 直接 CUDA 崩溃。8G 档把这三样叠明白就够了。
要打折扣的: 讨论度很高的 SLA 稀疏注意力节点,宣传 2.5 倍,4060Ti 8G 实测是 872 秒压到 487 秒,约 1.8 倍,而且 token 数要达到 8192 的门槛才完整生效。知乎评论区也有人说实测不如 4 步 LoRA 的方案——追求极限就自己两个都试,别只听一边。
听个响就行的: 英伟达 SANA 团队那篇"27.7 倍加速"(GB200 上 10 秒 768P 端到端 14.9 秒),那是服务器卡上"H3 出草稿 + LTX 精修"两段式流水线的数字,还是有损的,跟桌面显卡没关系。知乎Mac 用户有个 h3.c/MLX 的移植路线,作者是 Redis 之父 antirez。微博但它的每个加速开关都是拿步数、层数、复用换时间,画质代价得自己评估。
B站有条评论很真实:"更新太多了,都不知道用什么了。"这话说出了现在本地部署圈最真实的处境。哔哩哔哩我的建议是:固定一套组合先出片,再谈优化。生态还在野蛮生长,天天追新才是最贵的。
第三笔账:本地真比云端便宜吗
最后算钱。本地不是免费的:34GB 硬盘、半小时起步的等待、抽卡重跑的时间,都是成本。而云端价格已经卷到地板——MiniMax 官方 API 768P 是 0.08 美元/秒。知乎一些第三方平台的活动价甚至压到 0.01 元/秒,15 秒视频一毛五,充值 1 块就能试。知乎代价是每条也要等 6 分钟左右,且素材得过云。

顺便给个背景坐标:在评测机构 Artificial Analysis 的视频编辑模型榜单上,H3 一发布就冲到了第一。微博能力是真的,账也得自己算。
所以我的分人群建议很直接:
想体验效果、偶尔出片的,先别部署。用第三方平台或官方 API,花一块钱摸清 H3 能干什么、你要的题材它行不行,这是成本最低的试错。
素材不能出本地的(客户内容、隐私向),或者一天要抽几十条的重度用户,本地值得配。建议 16G 显存 + 64G 内存起步,24G 显存从容;8G 显存党先接受"480P + 等"这两个词,再谈值不值。
想商用的,先读许可证,再想清楚:本地开源版上限 768P,2K 那一步还是要回官方云。
留三个值得盯的信号:官方承诺的稀疏注意力推理什么时候随权重放出(开源版速度会直接上一档);2K 重生成和 Context-IR 什么时候开放;TeaCache、SLA、Sol-Attn 这些加速方案哪个会被官方工作流收编。这三个任何一个动了,上面的账就得重算。
本地部署的魅力从来不是"更便宜",而是"是我的"。H3 是开源视频模型第一次真正摸到"消费级显卡能跑、质量能看"的门槛,也正因为新,教程混、数字飞。把账算清再下载,总比 OOM 了再回头快。