8月3日,MiniMax 正式开源了海螺 H3 视频生成模型。财联社到 8 月 13 日,H3 在 HuggingFace 上已衍生出接近 300 个模型,ComfyUI 版本下载量近 700 万。微博B站、小红书上到处是管它叫"八月AI真神"的视频。
对 SD 玩家来说,这个场面熟悉又陌生:熟悉的是整条部署链路都是 ComfyUI 生态的老本行,工作流、LoRA、量化、整合包一个不缺;陌生的是视频模型对显存和算力的要求翻着跟头往上涨,"16G 通吃"的旧经验这次不好使了。小红书上吐槽"显卡配置要求高得离谱"的帖子,回复也有三十多条。小红书所以我没打算再转述一遍安装教程,而是把这一周散落在知乎、B站、小红书、微博的实测数据盘了一遍,不一定全,但足够帮你判断:手里这张卡,到底能不能部署。
先一句话看懂,H3 强在哪
H3 是一个多模态视频生成模型,最多支持 9 张图像、3 段视频、3 段音频作为参考输入。知乎它还能原生生成音轨,不用后期另配音效。知乎
在 DesignArena 的多图生视频专项排行里,H3 拿到 Elo 1355,仅次于字节 Seedance 2.5(1400),是榜单内最强的开源模型。微博
社区最直白的评价是:效果"不亚于一秒一块五的SEEDANCE2.0"。微博开源的意义就在这儿:原本按秒计费的 API,现在能摊到自己的显卡上免费试错。

各档显卡实测(跨源汇总,口径不一)
先说结论:16G 显存是相对完整玩转 H3 的门槛,24G/32G 决定你能不能碰 1080P。
RTX 3060(12G):微博博主说量化版"可以在3060上非常缓慢的跑",别期待更多。微博
RTX 5070(12G):小红书博主实测单条 15 秒视频直出用了 800 秒(约 13 分钟),配置是 5070 12G + 32G 内存,能用,但不快。小红书
RTX 5060 Ti(16G):数据最多。官方默认工作流 864×480、5 秒片段,实测稳定在 5 分钟左右,显存占用 14G 上下,内存占用 28G 上下。知乎拉到 1920×1088 要跑一个多小时。另一位博主换成 PyTorch cu130 + Turbo 4 步 + 手动 Unload 后,768×448 全尺寸带音轨,一条 5 秒片段约 117 秒。知乎同一张 16G 卡,默认工作流一条 5 分钟,换成 cu130 + 优化参数只要 2 分钟——差距全在环境和工作流。
RTX 4080 Super(32G):同一个 1088P 任务,比 5060 Ti 快 16 分钟左右,折合四十多分钟。知乎
老数据中心卡(V100):有人用 GGUF 量化 + stable-diffusion.cpp 跑,结论是"勉强能用,耗时大概是 H20 的 2.5-3 倍"。知乎
Mac:连 Redis 作者 antirez 都下场了,开源了纯 C + Metal 编写的推理引擎 h3.c,专为 Apple Silicon 设计,据说从 M3 支持到最新的 M5 系列。微博

再补几句说明:以上数据来自不同博主、不同 ComfyUI 版本、不同工作流,别跨口径直接对比,当数量级参考,不当 SLA。模型文件包总大小约 39.5GB,量化版也在 20GB 上下。知乎从 HuggingFace 直连下载很容易断,社区普遍走 hf-mirror 镜像 + aria2 断点续传。
四个坑,比配置更重要
这是目前信息差最大的部分。写 5060 Ti 实测的博主多宝说得直白,网上 90% 的 MiniMax H3 教程还停留在 cu128。知乎
cu130 是分水岭。ComfyUI 的 H3 README 写得明白:能用 cu130 的 PyTorch 就优先选 int8_convrot,fp8_scaled 只是 int8 用不了时的备胎。cu130 会把 comfy-kitchen 的 CUDA 加速后端从禁用变启用,cu128 时代一大半 OOM 和张量设备错乱直接消失。前提是你的驱动支持 CUDA 13.0,装完还要验证 torch 和 torchaudio 都是 cu130——两者版本号不同,但都可能从旧源拉到 cu128,这个坑已经有人踩过。知乎
分辨率必须是 32 的倍数。H3 的 patchify_video patch 尺寸是 (1,2,2),宽高不是 32 的倍数直接报错,稳妥选择是 768×448 或 640×384。
解码 OOM。采样完成后,DiT + 编码器死占约 14GB 显存,VAE 解码挤不出额外的 1.2GB。知乎正解是在采样器和解码器之间插一个"卸载全部模型"节点,采样完先卸载再解码;–novram 也能硬跑,但全卸载的速度不值一提。
音视频 VAE 分叉。H3 的 latent 是 NestedTensor(视频 24 通道 + 音频 32 通道),解码必须视频 VAE 和音频 VAE 两路分开,只接一路就没有声音。

加速方案:数字都好看,口径各不同
开源一周,加速生态已经很热闹,但各家宣传的数字不在同一个口径上:
Lightx2v 的 Turbo 加速 LoRA(8 步/4 步)已上架 HuggingFace,是 B站复现最多的路线之一。哔哩哔哩
SLA 稀疏注意力节点 + ComfyKitchenAttention 组合,在合理分辨率和时长下最高能带来 2.5 倍提速,优势是不损画质。知乎
TE-speed-FlashVSR 超分节点,号称比原版提速 50%,170 秒超分一条 10 秒视频,针对的是原片分辨率偏低的问题。哔哩哔哩
更夸张的是 NVIDIA SANA 团队公开的工程记录:把生成分成两段,先用 H3 快速出一张低分辨率草稿,再交给 LTX 精修,GB200 上相对基线最高加速 27.7 倍。知乎但这是数据中心卡、特定分辨率和时长下的结果,落到自己机器上别指望原数字。
小红书最激进的一条"14 倍"工作流:官方默认管线 30 多分钟的 5 秒 1024×576,压缩到 2.2 分钟。小红书
说句公道话:上面每组数字的步数、分辨率、硬件都不一样,别只对比倍数。我的建议是优先复现 Turbo LoRA + Unload 节点这条路,门槛最低、验证的人最多,其余的先围观。
成本账:本地部署到底省的是什么
云端价格做参照:Seedance 2.0 的社区口碑价大约一秒 1.5 元。微博H3 官方 API 也从按条计费改成了按秒计费,且不进 TokenPlan。知乎
RunningHub 这类云平台上也有现成的 H3 工作流,按平台点数计价。知乎
本地成本:16G 卡出一条 5 秒片段 2-5 分钟,电费可以忽略,真正的成本是你的时间和试错。但本地有两样云端给不了。一是无限试错,一天出 100 条也没人收钱。微博二是完全可控,模型和 LoRA 都随你折腾。
所以账很好算:
偶尔玩玩:本地部署最划算,卡是现成的,搭进去的是电费和耐心;
电商短视频是生计、量大:小红书已经有人吐槽"一个月光算力就上千",这种量级不是本地 16G 能扛的,上云平台或 API 更现实。小红书
想为 H3 专门升级显卡:先等等。MiniMax 8 月 15 日又开源了音乐模型 Music3,H3 + Music3 的音视频全流程还在磨合。微博LTX 2.5 也刚发布,GGUF 路线还在成熟(V100 都能跑,说明低端卡还有空间),别为一个模型买单。
最后两句
H3 开源对 SD 玩家最大的意义,不是多了一个能用的模型,而是证明了 ComfyUI 生态接得住前沿视频模型——一周 300 个衍生模型就是证据。

但也提个醒:视频生成的硬件门槛是真实存在的,16G 只是入场券。如果你已经卡在部署里,欢迎在评论区聊聊你的显卡和踩到的坑,这份盘点会持续更新。