MiniMax H3 开源一周,网上大半教程已经过时了:各档显卡实测、部署坑位和成本账,我跨源盘了一遍

源自106位全网作者

08-28 06:01

8月3日,MiniMax 正式开源了海螺 H3 视频生成模型。财联社到 8 月 13 日,H3 在 HuggingFace 上已衍生出接近 300 个模型,ComfyUI 版本下载量近 700 万。微博B站、小红书上到处是管它叫"八月AI真神"的视频。

对 SD 玩家来说,这个场面熟悉又陌生:熟悉的是整条部署链路都是 ComfyUI 生态的老本行,工作流、LoRA、量化、整合包一个不缺;陌生的是视频模型对显存和算力的要求翻着跟头往上涨,"16G 通吃"的旧经验这次不好使了。小红书上吐槽"显卡配置要求高得离谱"的帖子,回复也有三十多条。小红书所以我没打算再转述一遍安装教程,而是把这一周散落在知乎、B站、小红书、微博的实测数据盘了一遍,不一定全,但足够帮你判断:手里这张卡,到底能不能部署。

先一句话看懂,H3 强在哪

H3 是一个多模态视频生成模型,最多支持 9 张图像、3 段视频、3 段音频作为参考输入。知乎它还能原生生成音轨,不用后期另配音效。知乎

在 DesignArena 的多图生视频专项排行里,H3 拿到 Elo 1355,仅次于字节 Seedance 2.5(1400),是榜单内最强的开源模型。微博

社区最直白的评价是:效果"不亚于一秒一块五的SEEDANCE2.0"。微博开源的意义就在这儿:原本按秒计费的 API,现在能摊到自己的显卡上免费试错。

MiniMax H3 开源一周,网上大半教程已经过时了:各档显卡实测、部署坑位和成本账,我跨源盘了一遍

各档显卡实测(跨源汇总,口径不一)

先说结论:16G 显存是相对完整玩转 H3 的门槛,24G/32G 决定你能不能碰 1080P。

  • RTX 3060(12G):微博博主说量化版"可以在3060上非常缓慢的跑",别期待更多。微博

  • RTX 5070(12G):小红书博主实测单条 15 秒视频直出用了 800 秒(约 13 分钟),配置是 5070 12G + 32G 内存,能用,但不快。小红书

  • RTX 5060 Ti(16G):数据最多。官方默认工作流 864×480、5 秒片段,实测稳定在 5 分钟左右,显存占用 14G 上下,内存占用 28G 上下。知乎拉到 1920×1088 要跑一个多小时。另一位博主换成 PyTorch cu130 + Turbo 4 步 + 手动 Unload 后,768×448 全尺寸带音轨,一条 5 秒片段约 117 秒。知乎同一张 16G 卡,默认工作流一条 5 分钟,换成 cu130 + 优化参数只要 2 分钟——差距全在环境和工作流。

  • RTX 4080 Super(32G):同一个 1088P 任务,比 5060 Ti 快 16 分钟左右,折合四十多分钟。知乎

  • 老数据中心卡(V100):有人用 GGUF 量化 + stable-diffusion.cpp 跑,结论是"勉强能用,耗时大概是 H20 的 2.5-3 倍"。知乎

  • Mac:连 Redis 作者 antirez 都下场了,开源了纯 C + Metal 编写的推理引擎 h3.c,专为 Apple Silicon 设计,据说从 M3 支持到最新的 M5 系列。微博

MiniMax H3 开源一周,网上大半教程已经过时了:各档显卡实测、部署坑位和成本账,我跨源盘了一遍

再补几句说明:以上数据来自不同博主、不同 ComfyUI 版本、不同工作流,别跨口径直接对比,当数量级参考,不当 SLA。模型文件包总大小约 39.5GB,量化版也在 20GB 上下。知乎从 HuggingFace 直连下载很容易断,社区普遍走 hf-mirror 镜像 + aria2 断点续传。

四个坑,比配置更重要

这是目前信息差最大的部分。写 5060 Ti 实测的博主多宝说得直白,网上 90% 的 MiniMax H3 教程还停留在 cu128。知乎

  1. cu130 是分水岭。ComfyUI 的 H3 README 写得明白:能用 cu130 的 PyTorch 就优先选 int8_convrot,fp8_scaled 只是 int8 用不了时的备胎。cu130 会把 comfy-kitchen 的 CUDA 加速后端从禁用变启用,cu128 时代一大半 OOM 和张量设备错乱直接消失。前提是你的驱动支持 CUDA 13.0,装完还要验证 torch 和 torchaudio 都是 cu130——两者版本号不同,但都可能从旧源拉到 cu128,这个坑已经有人踩过。知乎

  2. 分辨率必须是 32 的倍数。H3 的 patchify_video patch 尺寸是 (1,2,2),宽高不是 32 的倍数直接报错,稳妥选择是 768×448 或 640×384。

  3. 解码 OOM。采样完成后,DiT + 编码器死占约 14GB 显存,VAE 解码挤不出额外的 1.2GB。知乎正解是在采样器和解码器之间插一个"卸载全部模型"节点,采样完先卸载再解码;–novram 也能硬跑,但全卸载的速度不值一提。

  4. 音视频 VAE 分叉。H3 的 latent 是 NestedTensor(视频 24 通道 + 音频 32 通道),解码必须视频 VAE 和音频 VAE 两路分开,只接一路就没有声音。

MiniMax H3 开源一周,网上大半教程已经过时了:各档显卡实测、部署坑位和成本账,我跨源盘了一遍

加速方案:数字都好看,口径各不同

开源一周,加速生态已经很热闹,但各家宣传的数字不在同一个口径上:

  • Lightx2v 的 Turbo 加速 LoRA(8 步/4 步)已上架 HuggingFace,是 B站复现最多的路线之一。哔哩哔哩

  • SLA 稀疏注意力节点 + ComfyKitchenAttention 组合,在合理分辨率和时长下最高能带来 2.5 倍提速,优势是不损画质。知乎

  • TE-speed-FlashVSR 超分节点,号称比原版提速 50%,170 秒超分一条 10 秒视频,针对的是原片分辨率偏低的问题。哔哩哔哩

  • 更夸张的是 NVIDIA SANA 团队公开的工程记录:把生成分成两段,先用 H3 快速出一张低分辨率草稿,再交给 LTX 精修,GB200 上相对基线最高加速 27.7 倍。知乎但这是数据中心卡、特定分辨率和时长下的结果,落到自己机器上别指望原数字。

  • 小红书最激进的一条"14 倍"工作流:官方默认管线 30 多分钟的 5 秒 1024×576,压缩到 2.2 分钟。小红书

说句公道话:上面每组数字的步数、分辨率、硬件都不一样,别只对比倍数。我的建议是优先复现 Turbo LoRA + Unload 节点这条路,门槛最低、验证的人最多,其余的先围观。

成本账:本地部署到底省的是什么

云端价格做参照:Seedance 2.0 的社区口碑价大约一秒 1.5 元。微博H3 官方 API 也从按条计费改成了按秒计费,且不进 TokenPlan。知乎

RunningHub 这类云平台上也有现成的 H3 工作流,按平台点数计价。知乎

本地成本:16G 卡出一条 5 秒片段 2-5 分钟,电费可以忽略,真正的成本是你的时间和试错。但本地有两样云端给不了。一是无限试错,一天出 100 条也没人收钱。微博二是完全可控,模型和 LoRA 都随你折腾。

所以账很好算:

  • 偶尔玩玩:本地部署最划算,卡是现成的,搭进去的是电费和耐心;

  • 电商短视频是生计、量大:小红书已经有人吐槽"一个月光算力就上千",这种量级不是本地 16G 能扛的,上云平台或 API 更现实。小红书

  • 想为 H3 专门升级显卡:先等等。MiniMax 8 月 15 日又开源了音乐模型 Music3,H3 + Music3 的音视频全流程还在磨合。微博LTX 2.5 也刚发布,GGUF 路线还在成熟(V100 都能跑,说明低端卡还有空间),别为一个模型买单。

最后两句

H3 开源对 SD 玩家最大的意义,不是多了一个能用的模型,而是证明了 ComfyUI 生态接得住前沿视频模型——一周 300 个衍生模型就是证据。

MiniMax H3 开源一周,网上大半教程已经过时了:各档显卡实测、部署坑位和成本账,我跨源盘了一遍

但也提个醒:视频生成的硬件门槛是真实存在的,16G 只是入场券。如果你已经卡在部署里,欢迎在评论区聊聊你的显卡和踩到的坑,这份盘点会持续更新。

内容由AI生成

精选参考来源

1. 【MiniMaxH3正式开源】财联社8月3日电,MiniMaxH3模型正式开源。华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及HuggingFace等开发社区和云推理平台同日完成相关适配支持。MiniMaxH3是一个通用型全模态生成系统,在ArtificialAnalysis榜单中...全文

2. Minimax小打了一个翻身仗。开源一周H3在HuggingFace里的热度持续,已衍生出接近300个模型,ComfyUI版本下载量近700万。

3. 看了minimax H3的本地部署方案,显卡配置要求高得离谱

4. 16GB 显存跑 39.5GB 模型?5060Ti 挑战 MiniMax H3 1080P

5. RTX 5060 Ti 16GB 本地跑通 MiniMax H3 图生视频(cu130 版):一次升级,七个雷直接排掉五个

6. DesignArena发布的多图生视频专项测试排行:-BytePlus(字节跳动)Seedance2.5,Elo评分1400-MiniMax开源模型MiniMaxH3,Elo评分1355,也是榜单内最强开源视频模型;不同于常见单图生视频测试,该测试要求模型输入多张参考图像,重点考验多重视觉信息融合能力,衡量主体一致性、风格统...全文

7. 据说minimaxh3今天开源了,视频生成效果不亚于一秒一块五的SEEDANCE2.0,虽然硬件要求高但是可以无限试错了

8. minimax把海螺H3开源了,这是一个挺不错的模型。我看过有人内测的,视频生成的还不错。据说comfyui做了量化和优化,可以在3060上非常缓慢的跑。这应该是近期非常有亮点的开源模型了。下面是具体介绍:1.一个"全能型"的视频生成模型H3是一个多模态生成系统,不仅能看图、看文字、听声音,还能...全文

9. MiniMax H3本地部署:单条15s视频直出,用时800s

10. MiniMax-H3 GGUF + stable-diffusion.cpp 部署记录(V100)

11. 【Redis作者出手:让MiniMax视频模型在Mac上“贴地飞行”】Redis创始人antirez最近开源了h3.c,这是一个专为AppleSilicon设计的MiniMax-H3原生推理引擎。它完全抛弃了臃肿的Python堆栈,直接基于C和Metal编写,让M3及最新的M5系列芯片能以极高效率跑通从文本到视频、音频的全流程。该项目最硬核的地方...全文

12. 加速还油?尝试一下Lightx2v新版加速lora!告别油乎乎的小脸蛋!

13. 综合最优解!2.5 倍的速度提升!SLA 节点 + Comfy Kitchen Attention 目前针对 MiniMax H3 最优的搭配组合!极佳的画质与细节!掂!

14. 全球最快的FlashVSR视频超分放大ComfyUI节点!TE-speed-FlashVSR震撼发布.加速高达50%!170s超分10秒视频

15. 【AI前沿】MiniMax H3 可以 加速 27.7 倍?4090 和 5090 也能跑吗?

16. 官方默认管线要30+分钟,这套加速工作流压到2.2分钟,快约14倍

17. 如何看待minimax将音乐权益从tokenplan中移除?

18. Minimax开源MiniMax-Music3,音乐大模型,最长可以生成5分钟长度的歌曲,而且可控性非常强,能通过提示词编排歌曲结构、人声、节奏、歌词等各个方面细节。Minimax先开源了视频模型H3,再开源音频模型Music3,把家底都给开源出来了。下方是利用模型生成的音乐。编曲佳,歌词佳,节奏佳,中上之作...全文

19. MiniMax H3 电影感 LoRA 开源了!附保姆级使用教程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章