MiniMax H3 开源这二十多天,口碑一直被捧:画质强、榜单高、8G 显存都能跑。但一批真在本地跑起来的人,给出了另一种评价:太慢。博主 Howell 用 M5 Max / 128GB 实测,生成一条 5.17 秒的 1344×768 视频用了 50 分 19 秒,平均每步 192 秒,测完直接把模型删了。小红书而同一篇帖子的评论区里,有人 5090 生成 15 秒视频只用 100 多秒。同一个模型,差出几十倍。它到底是慢,还是你没配明白?
我把近几周小红书、B站、微博放出来的实测耗时翻了一遍,凑了十来组不同配置。先说结论:H3 确实慢,但"慢"是个变量,不是常数;量化则是最容易被误会的"加速手段"。
先看实测耗时
有人把各家显卡的实测做成了 H3 天梯榜,3090 跑 10 秒只要三分钟。小红书3060 6G 显存跑 10 秒用了 16 分钟,但用的是 lightx2v 四步 LoRA。哔哩哔哩4060 Ti 8G 显存 + 32GB 内存,15 秒视频要 15 分钟左右,分辨率压到了 846×468。哔哩哔哩再结合我收来的其他配置,大致是这样一张表:

配置 | 视频规格 | 实测耗时 |
|---|---|---|
M5 Max / 128GB(BF16 原精度) | 1344×768 · 5 秒 · 16 步 | 50 分 19 秒 |
M5 Max / 64GB(8bit 优化版) | 1344×768 · 5.9 秒 | 约 20 分钟 |
2×2080 Ti 魔改卡 | 10 秒 | 约 20 分钟 |
RTX 3060 6G + lightx2v 四步 | 608×1058 · 10 秒 | 16 分钟 |
RTX 4060 Ti 8G + 32GB 内存 | 846×468 · 15 秒 | 约 15 分钟 |
笔记本 5090 24G | 720P · 5 秒 | 约 14 分钟 |
RTX 4070 Ti SUPER 16G(INT8+sage+4 步) | 780p · 10 秒 | 约 10 分钟 |
RTX 5070 Ti 16G + 48GB 内存 | 10 秒 | 约 8 分钟 |
RTX 4090(INT8) | 720p · 15 秒 | 约 4 分钟 |
RTX 5090 桌面版 | 15 秒 | 100 多秒 |
这张表有两个提醒。第一,每行规格都不一样:分辨率、时长、步数都影响耗时,横向比只能看个量级。第二,5090 不是一个数字:桌面版 15 秒能压到 100 多秒,笔记本 5090 跑 720P 5 秒却要 14 分钟,同芯片的持续性能释放差距就这么大。小红书
为什么差这么多:三个变量
评论区有人问,为什么我 4060 Ti 16G 还没有 5060 8G 生成得快,老手的回答很直接:环境或者加速节点没弄好,不会那么慢的。小红书把各路实测对照着看,真正拉开耗时差距的是三件事。
一是分辨率和时长。还是那台笔记本 5090,540P 5 秒 5.5 分钟,720P 5 秒就要 14 分钟;时长从 5 秒到 15 秒,耗时基本线性涨。二是步数:默认工作流往往二十多步,换 4 步 LoRA 直接砍到五分之一,这也是 3060 能跑出结果的原因。三是显存爆不爆。显存够,全程在卡上算;一旦溢出到内存做交换,速度断崖式下降,用一位楼主的话说,爆显存了就会很慢的。小红书
所以很多"慢"不是模型的问题,是规格组合和环境的问题。分清这一点,再看架构,就能搞明白哪些慢是先天的,哪些慢是自己配的,哪些加速是真有效。
先天的慢:33B 稠密单流,稀疏推理还没开源
H3 不是小模型:核心是 33B 参数的稠密单流 Transformer,画面和声音一口气算,再配 Qwen3-VL-32B 文本视觉编码器和双 VAE,完整权重包 134GB。测完删模型的博主把原因说得很透:慢是因为 33B 全注意力,官方稀疏注意力还没开源,量化只省内存,不加速。小红书这里有两个信息量:全注意力推理天生重;而真正能带来提速的官方稀疏推理还没来。H3 原生支持稀疏注意力训练,但开源版目前是完整(full)推理版,提速的稀疏推理要等后续更新。知乎

看官方架构图也能明白为什么本地上限是 768p:整个流程分三段——Context-IR 前处理、H3-Base 本地生成、再生成到 2K,而开源的是 H3-Base(768p 那条线);Context-IR、2K 重生成都是托管 API。知乎权重也要本地拉:编码器 + VAE 约 72GB,主模型 BF16 约 62GB,有博主 HuggingFace 直连只有 0.66MB/s,换 ModelScope 快源 41MB/s 才下完。小红书家里宽带和硬盘不够大的话,光第一步就够劝退。
四条加速路:真省时间的没几条
把社区的办法归拢一遍,真正被反复验证的是四条路。
路线一:减步数 LoRA,最直接的省时间。用蒸馏好的 4–8 步 LoRA(社区里叫 Turbo、lightx2v 这类)替换二十多步采样,耗时差不多按步数等比缩。官方生态已经有现成工作流:H3 Turbo LoRA 把采样压到 4–8 步,Tiny Autoencoder H3 负责快速合成预览,预览效果不好就停掉,去调提示词或种子,按分享者的说法,这套流程就是为了节省你宝贵的 GPU时间。微博前面 3060 的 16 分钟,就是这么跑出来的。
路线二:先预览,再出正式。用 TinyAE(taeh3)这类轻量编码器先出粗糙预览,废片直接掐掉,确认构图和动作后再跑高分辨率。这条路不会让单次生成变快,但能把无效的等待砍掉——对废片率高的新手,这可能是性价比最高的一条。
路线三:量化,省的是显存,不是时间。INT8、FP8、w4a8、GGUF,都是把权重变小、占显存变少,别指望它缩短出片时间。有人专门测过 GGUF 档:虽然是量化工作流,运行峰值仍接近 30G,模型文件更小,不等于实际生成时只需要同等大小的显存。哔哩哔哩量化的意义在"能跑":16G 卡、小显存卡和 Mac 靠 INT8 / w4a8 + 共享内存把模型塞进去,M5 Max 64GB 的 20 分钟就是 8bit 优化版的成绩。
路线四:注意力加速与缓存。sage attention、缓存提速这些是在算子层面抠时间。同一张 4080 SUPER 的五档实测里,缓存提速档跑得最快,低显存加强档峰值最低(6.3G)但耗时更长。哔哩哔哩也有 4070 Ti SUPER 16G 的用户 INT8 + sage attention + 4 步 LoRA 一起叠,780p 10 秒约 10 分钟,自评效果体感很不错,“介于 seedance 1.5 和 seedance 2.0 fast 之间”。小红书
一句话总结:省时间的,是减步数、缓存和预览流;省显存的,是量化和低显存档。两件事别混。
想上手,按配置选
把实测拼起来,各档位的建议大概是:
8GB 显存(如 4060 Ti 8G + 32GB 内存):能跑,但显存、内存、硬盘一起出力,846×468 的 15 秒要 15 分钟上下,定位是预览机,别指望直接出成品。
16GB 显存(5070 Ti / 4060 Ti 16G):前提是内存不能短。5070 Ti + 48GB 内存的实测 5 秒约 3 分钟、10 秒约 8 分钟,但显存占 13.6GB、共享显存再吃 17.5GB,系统内存接近 45GB,用原帖的话说,它能跑,是显存、内存和 NVMe 一起扛。小红书32GB 内存的机器已经有人反馈第二条就报错,内存不足 48GB 建议先降分辨率。
24GB 显存及以上(4090 / 5090):甜区。4090 挂 INT8 跑 15 秒 720p 约 4 分钟,桌面 5090 能把 15 秒压到 100 多秒,这是目前最接近"能用"的本地配置。
Mac:两派吵得很凶。一派用 M5 Max 跑 8bit 优化版把 5.9 秒压到 20 分钟;另一派结论是,Mac最多跑图,视频不适合,视频还是得上N卡。小红书大统一内存是底气,但速度上限仍明显低于同级 N 卡,更适合已经买了 Mac 的人顺手玩,不建议为它专门上车。

没显卡、只想试效果的,先算云。官方 API 5 秒 768p 大概 2–3 元,10 分钟就能出片。小红书这比先花一万多买显卡试错便宜得多。也别迷信租卡,有人 autodl 上 4090 48G + 96G 内存,跑 15 秒都可能爆内存。小红书
值得盯的信号
生态铺开的速度比预想快。开源一周,H3 在 Hugging Face 已衍生出接近 300 个模型,ComfyUI 版本下载量近 700 万。微博

实力也在被认证:Design Arena 多图生视频专项榜上,H3 以 Elo 1355 分排第二,是榜单内最强开源视频模型。微博同时有两件事要留个心眼。一是许可:H3 用的是 MiniMax-H3 Community License,不是常见的 Apache/MIT,对商用规模有限制,想接业务的先把许可读明白。知乎二是硬件行情:非N卡真的支持太少了,N卡已经涨飞了。小红书入坑成本不只是时间。
往后值得盯三个信号:其一,官方稀疏推理什么时候开源,这是从根上改变 H3 速度的开关;其二,减步数 LoRA 和 TinyAE 的迭代速度,4 步版的画质损失目前还是肉眼可见;其三,768p 以上的本地方案——目前开源线就到 768p,2K 还得走 API,什么时候放开是另一个节点。
最后给个痛快话:H3 的效果值得等,但本地生成现在处在"慢、但有办法"的阶段——把变量搞明白,时间能省出几十倍。等不及的,云 API 加本地预览流是当下最务实的组合;等得及的,盯住稀疏推理开源再下手。