AI视频圈已经很久没有这么热闹过了。
7月31日,MiniMax发布新一代视频生成模型H3,在ArtificialAnalysis视频模型榜单上,H3发布当日视频编辑能力排名全球第一,文生视频、图生视频分列第二、第三,综合能力跻身全球第一梯队。36氪更关键的是,8月初团队真的把模型权重放了出来,知乎、B站、Reddit这一周刷屏的都是同一个问题:我的显卡,能不能跑?

先把结论放在前面:「8G显存能跑」是真的,但「能跑」和「好用」是两码事。这篇把参数、显存、速度、成本一次算清楚,你对照自己的配置做决定就行。
这模型到底有多大
很多人看到「33B参数」觉得还好,实际上33B只是负责生成的主干,完整的H3-Base还包括音视频编解码模块和一整套多模态理解组件,官方工程师在Reddit的AMA上把这笔账算得很明白。知乎

也就是说,全部组件约60B参数、标准精度权重约120GB,消费级显卡不做优化连载入都做不到。社区的解法是两招:量化加分段卸载——只把当前要算的部件搬进显存,用不到的先在内存里排队,加上H3本身有约13B的调度分支可以预先算好、生成时不必加载,这颗巨无霸才第一次有机会走进消费级显卡。
三种权重,对应三种显卡
开源社区放出的权重主要分三档:BF16原始精度版、INT8/FP8量化版、剪枝版。注意一个容易踩的坑:66.3GB只是UNet权重一个文件的大小,加上约15GB的文本编码器和约5.5GB的VAE,整套BF16模型大约需要85GB以上的存储空间。知乎
简单对号入座:
16GB显存的主流游戏卡:约34GB的量化版是性价比最高的选择,社区口碑是「闭眼选它」
RTX 2060/3050/笔记本级别的8G显存:选约21GB的剪枝版,其中pruned_int8_convrot兼容性最好,再配一个量化后的文本编码器,全套下载也要40GB左右
一句话:各版本之间的质量差距远比你想象的小,但体积差距比你想象的大。选对版本,省的不只是硬盘,还有下载和跑起来的时间。
「8G显存能跑」的真相
知乎一位RTX 4070 Laptop用户(8G显存+32G内存)的实测很有代表性:确实跑通了,能出带声音的5秒视频,但代价也很真实——裸跑832x480分辨率一步要18秒,20步就是6分钟。知乎
所谓「换层」,就是显存装不下模型,权重只能在内存和显卡之间来回搬运。把优化链上满(新版torch、TeaCache缓存、SageAttention加速)之后,480p能压到2分半,1024x576约9分钟。所以8G显存的真实体验是:一条5秒视频,快的话2分半,慢的话9分钟,分辨率还得收着来。这不是产能工具,是入门门票。
还有一个本地版目前的硬限制要清楚:自己下载的H3最高只能生成768p,想要2K得走官方的Regenerate-2K,而它目前只有API。知乎官方承诺会开放且「不会等太久」,但今天想用2K,还是得走云端。
算笔账:本地部署值不值
先看云端。官方API默认2K分辨率,每秒定价0.8元,在同级别产品里是最低价。36氪第三方工具平台接入后价格还在往下探,以主打AI短剧的OiiOii为例,1元折合10个平台积分,H3的视频生成计费是每秒7个积分,折算下来约0.7元/秒。36氪一条10秒视频,几块钱到十几块钱,直接拿2K成片。

再看本地。生成的边际成本接近零,但要付三笔别的成本:
磁盘:权重加编码器加VAE,按所选版本从40GB到100GB不等,且强烈建议放固态硬盘,机械盘换层会等到怀疑人生
时间:8G显存一条视频几分钟起步,算上抽卡废片,实际耗时翻倍
门槛:ComfyUI工作流、节点版本、参数调优,社区的踩坑清单不短

所以判断其实可以很明确:
目的是出成片、尤其是需要2K的商用单:老实用云端,H3正在打价格战,现在是云端最便宜的时候
有16G以上显存、爱折腾、在意素材隐私(角色形象、IP素材不想上公有云)、抽卡量大:本地部署值得上,选34G量化版
8G显存:把它当成学习ComfyUI视频工作流的低成本门票,别指望产能
没有N卡或内存不到32G:别部署,官方API和各平台充值入口才是你的路
决定部署的,避坑清单直接抄
这些都是社区真金白银踩出来的经验:
SageAttention锁定1.0.6版本,新版本会直接CUDA崩溃;Windows记得装triton-windows
TeaCache这类缓存节点只选一个,叠加不会更快
分辨率必须是32的倍数:832x480、1024x576、1344x768
采样步数别低于12步,音频质量有底线,少了必爆音
4步加速LoRA已经有了,但步数压得太狠对人体结构、动作和声音质量都有可见影响,6到8步更稳
抽卡策略:480p打草稿、768p出成片,别一上来拉满
还有三件事值得盯着
Regenerate-2K开源:这是本地版目前最大的短板,官方说不会等太久,一旦放出,本地和云端的体验差距会明显缩小
许可证:H3目前用的是MiniMax定制的社区许可证,商用需要按条款逐条适配;官方回应等版权文件处理完、法律环境更清晰后,会考虑换成Apache 2.0。知乎有商用打算的团队,建议等这个信号
官方提速和生图模型:稀疏注意力优化已经在路上,从H3派生的生图模型也在收尾,官方推荐的玩法是先用生图模型定首帧,满意了再交给H3生成视频
最后说个细节:权重开放不到48小时,社区就做出了量化版、Mac的MLX适配和各种加速插件,团队说正是这种速度让他们觉得开放权重是非常正确的一步。知乎HuggingFace趋势榜第一的位置,大概就是这份热闹的最好注脚。

对闭源的视频生成世界来说,这扇门第一次被推开了。要不要进去,先看你的显卡,再看你的目的。