这周关注AI生成的人,大概率都被"H3"三个字母刷屏了。
7月31日,MiniMax正式发布新一代全模态生成模型H3,8月3日模型权重出现在Hugging Face上,ComfyUI同一天原生支持。这是视频生成领域第一次有旗舰级模型开放权重——过去,视频生成领域的默认选项是闭源模型,Seedance、可灵、Sora、Veo,所有主流模型无一例外。36氪对爱折腾本地生成的人来说,这等于把一台过去按秒计费的旗舰,直接摆进了你的models目录。
跟做图的人有什么关系?发布当日的Artificial Analysis视频模型榜单上,H3的视频编辑能力排名全球第一,图生视频也位列全球前三。36氪也就是说,你硬盘里那些插画、人设图、壁纸稿,现在有了一条免费的通道,可以变成带声音的5-15秒短片。

不过先别急着下权重,把结论说在前面:"能跑"和"跑得舒服"是两件事,这波开源的信息里还掺着不少噪音。看完这篇,你至少能回答三个问题:我的电脑能不能跑?玩起来成本多少?现在是不是入场的时机?
你的电脑能不能跑?先看社区实测账本
社区已验证的部署下限比很多人想象中低:12GB显存+32GB内存+NVMe就有完整跑通记录,B站评论区的实测反馈里,8G显存的卡也能启动、生成0.5MP的短片。哔哩哔哩但"能跑"和"跑多快"是两回事,下面是从B站部署视频和评论区里扒出来的实测数据(均为社区实测,供参考,速度随工作流与设置浮动):
配置(显存+内存) | 社区实测参考 |
|---|---|
8G + 32G | 0.5MP、5秒 ≈ 400秒 |
12G + 16G | 官方流480p、5秒 ≈ 420秒 |
RTX 3060 12G + 32G | 720p、5秒图生视频 ≈ 33分钟 |
2080 Ti 22G + 64G | 单条约20分钟 |
RTX 4090D 24G + 96G | 1344×768带音频,可正常出片 |
MacBook 16GB统一内存 | 能跑,5秒视频等110分钟 |
这张账本透露了两件事。第一,"低显存老卡也能玩"是真的,但480p的"玩"是每条等几分钟到几十分钟,还得抽卡。第二,更反直觉:这模型对内存的要求远高于显存。33B的DiT主干量化后约19.5GB,旁边的Qwen3-VL-32B文本/视觉编码器bf16权重大到48GB,权重主要靠内存承载、逐层卸载。有知乎作者把账算得很直白:32GB内存能跑但会落盘,64GB是舒适线,96GB以上可以选更好的量化组合。知乎B站评论区里"内存永远是首要的,显存无关紧要"的说法也几乎没人反驳。想为H3升级电脑的话,先加内存,后换显卡——甚至有人从电子垃圾堆里挖出了E5+DDR3四通道128G的性价比组合。

Mac用户单独劝退一句:16GB统一内存的MacBook已经有人跑出过5秒视频,只是这次生成等了大约110分钟。知乎能启动和能长期拿来出片之间,还有一段很长的距离。
三条玩法的成本账
官方API定价默认2K分辨率每秒0.8元人民币,折算768p每秒0.5元,是同梯队闭源旗舰的三分之一左右。36氪按美元计价表看:2K为每秒0.13美元,768P为每秒0.08美元,768P再生到2K还要每秒0.05美元。知乎

生成一条10秒的768p短片,花费5块钱。本地部署单次生成的边际成本趋近于零,但要算时间账:以RTX 3060的速度,一条5秒视频半小时,抽几次卡才出一条满意的,重度玩家一天出10条可用素材已经算高效。一个月只做两三条的人,老老实实付API或用云平台更划算;天天生成、爱折腾、不想把参考图和角色设定传上云的人,本地部署一定回本——评论区说得好,“本地也要抽卡,就是成本非常低”。第三条路是不买硬件、直接用云端工作流:RunningHub、LibTV这类平台已经第一时间接入H3,还有免费额度可以试,适合"先体验效果、再决定要不要投硬件"的人。
这六个坑,前面的人已经替你踩了

开源≠满血。这次开放的是H3-Base,本地能生成的是768p音视频;2K需要尚未开放的H3-Regenerate-2K模块或官方API,提示词理解模块H3-Context-IR同样是托管的。知乎上面这张图就是官方GitHub公布的三层结构,网上号称"本地2K直出"的工作流,别急着信。
加速是有代价的。官方4步加速LoRA确实把20步压到了4步,但社区反馈集中在画质缩水:“4步lora生成的视频特别糊,糊成马赛克是啥情况”。哔哩哔哩SageAttention同理,装上提速,但不少人画质明显下降。现阶段速度与画质还做不到两全。
版本依赖比想象中严格。int8量化严重依赖torch CUDA 130以上,ComfyUI要用官方便携版0.30.0以上(有人反馈0.30.1比0.30更快),第三方整合包可能内置旧版本,秋叶启动器用户暂时还得再等等。哔哩哔哩
提示词别照抄闭源模型的。H3的提示词逻辑不一样,照搬老模板会出现"人物乱说话、背景音乐奇奇怪怪"。官方文档里有示例句式,还有官方Skill帮你改写提示词,这个补课值得做。
视频参考生成是显存吞噬兽。有实测用16G显存+64G内存跑视频参考替换,15秒480p,采样器跑了10分钟才到10%,显存占用30G+。想玩参考生成,硬件要往上抬一档。
别去翻老的"海螺本地部署"教程。海螺前两代根本没开源过,H3是换代重设计,不是02的放大版,网上关于海螺02的一切参数讨论对H3都不适用。
谁现在玩、谁等一等、谁直接用线上
电脑有32G以上内存、12G以上显存、爱折腾的人:现在就可以动手。路径已经有人铺好:ComfyUI 0.30以上官方便携版+ModelScope上的Comfy-Org/MiniMax-H3权重(FL2VA与Ref2VA两个任务检查点,磁盘紧张只装FL2VA能省21GB)+ReservedVRAM插件,先从480p/768p玩起,别急着追2K。
电脑配置低、或者不想折腾的人:等一个月。有三件事值得等——稀疏注意力版本开源(速度会明显提升)、2K再生模块开源、社区整合包收敛出稳定版。评论区有人说得好,“百家争鸣,普通玩家可以一个月后玩个收束版本”。哔哩哔哩
只想偶尔用于工作的人(电商图生视频、短剧钩子镜头):别买硬件,API每秒0.5-0.8元+已接入的云平台,试错成本比折腾一下午更低。
最后对做图的人多说一句:H3的图生视频是目前开源里最强的路径之一,你手里最满意的那张图,值得拿去做一条5秒的带声音动效——过去这种效果要排队等闭源模型、按秒付钱,现在权重就摆在那里。也别觉得图像端就此停更:Seedream 5.0 Pro 7月刚发布,输出图0.3元起,字节的图像军备竞赛远没结束。36氪接下来盯三个信号:稀疏注意力和2K模块的开源进度、社区加速LoRA的画质修复情况、以及即梦和海螺的新动作。