这周关注数字人创作的朋友,大概率被一个名字刷屏了:MiniMax H3。B站的数字人分区几乎成了H3工作流专场,音频驱动对口型、动作迁移、数字人唱歌、长视频拼接,一条音频驱动的技术实测视频播放量超过2万。
先把时间线补齐:7月31日,MiniMax发布新一代全模态视频生成模型H3,三天后直接开源权重。知乎8月3日权重开放后,H3成为首个登顶Artificial Analysis全球视频榜单的开源模型。知乎8月20日,MiniMax又推出多模态创作平台MiniMax Design,把H3接进完整创作任务链。微博

于是不少做数字人口播、短剧的朋友心动了:开源了,是不是等于"数字人自由",不用给平台交月费了?先泼盆冷水:开放权重不等于零成本。我把这周B站、知乎、小红书上的实测和踩坑记录翻了一遍,给大家算三笔账,算完再决定走哪条路。
第一笔账:显卡可能是第一道门槛
H3的模型文件不小,社区把完整权重的五个组件叫"五件套",总重34GB起步。知乎官方给的SGLang示例用的是4张GPU,从未承诺消费级单卡能完整跑起来。知乎社区实测的现状大致是这样:
8GB显存:能跑。有人用RTX 4070笔记本(8GB显存)加32GB内存跑通了带声音的文生视频,优化后一条短片段的生成时间从500多秒压到150秒左右。知乎但要有足够耐心。
12GB显存:跑768P,5秒的片子大约要等10分钟;冲2K,5秒大约25分钟。知乎能跑,但15秒的连续镜头等起来很煎熬。
16GB显存:5060Ti要开–novram把模型卸载到内存,靠原生节点5秒片子约3分钟,“能用但不算快”。知乎
24GB显存起:社区普遍把24GB当成生产起步线,3090、4090这类卡显存余量足,少了很多来回搬运数据的折腾。

还有一个容易被忽略的点:H3本地开放的核心是H3-Base,原生画布短边约768像素,完整2K链路里的Context-IR与Regenerate-2K并没有以同样方式开放。知乎

也就是说,“H3系统最高支持2K"不等于"下载到本地就能直接出2K”,想要2K成片还得走官方云端能力,API成本照样要算进去。知乎顺带一提,H3火了之后,知乎上已经有人晒出京东5060Ti的价格走势,感叹16GB显存的卡"被带飞了"。知乎真要为它专门买卡,别在高点冲动下单。
第二笔账:时间和学习门槛,比宣传里高
先澄清一个常见误会:H3不是"数字人软件",而是一个开放权重的全模态视频生成系统,能在同一个上下文里理解文字、图片、视频和音频,联合生成画面、对白和环境声。知乎想做数字人口播视频,得自己搭链路:TTS生成音频,音频驱动H3出对口型画面,再做拼接、放大、补帧。社区说的"双采"“音频驱动”、Ref2VA、FL2VA节点,都是这条工作流上的玩法。

评论区的真实声音比弹幕热闹得多。有人说,太复杂了,都做数字人了,没必要再排列组合那么多种了吧。哔哩哔哩也有人吐槽,H3太难了,以前的模型刚出来没几天我就搞明白了,H3现在还卡着,不知道干啥。哔哩哔哩
踩坑报告同样硬核:照网上的4080教程在5060Ti上抄作业,大概率直接卡死,差一个CUDA版本,模型就跑不了。知乎分辨率必须是32的倍数,否则直接报错;视频VAE和音频VAE要分开解码;指定中文台词还可能出现发音不准、内容变化或中英文混合,稳妥做法是H3只负责画面和环境声,对白用中文TTS单独生成,后期再做口型同步。知乎也难怪有高赞评论感慨,昨天的刚学知识今天就变成粪便了。哔哩哔哩节点和工作流迭代飞快,上周的教程这周可能就过时了。
还有一笔容易被低估的成本:抽卡时间。小红书有创作者实测100条视频,其中一组10条里只有4条能直接用。小红书本地生成不要钱,但时间不是。而且数字人口播一般是2到3分钟的长音频,H3单次出片按秒算,评论区里大家都在等长音频方案,有人直言,如果把一段长音频,先切成很多小段,再一个一个生成,太麻烦了。哔哩哔哩这个痛点目前还在靠社区工作流补。
第三笔账:许可证不是"开源就能随便用"
这是最容易翻车的一笔。H3用的不是Apache 2.0或MIT,而是MiniMax自己的社区许可协议,对适用地区、商业使用、托管服务和分发都有条款约束,当前许可文本把美国、欧盟、英国和韩国列为排除地区。知乎准备做出海内容或对外提供付费服务前,务必先读一遍最新官方协议,别当成"开源随便用"。知乎
那么,谁适合上车本地?
已有24GB显存的卡、能玩转ComfyUI:值得深入。本地最大的价值不是省那几条生成费,而是素材不出本机、流程自己可控、高频生成的边际成本接近于零。当然也要清醒:本地路线真正降低的是高频调用时的按次费用,不是把视频生成变成没有成本、没有限制的免费资源。知乎
有8到16GB显存:拿量化版加768P玩玩可以,当熟悉链路。但别为了H3专门买新卡,模型迭代太快,今天的"五件套"下个月可能就换形态。
没有显卡或纯新手:先别装机。一条路是官方API和第三方接入平台,2K档位约0.8元/秒,产量小的时候比买显卡划算。知乎另一条路是一键式工作流平台,先验证自己的内容方向跑不跑得通,再谈升级装备。

再给两个避坑提醒。其一,知乎作者已经在喊话"别花钱买课":H3官方模板已内置进ComfyUI核心,免费教程B站一搜一大把,别再给"AI视频训练营"交学费。知乎其二,"最新免费数字人直播软件"这类标题党,多是引流广告;而且数字人主播等生成内容今年2月已被纳入监管。人民网真要做商业化,合规这根弦要绷紧。
接下来盯什么
H3的效果也不是完美。同提示词的对比测试里,Seedance 2.5在哭戏这类情绪表达上仍被不少人认为胜一筹。开源阵营自己的创作者也承认,你要说效果,肯定还是比Seedance2.5要差一些的,但是这是开源的,还要什么自行车?哔哩哔哩但开源阵营的武器是迭代速度:继H3之后,MiniMax Music 3.0也已开源,数字人现在能直接开口唱歌。
值得持续关注的信号有几个:MiniMax M3.1的发布节奏、商用许可条款的更新、长音频口播工作流的成熟度,以及Design平台的免费额度够不够。知乎开源和闭源两条路线正在对垒,受益的是创作者。我会继续跟进,感兴趣的朋友保持关注。