0.8元/秒,还开源:MiniMax-H3满月,数字人创作能在消费级显卡上走多远?

源自132位全网作者

12:12

最近两天刷B站的朋友应该已经发现了:首页隔三差五就冒出一条MiniMax-H3工作流视频——音频驱动数字人、对口型、无限时长、“让你推的角色无损唱歌”,收藏量动辄上百。哔哩哔哩哔哩哔哩不是巧合,这波爆发有明确的时间线,而且对做数字人内容的人来说,可能是今年最值得认真对待的一次模型换代。

先把事情说清楚。7月31日,MiniMax正式发布新一代多模态生成模型H3,视频生成定价0.8元/秒(2K分辨率),官方口径是"仅为业内同类旗舰视频模型的三分之一",而且这是MiniMax推出的首款开源多模态生成模型。每日经济新闻发布当天,MiniMax港股涨了13.15%。8月3日,模型权重正式开源——从"按秒付费"到"权重免费下载",中间只隔了一个周末。知乎

为什么说数字人创作是最大受益者

之前的视频生成模型,做数字人内容基本是"拼装":先出画面,再单独配音,再做口型对齐,台词一改整段重做。H3的思路不一样,它是个33B的全模态模型,原生带立体声音频——画面里的人物开口说话时,口型是跟着声音走的,环境声、音效在同一次生成里完成。知乎

对数字人创作者,几个能力是直接可用的:

  • 一次生成最多塞9张参考图、3段视频、3段音频,角色形象、运镜参考、目标音色可以一起喂进去;

  • 指令式编辑:换背景、改台词、迁移音色,没动的部分保持不变,不用整段重渲;

  • 上下文延展:上一段的最后一帧可以当下一段的起点,角色和场景连贯,短剧、长口播能分段续写。

所以B站这波工作流不是蹭热度,是真有人拿它跑通了数字人生产线:有人做"推的角色无损唱歌"(音频分离+口型驱动),有人做多人对话短剧,还有人把分片推理做成无限时长方案。平台侧也在跟进,比如数字人创作平台智映在8月25日就宣布接入H3,150个数字人形象直接可调用,真人人像和虚拟人像支持同画布混用。知乎

0.8元/秒,还开源:MiniMax-H3满月,数字人创作能在消费级显卡上走多远?

开源满月,生态已经长成了什么样

这里替大家把开源后一个月的社区动态盘了一遍,按路线分好类:

本地部署派(ComfyUI主战场):工作流迭代最快的是分片推理、音频驱动对口型、全能参考这几条线,头部教程视频两天内就能攒到三位数收藏;阿里PAI等团队已经放出8步加速LoRA,社区还有PinkCherry、Remix等专项强化模型和电影感LoRA陆续开源。知乎

0.8元/秒,还开源:MiniMax-H3满月,数字人创作能在消费级显卡上走多远?

轻量推理派:Redis创始人antirez在8月13日开源了h3.c——一个专为Apple Silicon写的C+Metal原生推理引擎,靠SSD流式加载让显存吃紧的Mac也能跑,这说明H3的推理生态已经不局限于N卡+Python。微博

官方工具派:官方放出了prompt Skill,Claude、Codex可直接调用生成推荐提示词,社区反馈是"每遍生成结果差不多,不太需要抽卡"。微博8月21日又推出MiniMax Design,把策划、分镜、生成、剪辑、交付串成一条AI Agent流水线。微博

云平台派:不想装环境的,海螺AI网页版可以直接体验;第三方API通道已经开始打价格战,有渠道把价格压到4分钱/秒,还分时段计费。知乎便宜是真便宜,但渠道稳定性和合规风险自己掂量。

一个模型开源一个月,四条路线同时铺开,这个生态密度在视频模型里是很少见的。

显存真相:8G"能跑"和"好用"是两回事

教程标题普遍写"8G显存可用",这话技术上没错,但魔鬼在细节里。先把社区的三档方案摆清楚:

全精度档(24G显存起):有人实测在RTX 4090上跑通,但H3主模型加载约20GB、文本编码器约15GB,两个模型叠起来超过24G,不做显存管理会直接把系统干到强制重启。知乎这档体验最完整,代价是旗舰显卡加一堆卸载、复用的工程细节。

低显存档(8-16G):主流玩法是分片推理加模型量化,或者用ClipProj这类方案把视觉编码器从32B换成4B,显存占用能从15.7GB压到5GB左右。知乎能跑,但要有心理预期——热门工作流的评论区里,有人实测4秒视频生成了79分钟,4060用户卡在加载环节的不在少数,还有人反馈"数字人场景吃资源,速度不如LTX2.5"。哔哩哔哩

0.8元/秒,还开源:MiniMax-H3满月,数字人创作能在消费级显卡上走多远?

零硬件档:官方云0.8元/秒,或者直接用打包好的平台。

一句话总结:16G显存是分水岭。16G以下不是不能玩,是"跑通"和"稳定出片"之间还隔着调参、降速和版本回退。

算笔账:云端按秒付费,本地无限抽卡

拿数字人最常见的60秒口播视频算:

  • 官方云:0.8元/秒×60秒=48元一条。生成式内容躲不开抽卡,按2-3条挑一条能用算,单条成片成本100-150元;

  • 本地部署:边际成本约等于电费,抽卡自由。代价是前期硬件投入和生成等待时间;

  • 月更30条的强度:云端一年下来是五位数开销,本地一次显卡投入摊完就是零头。

所以决策逻辑其实很清晰:产量低、试水期,用云;产量稳定、长期做号,本地的账怎么算都划算。中间地带的最优解是"云端验证提示词和效果,本地批量出片"。

踩坑清单:社区第一周替你踩完了

这几条都是热门工作流评论区的真实反馈,动手前先存好:

  1. 分段续写会画质劣化:分片拼接越长,后段画质越肉眼可见地掉,目前无解,重要内容控制单段长度。

  2. 台词幻觉还在:有实测案例提示词写了"no music",结果还是冒出了音乐和怪声,关键指令要多验证。哔哩哔哩

  3. 版本迭代太快:工作流整合包几乎天天更新,新版翻车是常态,有人连夜回退8月8日版本。别追最新,追"评论区没人骂的"。

  4. 下载量巨大:全套模型几十GB,硬盘先留够。

  5. 提示词别随手写:社区共识是按官方文档结构写,或者直接用官方Skill,出片稳定性差一个量级。

0.8元/秒,还开源:MiniMax-H3满月,数字人创作能在消费级显卡上走多远?

你该冲还是该等

  • 16G以上显存+爱折腾:直接冲。现在是生态红利期,工作流、加速LoRA、教程都是现成的,早一个月入场攒下的经验是实打实的;

  • 8-12G显存:建议先用云端把内容模式跑通,确认有持续产量需求再升级硬件,别为"可能有用"买单;

  • 完全不碰ComfyUI:等MiniMax Design这类客户端成熟,或直接用接入了H3的数字人平台,把精力留在内容本身;

  • 商用口播、带货方向:模型能力够了,但AI内容的平台标注规则和版权登记口径都在收紧,商用前把合规动作做在前面。

最后留几个值得持续盯的信号:官方对分片劣化和台词幻觉的修复节奏、Seedance 2.5和可灵3.0的价格跟进、以及加速LoRA能把消费级显卡的速度拉到什么位置。这三个变量任何一个落地,上面那笔账都得重算。

精选参考来源

1
#MiniMaxH3价格仅为同类三分之一# 【大模型“价格战”烧向多模态?MiniMax推出新一代多模态生成模型,定价降至行业同类模型三分之一】7月31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布近期开源。早在WAIC期间,MiniMax方面便表示,H3是其从“特化任务模型”迈向“通用多模态智能”的新范式探索。@每日经济新闻 记者注意到,H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。随着本次模型正式发布,@每日经济新闻 记者注意到,H3是MiniMax推出的首款开源多模态生成模型。此外,记者从官方了解到,MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。截至7月31日港股收盘,MiniMax股价涨13.15%,总市值805.34亿港元。大模型“价格战”烧向多模态?MiniMax推出新一代多模态生成模型,定价降至行业同类模型三分之一(每经,泽塔) 每日经济新闻的微博视频
2
【Redis作者出手:让MiniMax视频模型在Mac上“贴地飞行”】Redis创始人antirez最近开源了h3.c,这是一个专为Apple Silicon设计的MiniMax-H3原生推理引擎。它完全抛弃了臃肿的Python堆栈,直接基于C和Metal编写,让M3及最新的M5系列芯片能以极高效率跑通从文本到视频、音频的全流程。该项目最硬核的地方在于其工程取舍:通过减少Transformer层数、复用去噪步数以及黑科技般的SSD流式加载(SSD Streaming),它不仅能在显存吃紧的设备上运行几十GB的DiT模型,甚至能直接在终端窗口预览生成的每一帧。这不仅仅是一个推理库,更是顶级程序员对硬件潜力的极致挖掘。社区普遍认为,这种“垂直切片”式的工程范式正在打破大模型对算力集群的依赖。相比于追求绝对精确的指标,这种能通过几行参数就在本地实现推理自由、且支持图生视频(Ref2VA)等进阶功能的工具,展现了从底层代码层面对AI进行降本增效的另一种可能。 repo: antirez/h3.c
全部
来源
内容由AI生成

精选参考来源

1. #MiniMaxH3价格仅为同类三分之一# 【大模型“价格战”烧向多模态?MiniMax推出新一代多模态生成模型,定价降至行业同类模型三分之一】7月31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布近期开源。早在WAIC期间,MiniMax方面便表示,H3是其从“特化任务模型”迈向“通用多模态智能”的新范式探索。@每日经济新闻 记者注意到,H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。随着本次模型正式发布,@每日经济新闻 记者注意到,H3是MiniMax推出的首款开源多模态生成模型。此外,记者从官方了解到,MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。截至7月31日港股收盘,MiniMax股价涨13.15%,总市值805.34亿港元。大模型“价格战”烧向多模态?MiniMax推出新一代多模态生成模型,定价降至行业同类模型三分之一(每经,泽塔) 每日经济新闻的微博视频

2. 【Redis作者出手:让MiniMax视频模型在Mac上“贴地飞行”】Redis创始人antirez最近开源了h3.c,这是一个专为Apple Silicon设计的MiniMax-H3原生推理引擎。它完全抛弃了臃肿的Python堆栈,直接基于C和Metal编写,让M3及最新的M5系列芯片能以极高效率跑通从文本到视频、音频的全流程。该项目最硬核的地方在于其工程取舍:通过减少Transformer层数、复用去噪步数以及黑科技般的SSD流式加载(SSD Streaming),它不仅能在显存吃紧的设备上运行几十GB的DiT模型,甚至能直接在终端窗口预览生成的每一帧。这不仅仅是一个推理库,更是顶级程序员对硬件潜力的极致挖掘。社区普遍认为,这种“垂直切片”式的工程范式正在打破大模型对算力集群的依赖。相比于追求绝对精确的指标,这种能通过几行参数就在本地实现推理自由、且支持图生视频(Ref2VA)等进阶功能的工具,展现了从底层代码层面对AI进行降本增效的另一种可能。 repo: antirez/h3.c

3. MiniMax-H3-分片推理-无限时长,数字人,全能参考,文图生视频,8G显存可用,自动补帧,超分放大,首尾帧,自动提示词,多任务队列

4. 让你推的角色无损唱歌,简单的数字人工作流v2~Minimax h3

5. 新增MiniMax-H3模型!150个数字人直接用!

6. RTX 4090 本地跑 MiniMax H3 视频生成:完整技术方案与踩坑总结

7. 神奇!从 15.7 GB 降到了约 5 GB !minimaxH3大幅节省显存!对小显存显卡非常友好!这一个方案一定不要错过!

8. MiniMax H3爆了,4分/秒就能玩

9. MiniMax H3 电影感 LoRA 开源了!附保姆级使用教程

10. 用Minimax H3官方skill写prompt,每遍生成都差不多,不太需要抽卡,感觉有好有坏,没法一次开八个然后开把海斗来收菜

11. MiniMax 推出MiniMax Design 是一款面向商业视频与内容创作者的 AI Agent 客户端配合其H3模型 通过 AI Agent把策划、分镜、生成、剪辑到交付的全流程串联了起来下面是根据拍摄制作的一个特效AR视频他内置了针对不同商业场景的专属模板,直接套用就能出片:自动理解意图无限画布(节点图协作)技能与插件生态开箱即用的预设技能配合MiniMax H3 视频模型非常划算,不仅开源,且 API 价格极低(768P 约 0.5 元/秒,2K 约 0.8 元/秒,年卡低至 0.4 元/秒)3D 导演台(最大王炸功能):自然语言 3D 布景:用提示词直接生成可旋转、缩放、增减道具的 3D 场景与人物打斗动作,摆脱纯提示词抽卡。手机摇杆虚拟运镜:用手机扫码把手机变成“虚拟摄像机”,像玩游戏一样推拉摇移、实时录制运镜路径。时间线与关键帧调速:支持手动画路径和打点,精细控制极速或慢镜头,导出的运镜轨迹直接作为视频生成的动态参考然后把你调好的运镜视频交给AI它就能根据你自己设定的运镜进行视频生成全自动批量出片:只要给出一句综合需求(如 5 个不同痛点的扫地机器人广告),Agent 会自己拆解分镜、自动批量生成几十张统一风格的产品/场景图,并全自动交叉渲染成成片。兼容性强,支持直接导入导出现成的 ComfyUI 工作流。我这里做了详细的评测你们可以看看:网页链接这里有个MiniMax Design - 手提示册与使用指南领取:网页链接在线体验:网页链接

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章