过去两周,本地大模型圈最热闹的不是哪个文本模型又刷了榜,而是一个视频模型:MiniMax H3。7月底MiniMax H3开源的时候,Artificial Analysis视频编辑榜Elo 1130分,直冲全球第一。 33B参数、视频+音频一次前向联合生成、ComfyUI原生支持——然后整个8G显存党、丐帮党、二手卡党全涌进来了。知乎
但你在小红书刷到的"38秒出片",和知乎上"3060花10小时做短片"的,根本不是同一个H3。我把小红书、知乎、微博的20多条实测,连同一个吵出101条评论的"8000预算帖"摆进同一张表,先说结论:拦住本地跑H3的从来不是显存,是三本账——内存账、授权账、时间账。
先把滤镜摘掉:官方仓库那个H3,不是发给你的显卡的
官方仓 MiniMaxAI/MiniMax-H3 共 280 个文件、约 464.2 GiB,FL2VA 与 Ref2VA 两套 checkpoint 各带 14 分片、61.73 GiB 的 transformer,官方只出 BF16。 个人玩家直接下官方权重是天方夜谭,社区跑的全是 Comfy-Org 重打包往下裁的量化档(同一快照里该仓下载量 3,672,292、点赞 5,717,但这是含自动拉取的近期窗口,不等于独立用户数)。知乎
裁法是门学问:官方模型卡自己说,约 13B 参数位于 AdaLN 分支、纯推理部署可不加载,pruned 版因此比原版小约四成。 官方 org 下的 awesome-h3-integration 索引页甚至按显存档位配好了栈:24GB 首跑推荐 19.53GB 的 pruned INT8 加 14.61GB 的量化编码器,22GB 的老 Turing 卡有专门的 W4A8 组合。知乎
最狠的一刀在文本编码器:H3 原版挂了个 Qwen3-VL-32B,光它就吃 15.7GB 显存。社区插件 ComfyUI-ClipProj 用 4B/8B 小编码器加几百兆投影矩阵替换后,实测 4B 搭配插件 bf16 精度为 8.3GB,切换到 fp8 精度后仅 5.2GB,int8 量化模式最低可以压到 4.5GB——代价是画质有细微损耗、项目仍是概念验证性质。 你刷到的"8G跑H3",跑的基本都是这层滤镜之后的版本:8G 显存把三种生成模式全测一遍,只活下来一个——8GB 能稳定出片的是 FL2VA 加 Turbo 提速,4 分钟一条;T2VA 人物服装全跑偏,Ref2VA 要 40GB 起步、8GB 当场 OOM。知乎小红书
还有两条没人喊的硬边界:官方 API 侧的 2K 与 24FPS 不下放,本地 H3-Base 上限 768p;本地生成的视频要商用需要 MiniMax 商业授权,而 Comfy 自称「唯一的官方转售方」,承诺的 Apache-2.0 迁移至今没有落地记录。 "0元出片"对自己玩成立,对你想接的单不成立。知乎

20多条实测进表:同一句话,8G到32G卡的真实世界
配置 | 模式/参数 | 结果 | 出处 |
|---|---|---|---|
1070 8G+32G内存 | 整合包4步Turbo | 能跑,很慢 | 老鹿整合包实测 |
4060 8G | “5秒三分钟出” | 评论区点破:简化版480p,远景没法看 | 8000预算帖 |
8G显存 | 三模式横测 | 只活一个:FL2VA+Turbo约4分钟/条;Ref2VA当场OOM | 小红书实测 |
3060 12G | 微电影 | 约1小时一条;另一人10小时出短片 | 小红书 |
12G+32G内存 | 10秒720P | 运行不了 | 3060帖评论 |
5060Ti 16G+32G | int8 | “完美适配,8G也可以、只是时间不行” | 微博 |
A4000 16G | 768×1376 3秒 | 176.9秒;放大1.35倍再+193.3秒 | 老鹿整合包 |
5070Ti 16G桌面 | 15秒/段 Turbo | 2-3分钟/段;一分钟成片全流程1.5小时 | 知乎复盘 |
5070Ti笔记本 | 15秒 0.5精度 | 约1.5小时,“还是云端算了” | 8000预算帖 |
RX 7900XTX 24G | int8 768P 5秒 | 约6分钟;A卡三坑全踩了一遍 | 小红书 |
RTX 5090 32G | 209帧 768p→1088p | 202.69s→566.08s,峰值显存23.4GB几乎没变 | 小红书 |
4080 Laptop 12G+远端TE | 864×480 124帧 | 243秒出5.17秒带声视频 | StageBridge |
5090 Laptop 24G | 同段 | 187.6秒 | StageBridge |
2080Ti~PRO6000七卡 | 8步LoRA同一段 | 最慢27分40秒未完成,最快不到3分钟 | 知乎横评 |
算家云5090镜像 | 标"推荐显存32G" | 作者提醒:镜像能启动≠工作流跑通 | 长视频验证 |

这张表里最反直觉的不是速度差(入门卡和旗舰差几十倍,意料之中),而是三条把"本地党常识"打穿的结论。
1. 瓶颈是内存,不是显存。 评论区最高频的词是"内存":不能,这个东西吃内存,768p要想跑到15s 64g起步,还不保证参考视频能跑的动——一位买了48G内存的用户留言"看完心都凉了"。 更阴的是机制坑:框架锁90%物理内存、内核悄悄杀进程、显卡监控一切正常,直到查了 dmesg 才实锤是 OOM——启动加 --disable-pinned-memory,实测内存 29.8G→7.5G,再没死过。 洋垃圾党已经给出邪道路线:X99配ECC内存、DDR3平台照样上桌——“显存装得下,老平台根本不拖后腿”,前提是把内存堆够。小红书小红书
2. 分辨率是个假按钮。 同一Seed、同一组首尾帧,结果耗时从 202.69 秒涨到 566.08 秒,接近原来的 3 倍,峰值显存却几乎没变,仍然是 23.4GB;而 1088p 并不是对 768p 结果的高清重绘,两段结果的 PSNR 只有 19.86dB、SSIM 为 0.722——构图、物体位置全变了。 想省钱又想要高清,社区正确姿势:按 0.4 兆像素这类低分档先抽卡、固定Seed,再二采或放大。小红书

3. 越快的卡反而越便宜。 三张卡租卡横评给的答案很扎心:4090 虽然算力最强、生成最快,但因为完成一条视频的耗时远远低于另外两张卡,单条视频的实际生成成本反而是三者里最低的;3090 单卡租金便宜,但慢得太多,算总账反而最贵。 按时间计费的算力时代,"慢"本身就是最大的成本项——七卡横评里最惨的一组,跑了 27 分 40 秒仍卡在 11% 的采样阶段,只能直接杀掉后台进程。知乎知乎
那笔账,到底怎么算
把三档真实价格摆在一起。RunningHub 基于 H3 开源基座做了深度后训练增强版,9月29日发布,一秒一毛钱即可直接产出成片。 第三方转售口径同样便宜:Atlas Cloud 把 H3 做成四档、起价每秒 0.038 美元,Higgsfield 标 768p 每秒 0.074 美元——都是转售方自报价,只能当量级参照。 云端一分钟成片大约6块钱起步。知乎知乎
本地呢?参考那个8000预算热帖的评论区现实:现在这行情,投2w差不多。新的显卡都占了1w出头,64g内存4k,剩下的你想想。 拿云价反推:2万元的机器,对应云端约55小时的成片。理想状态下本地确实能"0元":一位 5070Ti 16G 桌面用户做了条一分钟公司宣传片,生成四段15秒共花约1.5小时,唯一花钱的是用云端模型写提示词的0.11元; 但同一个帖子里,5070ti笔记本跑一个0.5精度的15秒大概要一个半小时,作者自己的结论是"还是云端算了"——机器时长、电费、折腾成本和返工率,才是本地党真正的账单。小红书知乎

谁现在装,谁再等等,谁认命上云
值得马上装的:手里已有24G级显存加64G内存的(7900XTX int8 六分钟就能出一条5秒片,已经能干活);把本地当隐私沙盒和工作流试验田的;以及"先租后买"党——租卡跑完九组数据再决定配机,比直接2万砸下去体面得多。再等等的:8-12G卡用户,你刷到的低耗时演示多是480p简化版加Turbo,量化生态一周三变,等等党稳赚;还有指望本地回本的接单创作者,商用授权要另买,成本模型直接改写。认命上云的:笔记本党和不想加内存条的——"0元出片"的口号里,藏着你没算的那台机器。
最后是三件装前必查的事("踩20坑"帖作者的排查顺序):先对版本链,nvidia-smi 右上角的 CUDA Version 就是你的上限,镜像tag会骗人;再加 `–disable-pinned-memory`,防内核静默杀进程;最后才轮到怀疑显存。权重走 Comfy-Org 量化仓,别碰官方全量。坑不在模型,在环境。
至于"这套配置到底跑没跑通",一位做长视频验证的作者把话说得很克制:镜像创建成功、自动启动、页面能打开,只说明验证入口建好了——这里的 32G 只能理解为这个命名镜像页面当前给出的推荐标签,不等于性能结论。 入口能用,不等于跑通;能出片,也不等于能生产。这张20多条实测拼出来的表,就是替你先把三层滤镜各摘了一遍——按档位对号入座,比刷100条"本地部署教程"省时间。知乎