AI视频能在自己电脑上跑了!ComfyUI+MiniMax H3本地部署教程
最近 AI 视频这块又热闹起来了。不过和前两年不太一样,以前效果好的视频模型基本都在云端,想玩就得充值、买积分,一次生成几秒钟,抽卡抽得心疼。现在MiniMax H3 开放权重之后,咱们这些有独显的臭打游戏的有福了,终于可以正儿八经塞进自己电脑里跑了。

而且更方便的是,ComfyUI已经原生支持MiniMax H3。也就是说,不需要自己折腾一大堆魔改插件,更新ComfyUI、下载模型、载入官方工作流,基本就能开跑。
这篇就从零开始聊一下,怎么在Windows电脑上用ComfyUI + MiniMax H3本地生成AI视频。
MiniMax H3到底是什么?
MiniMax在2026年7月31日正式发布H3。
和以前比较单纯的文生视频模型不同,H3更接近一个真正的多模态音视频生成模型:它能同时理解文字、图片、视频和音频,也能在生成画面的同时直接生成声音,记住这点:视频和声音一起生成,对白、环境音、音乐都可以直接写进Prompt里。非常牛X!
目前ComfyUI官方工作流主要提供三种玩法:

T2V:Text to Video
直接输入文字生成视频。
I2V:Image to Video
拿一张图片生成动态视频,也可以加入首帧、尾帧控制。
R2V:Reference to Video
这个就比较猛了,可以同时喂图片、视频甚至音频,让模型参考人物、画风、动作、运镜或者声音来生成新视频。
官方目前的R2V工作流最多支持9张参考图片、3段参考视频和3段独立参考音频。对于玩视频内容的人来说,我觉得后面这个R2V反而是H3最值得玩的东西。
先看看你的电脑能不能跑

这块其实我不太清楚,有的说是64G内存+12G显存的电脑才行,我这试了下32G内存+16G显存也能跑出不错的质量,速度也还能接受。网上别人说的8G显存也能跑,只不过输出分辨率得调低一些。
安装ComfyUI真的非常傻瓜
H3这次我非常建议新手直接走官方工作流。
首先得去安装ComfyUI:

最简单的方法就是,去某g__hub上下载Windows Portable版本,N卡就下ComfyUI_windows_portable_nvidia。别像我一样,自认为我的CPU是intel的,就下了intel版本,结果打开后无法加载GPU……

另外,ComfyUI有desktop安装版本,但装好后部署comfyui我发现其内置的最新版是0.28的,在模板里搜不到minimax H3 图生视频,所以就别用desktop安装版了。
下载好后解压,ComfyUI_windows_portable的目录如下:

把它放到一个没有中文的目录下就行,建议放到硬盘的根目录,可以减少文件路径过长导致的错误。打开run_nvidia_gpu.bat批处理文件后,它会自动启动terminal终端来完成各项部署,完成后就会启动浏览器开启web工作台:

我们点击模板。

在模板里选择生成类型》视频,里面就可以按照我们的需求去选择模板了,选好之后,就会进入节点式工作流↓

第一次部署我建议先玩:MiniMax H3文生视频(T2V)
因为它变量最少。先确认模型能够正常加载、采样和输出视频,再折腾其他的。
下载哪些模型?
如果你用的是T2V或者I2V,官方推荐的本地组合主要是下面四个文件。

视频扩散模型
minimax_h3_fl2va_pruned_int8_convrot.safetensors

放到ComfyUI解压后目录里的:
ComfyUI/models/diffusion_models/
·
Qwen3-VL文本/多模态编码器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
放到:
ComfyUI/models/text_encoders/
·
Video VAE
minimax_h3_video_vae_fp16.safetensors
+
Audio VAE
minimax_h3_audio_vae_fp32.safetensors
两个模型放到:
ComfyUI/models/vae/
如果你要玩R2V参考生视频,则需要另外下载:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
同样放进:
ComfyUI/models/diffusion_models/
FL2VA和Ref2VA是两套不同权重,别下错了。
模型搞定后,就可以关掉comfyui并重新打开加载一遍,随后就能正常用了。
试下!
文生视频
我们先做一次最简单的T2V,不要看到H3支持高分辨率、15秒,就直接把所有参数拉满,先确认能跑。
我建议第一次直接:
16:9;832×480;5秒

duration就是时长,5.0就是5秒钟;百万像素0.4就是832×480。
然后写一条简单Prompt,比如:夜晚的东京街道,一名穿黑色夹克的年轻男子从便利店走出来,细雨落在路面上,霓虹灯倒映在积水中。镜头缓慢向人物推进,人物停下来抬头看向天空。背景有轻微车辆行驶声和雨声,远处传来城市环境音,电影感,真实摄影。

大概2分半就能生成5秒的视频,效率我觉得还挺不错。
Prompt你不用只写:人物、衣服、背景、镜头。
还可以直接把:
人物做什么、镜头怎么运动、环境里有什么声音、人物说什么、背景音乐是什么
全写在同一个Prompt里面,如果不太会写的话,可以用deepseek这类AI工具帮你润色,扩展想象力。H3本身就是音视频联合生成,所以Prompt里把画面、运动和声音一起描述清楚,一般更容易得到接近预期的结果。
接下来
图生视频
实际玩下来,我觉得很多人真正用得最多的应该还是I2V,纯文生视频随机性还是比较高。而图生视频可以先把人物、产品或者场景确定下来,再让H3负责“让它动起来”。
在模板里选择生成类型》视频》MiniMax H3图生视频

节点工作流载入完成后,点击选择文件上传,把自己的图片放进去。然后写动作。
例如拿一张产品照片,可以写:
保持产品外观、材质、颜色和Logo不变。镜头缓慢从左向右环绕产品,背景灯光产生轻微移动,产品保持静止。镜头最后缓慢推进至产品正面。环境安静,伴随轻微电子氛围音乐。

如果有明确的结尾画面,还可以复制一下加载图像的节点,接First Frame+Last Frame——也就是我们经常说的首尾帧生成,H3会尝试生成两个画面之间的运动过程。
对于产品动画、转场以及一些短片镜头,这个功能其实非常实用。
比如做数码产品视频的时候,我完全可以先拍好产品的起始画面和结束画面,再交给H3补中间过程。相比完全靠Prompt抽卡,可控性要高不少。
参考生视频
H3比较有意思的是Reference to Video,比如可以给它:人物照片+喜欢的运镜+参考声音。然后告诉H3:人物外貌参考Picture 1,镜头运动参考Video 1,人物声音参考Audio 1。模型会自己理解这些素材之间的关系。

官方工作流要求参考素材按照、

比如:让图像1的女生做出图像2的动作,镜头缓慢向人物推进,人物停下来抬头看向天空。远处传来山谷环境音,电影感,真实摄影。
效果还不错。
常见问题
找不到GPU 无法加载独显
重下一个适合你GPU品牌的版本,N卡下nvidia的,A卡下amd的,别像我一样和CPU的品牌弄混。
工作流打开全是红色报错
先更新ComfyUI,如果是很久没更新的版本,很可能压根没有H3相关的原生节点。如果是desktop版,建议删了重新下一个portable的。
小显存小内存能不能跑?
用固态硬盘虚拟内存,能跑,但真的慢。
最后
这次ComfyUI原生支持之后,本地部署门槛已经比想象中低很多,无论是内置工作流、支持中文这些都极大的降低了门槛。唯一的门槛就是一张显存较大的独立显卡吧,但如果你有大显存显卡的话,我觉得还是值得玩一玩的。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

姐搓澡不
校验提示文案
张大妈
校验提示文案
苹果先生
校验提示文案
小树熊
校验提示文案
猫仔仔
校验提示文案
信太多因为知道太少
校验提示文案
小鹿梦溪
校验提示文案
小明侃家电
校验提示文案
亦心之心
校验提示文案
爱折腾的老狐狸
校验提示文案
小明侃家电
校验提示文案
我是小猫猫
校验提示文案
村口剪头王师傅
校验提示文案
人生就是道选择题
校验提示文案
弗老大
校验提示文案
laoshu0205
校验提示文案
亦心之心
校验提示文案
小明侃家电
校验提示文案
小鹿梦溪
校验提示文案
人生就是道选择题
校验提示文案
村口剪头王师傅
校验提示文案
我是小猫猫
校验提示文案
laoshu0205
校验提示文案
小明侃家电
校验提示文案
信太多因为知道太少
校验提示文案
姐搓澡不
校验提示文案
弗老大
校验提示文案
猫仔仔
校验提示文案
小树熊
校验提示文案
苹果先生
校验提示文案
爱折腾的老狐狸
校验提示文案
张大妈
校验提示文案