AI视频能在自己电脑上跑了!ComfyUI+MiniMax H3本地部署教程
最近 AI 视频这块又热闹起来了。不过和前两年不太一样,以前效果好的视频模型基本都在云端,想玩就得充值、买积分,一次生成几秒钟,抽卡抽得心疼。现在MiniMax H3 开放权重之后,咱们这些有独显的臭打游戏的有福了,终于可以正儿八经塞进自己电脑里跑了。

而且更方便的是,ComfyUI已经原生支持MiniMax H3。也就是说,不需要自己折腾一大堆魔改插件,更新ComfyUI、下载模型、载入官方工作流,基本就能开跑。
这篇就从零开始聊一下,怎么在Windows电脑上用ComfyUI + MiniMax H3本地生成AI视频。
MiniMax H3到底是什么?
MiniMax在2026年7月31日正式发布H3。
和以前比较单纯的文生视频模型不同,H3更接近一个真正的多模态音视频生成模型:它能同时理解文字、图片、视频和音频,也能在生成画面的同时直接生成声音,记住这点:视频和声音一起生成,对白、环境音、音乐都可以直接写进Prompt里。非常牛X!
目前ComfyUI官方工作流主要提供三种玩法:

T2V:Text to Video
直接输入文字生成视频。
I2V:Image to Video
拿一张图片生成动态视频,也可以加入首帧、尾帧控制。
R2V:Reference to Video
这个就比较猛了,可以同时喂图片、视频甚至音频,让模型参考人物、画风、动作、运镜或者声音来生成新视频。
官方目前的R2V工作流最多支持9张参考图片、3段参考视频和3段独立参考音频。对于玩视频内容的人来说,我觉得后面这个R2V反而是H3最值得玩的东西。
先看看你的电脑能不能跑

这块其实我不太清楚,有的说是64G内存+12G显存的电脑才行,我这试了下32G内存+16G显存也能跑出不错的质量,速度也还能接受。网上别人说的8G显存也能跑,只不过输出分辨率得调低一些。
安装ComfyUI真的非常傻瓜
H3这次我非常建议新手直接走官方工作流。
首先得去安装ComfyUI:

最简单的方法就是,去某g__hub上下载Windows Portable版本,N卡就下ComfyUI_windows_portable_nvidia。别像我一样,自认为我的CPU是intel的,就下了intel版本,结果打开后无法加载GPU……

另外,ComfyUI有desktop安装版本,但装好后部署comfyui我发现其内置的最新版是0.28的,在模板里搜不到minimax H3 图生视频,所以就别用desktop安装版了。
下载好后解压,ComfyUI_windows_portable的目录如下:

把它放到一个没有中文的目录下就行,建议放到硬盘的根目录,可以减少文件路径过长导致的错误。打开run_nvidia_gpu.bat批处理文件后,它会自动启动terminal终端来完成各项部署,完成后就会启动浏览器开启web工作台:

我们点击模板。

在模板里选择生成类型》视频,里面就可以按照我们的需求去选择模板了,选好之后,就会进入节点式工作流↓

第一次部署我建议先玩:MiniMax H3文生视频(T2V)
因为它变量最少。先确认模型能够正常加载、采样和输出视频,再折腾其他的。
下载哪些模型?
如果你用的是T2V或者I2V,官方推荐的本地组合主要是下面四个文件。

视频扩散模型
minimax_h3_fl2va_pruned_int8_convrot.safetensors

放到ComfyUI解压后目录里的:
ComfyUI/models/diffusion_models/
·
Qwen3-VL文本/多模态编码器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
放到:
ComfyUI/models/text_encoders/
·
Video VAE
minimax_h3_video_vae_fp16.safetensors
+
Audio VAE
minimax_h3_audio_vae_fp32.safetensors
两个模型放到:
ComfyUI/models/vae/
如果你要玩R2V参考生视频,则需要另外下载:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
同样放进:
ComfyUI/models/diffusion_models/
FL2VA和Ref2VA是两套不同权重,别下错了。
模型搞定后,就可以关掉comfyui并重新打开加载一遍,随后就能正常用了。
试下!
文生视频
我们先做一次最简单的T2V,不要看到H3支持高分辨率、15秒,就直接把所有参数拉满,先确认能跑。
我建议第一次直接:
16:9;832×480;5秒

duration就是时长,5.0就是5秒钟;百万像素0.4就是832×480。
然后写一条简单Prompt,比如:夜晚的东京街道,一名穿黑色夹克的年轻男子从便利店走出来,细雨落在路面上,霓虹灯倒映在积水中。镜头缓慢向人物推进,人物停下来抬头看向天空。背景有轻微车辆行驶声和雨声,远处传来城市环境音,电影感,真实摄影。

大概2分半就能生成5秒的视频,效率我觉得还挺不错。
Prompt你不用只写:人物、衣服、背景、镜头。
还可以直接把:
人物做什么、镜头怎么运动、环境里有什么声音、人物说什么、背景音乐是什么
全写在同一个Prompt里面,如果不太会写的话,可以用deepseek这类AI工具帮你润色,扩展想象力。H3本身就是音视频联合生成,所以Prompt里把画面、运动和声音一起描述清楚,一般更容易得到接近预期的结果。
接下来
图生视频
实际玩下来,我觉得很多人真正用得最多的应该还是I2V,纯文生视频随机性还是比较高。而图生视频可以先把人物、产品或者场景确定下来,再让H3负责“让它动起来”。
在模板里选择生成类型》视频》MiniMax H3图生视频

节点工作流载入完成后,点击选择文件上传,把自己的图片放进去。然后写动作。
例如拿一张产品照片,可以写:
保持产品外观、材质、颜色和Logo不变。镜头缓慢从左向右环绕产品,背景灯光产生轻微移动,产品保持静止。镜头最后缓慢推进至产品正面。环境安静,伴随轻微电子氛围音乐。

如果有明确的结尾画面,还可以复制一下加载图像的节点,接First Frame+Last Frame——也就是我们经常说的首尾帧生成,H3会尝试生成两个画面之间的运动过程。
对于产品动画、转场以及一些短片镜头,这个功能其实非常实用。
比如做数码产品视频的时候,我完全可以先拍好产品的起始画面和结束画面,再交给H3补中间过程。相比完全靠Prompt抽卡,可控性要高不少。
参考生视频
H3比较有意思的是Reference to Video,比如可以给它:人物照片+喜欢的运镜+参考声音。然后告诉H3:人物外貌参考Picture 1,镜头运动参考Video 1,人物声音参考Audio 1。模型会自己理解这些素材之间的关系。

官方工作流要求参考素材按照、

比如:让图像1的女生做出图像2的动作,镜头缓慢向人物推进,人物停下来抬头看向天空。远处传来山谷环境音,电影感,真实摄影。
效果还不错。
常见问题
找不到GPU 无法加载独显
重下一个适合你GPU品牌的版本,N卡下nvidia的,A卡下amd的,别像我一样和CPU的品牌弄混。
工作流打开全是红色报错
先更新ComfyUI,如果是很久没更新的版本,很可能压根没有H3相关的原生节点。如果是desktop版,建议删了重新下一个portable的。
小显存小内存能不能跑?
用固态硬盘虚拟内存,能跑,但真的慢。
最后
这次ComfyUI原生支持之后,本地部署门槛已经比想象中低很多,无论是内置工作流、支持中文这些都极大的降低了门槛。唯一的门槛就是一张显存较大的独立显卡吧,但如果你有大显存显卡的话,我觉得还是值得玩一玩的。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
