做AI视频,你缺的不是模型,是这个翻译官
很多人做AI视频,做出来的效果总是不对。
你明明用着最先进的模型,prompt却写得跟小学生造句一样:
"一只猫在草地上跑,阳光很好"
然后生成出来,要么是猫在草地上僵硬地滑步,要么光线乱成一团。
你怪模型不行。 你怪AI太蠢。 你甚至开始怀疑人生。
但真相是:问题根本不在模型。 在你的prompt。
开篇:深夜调AI猫的沮丧用户开篇:深夜调AI猫的沮丧用户
你是不是也遇到过这种情况——
脑子里有一个画面,但写出来完全不是那个意思。
你说"有电影感",AI给你整出一张过曝的旅游照。 你说"情绪要有张力",AI给你一张面无表情的扑克脸。 你说"镜头要有呼吸感",AI给你来了一段PPT切换。
导演剪辑室:多屏调色间,专业电影感导演剪辑室:多屏调色间,专业电影感
为什么?
因为你自己都不知道"电影感"和"呼吸感"用prompt到底该怎么说。
这不是你的问题。 这是所有用AI做视频的人的共同困境。
直到我发现了这个工具——
它不是来教你写prompt的。
它是直接替你写。
封面:老电影摄像机+全息大脑,AI生成视频的视觉隐喻封面:老电影摄像机+全息大脑,AI生成视频的视觉隐喻
它叫 ComfyUI MiniMax H3-Promptor。
你只需要做一件事:给它一张图。
比如你想做一个日落奔跑的镜头,你随便找一张参考图丢进去。
它会自动分析这张图里的光线、色调、人物状态、镜头角度、构图——然后全部转化成专业的导演语言。
不是"阳光很好"。 是"逆光,侧跟镜头,暖色调,情绪压抑但有希望感"。
这就是AI应该有的样子。
不是替代你,是放大你。
你可能会问:不就是写prompt吗?我自己也能学。
好,我问你几个问题:
你做视频,需要分几种情况:
纯文字生成(Text to Video)
一张图生成视频(Image to Video)
两张图生成视频(指定首尾帧)
三到四张图生成视频(多参考)
直接把一个视频转换成另一个视频
每一种情况,prompt的写法都不一样,你知道吗?
你不知道。 H3-Promptor知道。
它有一个"自动检测"功能——你什么都不用选,你只管连上线,它自动识别你的模式,给你吐出最匹配的那个prompt结构。
你就是个导演,你只管想画面。 剩下的,工具来。
更离谱的是——
它支持4个不同的AI模型:OpenAI、Claude、Gemini,还有本地部署的Ollama。
你有钱用Claude,没钱用Ollama。 你追求画质用Gemini,追求速度用GPT-4o。 它全兼容。
前后对比:2D动画猫 vs 电影感夕阳——风格与质感的差距前后对比:2D动画猫 vs 电影感夕阳——风格与质感的差距
这不是什么花里胡哨的功能。 这是真正的自由。
H3-Promptor工作流:节点图+胶片,AI视觉化呈现H3-Promptor工作流:节点图+胶片,AI视觉化呈现
说真的,用AI做内容的人分两种:
一种人,永远在找更好的模型。 一种人,永远在打磨自己的方法论。
前者永远在追,永远在焦虑。
后者早就明白了: 模型是公共资源,方法才是你的壁垒。
prompt写得好的人,用10块钱的模型能吊打用100块模型的人。 prompt写得烂的人,用GPT-5也是浪费。
H3-Promptor解决的就是这个问题。 它不是让你的模型变强。 它让你的方法变强。
以前拍电影,需要一个团队:导演、摄影指导、灯光师……普通人根本玩不起。
后来有了AI,一个人就能做视频。
但"一个人做视频"有个巨大的门槛:你得懂镜头语言。普通人不懂这些。
H3-Promptor做的事,就是把这个门槛拆掉。
你不需要懂任何专业知识。 你只需要有审美。 你只需要知道"我喜欢这个感觉"。
剩下的,它帮你翻译成导演的话。
好了,情绪铺垫完了。
来说点实际的——怎么用。
真的超简单,就三步。
第一步:装上。
去GitHub搜 ComfyUI MiniMax H3-Promptor,把这个项目克隆到你的 ComfyUI 目录里的 custom_nodes 文件夹。
就这一句命令:
git clone https://github.com/1038lab/Comfyui-Minimax-H3-Promptor.git
然后 pip 装一下依赖:
pip install -r requirements.txt
完事。
第二步:配API Key。
第一次打开,它会自动生成一个 config.json 文件。

也可以自己复制一个示例json,重命名为 config.json 然后修改配置

你进去填上你的 API Key——支持 OpenAI、Claude、Gemini 三选一,你用哪个就填哪个。
嫌麻烦?也可以直接在节点界面上单独填,不用动配置文件。
第三步:开用。
拖入一张图,或者写一段文字描述,连上线,点运行。
它给你吐出专业导演级的prompt。
你拿着这个prompt去 MiniMax 的 H3 模型生成视频。

就这么简单。
但我要重点说一下它的两个最实用的功能——
功能一:图片分析。

你有4个图片槽位,可以同时丢4张图进去。
它不只是"看看"这张图——它会从不同维度分析:人物特征、光线风格、色调质感、画面构图……

你想让它只分析光线?只分析人物?只分析色调?
在 vision_prompts.json 文件里改一下就行。 加你自己的分析策略也行。 改完重启ComfyUI,菜单自动更新。
这就是你的私人摄影指导。
功能二:时长控制。
你想做4秒的短镜头,它给你写一套结构。 你想做15秒的短片,它给你写另一套结构。
它会根据你设定的时长,自动调整镜头数量和节奏分配。
比如4秒:
特写脸部 → 拉远到全身 → 转身离开
比如15秒:
定场 → 特写 → 全景 → 特写 → 全景 → 转身离开
长度不同,镜头语言完全不同。 它帮你算好了。
所以,回到开头那个问题:
为什么你用AI做视频,总是不对?
不是因为模型差。 不是因为你笨。 是因为你少了一个翻译官。
把图片翻译成专业prompt的那个翻译官。
H3-Promptor,就是那个翻译官。
工具免费开源。 GitHub搜 ComfyUI MiniMax H3-Promptor。 上手难度:跟装一个插件差不多。
https://github.com/1038lab/ComfyUI-MiniMax-H3-Promptor
转给每一个,被AI视频折磨过的人。
