MiniMax 用户必看!手把手教你用 openclaw 做电影

2026-04-09 17:32:50 11点赞 74收藏 4评论

就在刚刚,MiniMax 发布了其首个官方命令行工具 —— MMX CLI。

一个专门为 AI Agent 打造,可以在任意 Agent 或终端中生成文字、图像、视频、音乐、语音的工具。

建议某看看,什么叫 Token Plan?这才叫 Token Plan。

  • 文本对话
    — 多轮对话、流式输出、系统提示词、JSON 格式输出

  • 图像生成
    — 文生图,支持比例和批量控制

  • 视频生成
    — 异步生成,进度追踪

  • 语音合成
    — 30+ 音色、语速调节、流式播放

  • 音乐生成
    — 文生音乐,支持自定义歌词

  • 图像理解
    — 图片描述与识别

  • 网络搜索
    — MiniMax 搜索引擎

  • 双区域
    — 国际版(
    api.minimax.io)和国内版(api.minimaxi.com)自动切换

MiniMax 用户必看!手把手教你用 openclaw 做电影

恰好这几天我一直在研究如何最大化利用 MiniMax 内的音频、视频、图片用量。

说实话,Max 套餐,每天 120 张 Image-01 生图,4 个海螺 2.3音频,以及 4 首 Muisc-2.5 的用量,不用真的很浪费。

虽然模型目前不是业内顶尖的,但是放在 25 年底的那一档里还是可以打的。

MiniMax 用户必看!手把手教你用 openclaw 做电影

我花了 20 分钟,全程和 Openclaw 聊天,从剧情创意、到分镜、到参考图、到音乐背景、到成片。

题材是鬼片,至于为什么这样做,后面有介绍。

先看成品,一个纯理科生,没有任何影视经验,靠着自己的理解完成。

如果看完你有触动,感觉想试试,那么再往下看,我把自己的经验,全盘托出。


一、如何使用?

首先把 CLI 工具的地址发给 openclaw,让它进行安装。

https://github.com/MiniMax-AI/cli

聪明的 agent ,装好以后会做几个测试的内容,确保服务本身是通的。

MiniMax 用户必看!手把手教你用 openclaw 做电影

🔻MMX quota show 查询套餐余量

MiniMax 用户必看!手把手教你用 openclaw 做电影

TTS、音乐、Text 就不说了。

主要来说说,我对图片,视频模型的理解。

根据套餐内容,MiniMax Token Plan 可以使用的模型有以下特点。

1. image-01(图片)

文生图:prompt → 图片

图生图:subject_reference锁定角色一致性

批量生成:n=1~9,一次最多9张

自定义尺寸:width/height 512-2048px(必须是8的倍数)

返回格式:URL(24小时有效)或base64

2.MiniMax-Hailuo-2.3 / 2.3-Fast(视频)

不支持首尾帧、不支持主体参考!

图生视频:必须传first_frame_image(公网URL或base64)

格式:JPG, JPEG, PNG, WebP

体积:小于 20MB

文生视频:仅 Hailuo-2.3 支持

运镜指令:免费支持15种[指令]语法,每组不超过 3 个复合运镜。

时长:仅6秒

分辨率:仅768P


二、实战篇

纯干货,利用最合适的方法,把这些模型用量串起来。

Step 1:脚本规划

MiniMax Max 套餐每天 4 个视频是上限。

所以的工作都是围绕 4 个视频额度来做的。

所以我们必须和 AI 讨论,先设定明确的场景、分镜、提示词。

每一个分镜、运镜,至少保证 3、4 个可选项以上,用 LLMs 抽卡来弥补质量缺陷。

1️⃣ 分镜

剧本就不说了,直接让 AI 现编内容,自己升华。

重点是分镜。

建议把人物描述、场景描述、灯光分为全部纳入,包括一些硬编码的尺寸。

MiniMax 用户必看!手把手教你用 openclaw 做电影

2️⃣ 运镜脚本

运镜脚本很关键,hailuo-2.3 支持 6s 的视频,这 6s 可以做很多的镜头切换。

运镜脚本是画面感最重要的部分。根据前面提到的最多 3 个镜头组合的方式,把分镜细化到运镜级别的提示词。

最好再加上 [1s-2s] 这样的人工强制分镜切片。

MiniMax 用户必看!手把手教你用 openclaw 做电影

Step 2:角色与场景

图片的量最大,120 张每天,每组 4 张的话,我们可以做 30 组分镜场景。

先抽卡一批,[文生图],筛选剧情角色。

这里不建议用 CLI,建议直接走 API ,一次性生成 5 张以上的。

MiniMax 用户必看!手把手教你用 openclaw 做电影

设定 ref 角色为参考图,使用 [图生图] ,根据分镜提示词把视频的首帧做出来。

平均一个视频镜头,可以有 7 组的选择余地。

MiniMax 用户必看!手把手教你用 openclaw 做电影

# 步骤1:生成角色参考图(9张选1) image-01: n=9, prompt="疲惫女子,深蓝oversized西装,白色圆领..." # 步骤2:用角色参考生成4个场景(shot5/7/8/9) for shot in ["shot5", "shot7", "shot8", "shot9"]: image-01 I2I: subject_reference=[character_ref], n=4, # 每张场景4张选最优 aspect_ratio="16:9"

场景的话,选择文生图提示词。

同样是抽卡,让 AI Agent 结合剧本分镜自己写提示词做。

MiniMax 用户必看!手把手教你用 openclaw 做电影

Step 3:视频生成

视频提示词。

我的建议是能用首帧 [图生视频] 的,就不要做 文生视频。

它是场景一致性的延续。

比如简单的文生视频,提示词写得再好,也没办法确保一致性。

一个余量就浪费掉了。

🔻文生视频无法保证一致性

MiniMax 用户必看!手把手教你用 openclaw 做电影

大家不要认为首帧参考图就会固定画面。

通过运镜、提示词变化,同一个视频里的场景完全是可以做到转移的。

前 2 秒的首帧视频,只是场景内变化。

MiniMax 用户必看!手把手教你用 openclaw 做电影

3s 以后的场景,可以在同一个视频内的逻辑范围下,转换角度、变焦、画面。

相当于把一个视频拆开来用。

MiniMax 用户必看!手把手教你用 openclaw 做电影

这里再提 2 个视频生成的小技巧。

1️⃣ 6s 内多场景。

一个视频只有 6s 没错,但是很多分镜场景我们不需要用到 6s 。

所以一个 图生视频 = 首帧参考图 + 文生视频。

充分利用 6s 内的镜头变化,用来拆分出更多的短时间镜头,通过后期的镜头语言、剪辑软件进行拆分,用量就上来了。

2️⃣ 首尾帧一致性

安装 ffmpeg 插件。

通过脚本,我们对视频的最后一帧进行提取。

for clip, shot in [("clip5", "shot5"), ("clip7", "shot7")]: url = upload_catbox(f"{shot}.png") # Hailuo生成6秒视频 hailuo_2.3_fast: first_frame_image=url, prompt=f"{scene_desc} [运镜指令]", duration=6, resolution="768P" # 提取尾帧供下一条使用 extract_lastframe(f"{clip}.mp4", f"{clip}_lastframe.png")

这一帧的画面,我们继续作为下一个视频的首帧。

这样画面就连贯的。

但是这里要注意的是,跨视频不能做人物分镜。

因为第二个视频已经没有第一个视频里的人物参考图了。

这个时候镜头里的人物相当于是文生图。

上个视频还是女主角,下个视频人物一回头已经是一个男人。

所以 ffmpeg 的画面延续只能用在 上一个画面尾帧有人物正脸,或者纯场景的。

MiniMax 用户必看!手把手教你用 openclaw 做电影

Step 4:音频与合成

hailuo 2.3 全系列出来的视频都是默片。

没有声音。

我们需要为视频片段创建合理的背景音、语音。

音乐支持纯音乐、歌词音乐。

想要氛围感强一点的,可以将歌词替换为呢喃声,轻声低语的,比纯音乐效果更好。

MiniMax 用户必看!手把手教你用 openclaw 做电影

# 生成呢喃BGM(分段拼接) for i in range(4): # 4段6秒=24秒 tts_async: text="嗯~嗯嗯~啦啦~啊~", voice_id="Chinese_Sweet_Lady" # ffmpeg最终合成 ffmpeg_concat_video(clips=["clip5.mp4", "clip7.mp4", "clip8.mp4", "clip9.mp4"]) ffmpeg_add_bgm(video="concat.mp4", audio="humming.mp3")

人物出声的话,多听听内置的音色,选择合适的,通过语速、语调、音量,来分段控制,合并。

最后,所有的视频、音乐、语音 TTS。

通过 FFMPEG 进行合并。

小技巧就是,可以留适当的空帧,用空镜头来增加氛围感和节奏感。

MiniMax 用户必看!手把手教你用 openclaw 做电影

三、资源最大化策略

策略1:图片批量抽卡

# 最优:单次n=9

payload = {

"model": "image-01",

"prompt": "疲惫女子,深蓝西装...",

"n": 9, # 一次9张选最优

"aspect_ratio": "16:9"

}

# 120张额度 = 13次API调用(9×13=117张,余3张)

策略2:角色一致性锁

# 用subject_reference锁定角色

payload = {

"model": "image-01",

"prompt": "同一个人在地铁站...",

"subject_reference": [{

"type": "character",

"image_file": "图片"

}],

"n": 4

}

策略3:视频运镜优化

# 15种指令免费可用

payload = {

"model": "MiniMax-Hailuo-2.3",

"first_frame_image": "图片",

"prompt": "女子走进车厢 [推进,变焦推进], 然后看向窗外 [左摇,上升], 镜头[固定]",

"duration": 6,

"resolution": "768P"

}

15种运镜指令:

  • • 移动:[左移] [右移] [推进] [拉远] [上升] [下降]

  • • 摇镜:[左摇] [右摇] [上摇] [下摇]

  • • 变焦:[变焦推近] [变焦拉远]

  • • 其他:[晃动] [跟随] [固定]

策略4:视频尾帧接续

image-01生成首帧图 → Hailuo 2.3生成视频

FFMPEG 提取尾帧 → 作为下一条首帧

MiniMax 用户必看!手把手教你用 openclaw 做电影

最后

最后,讲三个,在我看来是现在做 AI 视频很关键的部分,可以弥补模型的缺陷。

镜头语言,AI 特色,空镜。

其一,镜头语言

前端时间很火的 《纸手机》,给我最大的启发,就是镜头语言。

短篇里,很少有多个人物出现在同一个场景下的画面。

大部分都是近景、人物特色、视线外放。

没错,人物的视线是往外的,看向镜头之外,观众会自动脑部空间,减少 AI 的出错,增加镜头的语言,补充观众的想象,一举三得。

通过对视线、想象、声音、空镜的组合,感官上就会自动推动剧情发展,这是比单独一个画面来演绎更高级、更自然的方式。

其二, AI 特色。

天然适合鬼片。

鬼片就是抽象的,不讲逻辑,存在画面故障的。

我刚才放的片子里,闹钟场景其实就是 AI 的一个废片,但是放到鬼片里,却增加了氛围感。

还有抽象的人物镜头行动方式,夸张的表情,浮夸的动作。

这些在正常片子里一眼假的内容,在鬼片里,是不是就符合逻辑了!

天才!出院!

其三,空镜头。

空镜头,可以理解为黑屏或者纯场景画面。

它对人物一致性的要求很低。

适当的空镜转场,可以调动视频的节奏,增加影片的艺术感。

没有了人物,一个纯场景的视频,它的废片率就大大降低了。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
4评论

  • 精彩
  • 最新
  • Max套餐每天4个视频额度这么用确实聪明!但海螺2.3默片+需手动配BGM,家里娃剪视频时能直接调用TTS吗?

    校验提示文案

    提交
  • 我能当导演啦 [惊喜] ,把摸鱼时候的怪奇想法统统用视觉呈现

    校验提示文案

    提交
    还能做游戏,未来是创意和思路价值远高于技能的时代,很幸运活在了这个时代 [高兴] [高兴] [高兴]

    校验提示文案

    提交
    收起所有回复
  • 喜欢,买了

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
74
扫一下,分享更方便,购买更轻松