我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比
MiniMax H3 终于来了。
过去一年,AI 视频最大的变化是模型已经从“能不能生成”进入到了“能不能用”的阶段。
但当真正商业创作需求接入 AI 视频模型后,会发现新的问题又出来了,强的模型更偏向了真人影视作品和短剧创作,而偏向商业场景的模型又不够强,MiniMax H3 的出现,正式解决了这个问题。
其实前段时间 WAIC 大会上,我就看到了 MiniMax H3 的预热亮相。
当时 MiniMax 提到 MiniMax H3 将不再以单独的图片或视频或声音生成、编辑为任务,它会是一个从 “特化任务模型” 迈向 “通用多模态智能” 的新范式代表。
什么意思呢,就是说 MiniMax H3 不再局限于某一种输入类型,无论是参考图、参考视频、文本、音频都可以自然解析,完成创作意图的统一理解,并实现更自然、连贯的内容表达。
换成大家最容易接受的表达,就是全能参考。
简单来说,以往 AI 视频模型更像是在“看一张图,然后猜作者想表达什么”。而 MiniMax H3 更像是在理解一个完整创作需求:人物是谁、场景是什么、动作应该如何发展、不同素材之间有什么关系。
Seedance 的护城河,被 MiniMax H3 拿下。
当然,这句话不是说某个模型全面超过另一个模型,而是在“多模态参考、商业化生成、成本控制”这个方向,MiniMax H3 给出了非常有竞争力的答案。
下面,我们通过 7个不同场景下的案例展示,以及 Seedance 做了2组对比,一起来看看 MiniMax H3 的实力究竟如何。

过去 AI 视频最大的矛盾就是:能力越强,价格越贵。
很多强大的模型效果的确很棒,但是当我们把价格纳入到整个商业体系里去看,会发现几十秒甚至几分钟的视频成本,很快就会占用大量的预算,再加上抽卡行为,更是无法忽略。
所以 AI 视频真正进入生产环节,需要的不只是 SOTA,而是“足够强 + 用得起”。
MiniMax H3 最让我关注的一点,就是它把商业生产最核心的成本问题解决了一部分。
以下价格来源即梦和海螺两个平台,MiniMax H3 2K 视频的每秒均价,连 Seedance 的一个零头都不到,但是能力已经赶上。
这还有啥可说的?便宜就是 AI 时代的硬道理。

一、商业级成品大片,游戏网页 UI
经过实测,我发现成品商业片和 UI 类视频是 MiniMax H3 的黄金领域,它可以非常自然的融合多个参考内容的信息,而且提示词理解的很透彻。
1.游戏 UI
第一个测试,我没有选择普通人物动画,而是直接挑战商业设计场景。
原因很简单:游戏 UI、网页设计、电商广告这些内容,看似只是视频,其实背后包含大量需要模型理解的信息。
一个按钮的位置、一个角色装备、一套视觉语言,如果模型理解错误,最终效果就会完全崩坏。
拿我最喜欢的游戏 UI 风格,我在海螺里生成了三张游戏截图作为视频参考图,选用全能参考。
角色与美术风格严格参考三张图片,保持同一人物、同一背包、同一服装与游戏世界观。整体为高饱和街头涂鸦风3D游戏画面,青蓝、亮黄、橙色与黑色为主色,UI带喷溅油墨、粗线条、贴纸与霓虹描边效果。视频时长约10秒,画面流畅,角色动作自然,所有UI文字清晰稳定,不出现真实游戏Logo或已有角色。
[0秒-3秒] 角色选择界面 @图片1
高角度镜头缓慢向前推进,青绿色短发角色站在圆形展示台中央,微微侧身,单手抓住背包肩带,面向镜头露出自信表情。左侧依次滑入角色选择头像列表,当前角色被黄色边框与喷溅特效高亮;右侧展开人物介绍面板,显示角色名称、定位、能力图标与简短属性条。镜头轻微向右环绕角色,展示人物服装、鞋子与背包细节,展示台下方出现旋转预览提示。
[3秒-6.5秒] 打开背包与装饰选择 @图片2
镜头顺势移动到角色侧前方,角色取下背包并在胸前展开。背包内部整齐排列徽章、挂件、贴纸、小罐子等装饰物,所有物品出现青蓝、紫色和橙黄色轮廓高亮。右侧UI切换为背包装饰选择栏,物品格依次亮起,当前选中的青色骷髅徽章带黄色选框。镜头缓慢推近背包内部,角色伸手点击并更换装饰,选中物品产生短暂发光、弹跳和墨水喷溅反馈。
[6.5秒-10秒] 取出饮料与气泡属性展示 @图片3
角色从背包侧袋中拿出一瓶蓝色发光饮料,并伸向镜头展示。镜头快速聚焦饮料,角色与背景轻微虚化。画面右侧切换为蓝色游戏信息面板,显示饮料名称、稀有度、持续时间、气泡增幅与泡沫护盾属性。瓶内不断上升细小气泡,周围出现蓝色扫描线、透明泡泡与柔和霓虹光晕。最后角色轻轻晃动饮料,瓶身爆发一圈蓝色气泡能量,UI中的“使用”按钮高亮,画面定格在角色、背包与饮料属性界面。
对于游戏 UI 来说,我最关心的就是文字是否变形,尤其是在 UI 在动态展示过程中。这个案例其实验证的是 MiniMax H3 对“结构化视觉信息”的理解能力。
成品来看效果还是很不错的,清晰度很高,而且 UI 界面完全没有变形。第二张图片转换成视频的时候,模拟了游戏中框选物品的过程,到角色手指点击物品拿蓝屏,也都非常丝滑。而 MiniMax H3 在这个场景里的表现,更接近一个真正理解游戏界面的设计助手。

2.网页 UI
如果说游戏 UI 测试的是静态视觉理解,那么网页 UI 测试的就是动态叙事能力。于是我又做了一个网页的 UI 视频。模仿的是cyclemon.com 网页风格,实现的是超跑商品动态展示过程和网页切换的丝滑表现。
网页本质上就是一个连续动画:滚动、切换、视差、交互反馈缺一不可。这也是为什么很多人过去会尝试用 AI 生成网页动态背景,但最终还是需要自己写代码控制。
整个场景跑下来,我是真的被 MiniMax H3 的丝滑呈现所折服。画面右侧有一个网页的动态轴,可以看到每一次切换背景主色调、网页 UI 展示内容的时候,右侧网页滚轴会变化,它是随着画面切换而动态展示的。
之前不是有一个很多的玩法么,就是让 AI 生成网页 UI 动态背景视频,然后整合到代码下去通过鼠标控制播放,现在我觉得直接使用 MiniMax H3 生成效果播放就可以了。
生成一段 15 秒以内的高端超跑品牌网页前端 UI 展示视频,整体采用大胆扁平插画、强对比配色、全屏滚动叙事和视差动画风格。
0—3 秒:画面从纯色背景开始,一辆流线型未来超跑从画面右侧高速滑入中央,车身以高级 3D 渲染结合扁平插画质感呈现。镜头快速推进,展示前灯、轮毂、进气口和碳纤维车身细节,页面左侧出现超大无衬线标题“BORN TO OUTRUN”,右侧显示简洁的纵向滚动导航。
3—7 秒:网页开始向下滚动,超跑主体固定在画面中央,背景色从明亮橙色切换为深蓝、荧光绿和黑色。每切换一个页面章节,车辆同步更换车漆、轮毂和尾翼造型,文字以错位滑入、数字放大、线条延伸的方式出现,展示“0–100 KM/H 2.7S”“V8 TWIN TURBO”“TOP SPEED 350 KM/H”。
7—11 秒:镜头跟随网页滚动产生明显视差,背景中的城市道路、霓虹灯带和赛道线条以不同速度移动,轮毂持续旋转,车身产生轻微悬浮和动态倾斜。鼠标指针划过车辆时,车身局部高亮,性能参数以半透明悬浮 UI 标签展开。
11—15 秒:页面快速滚动至最终首屏,背景切换为纯黑色,超跑正面居中停下,车灯瞬间点亮,地面出现流动光带。品牌 Logo 和标题“CHOOSE YOUR MACHINE”从下方缓慢升起,底部出现极简按钮“EXPLORE THE DRIVE”,最后镜头轻微拉远并定格。
整体要求:高端汽车广告质感,流畅网页滚动动画,强烈视觉节奏,极简但有冲击力的前端 UI,干净排版,圆角按钮,粗体英文字体,顺滑转场,真实光影反射,电影级运动模糊,16:9 横屏,4K,24fps,不出现真实汽车品牌 Logo,不出现复杂后台界面。
3.品质大片(含对比)
多人一致性一直是 AI 视频最难的问题之一。
单个人物还能靠参考图约束,但是五个人、五张脸、五套服装,同时保持真实动作和差异化表现,对模型理解能力要求非常高。
商业内容下,我又做了一个走秀 T 台片。这里主要是想观测一下 MiniMax H3 在高质感品质内容呈现上的效果。所以我的提示词非常简单,就是一句话,尽量是想让模型自己思考和创作方向,不被提示词束缚。
一个品牌的服装展示,请让参考图里所有的人物一起走梯台,实现一个时尚秀的表演,保持人物的样貌、真实感。
这里要说一下参考图,我生成的是五个差异性极大的模特图片,无论是风格、产品卖点、光线都有明显差异。在使用 MiniMax H3 生成视频时,最大的感受就是它对人脸的校验更自由一些,而且脸部更千变万化、更依循参考图,不会出现 Seedance 明明上传的是 A 脸,但是出片后被污染成 Seedance 模板库里 B 脸的情况。

在 T 台走秀的实际产出里,我注意到了五个美女在姿态、动作、神态、步伐上的不一致。这种不一致大家应该很清楚,以往的 AI 视频出来的效果,我们写了五个人,大部分时候这五个人是一起迈着六亲不认的步伐,一个模子里的动作,毫无差异。MiniMax H3 的产出里,就不一样了,人物有个自己的节奏和感觉。
其次是灯光效果,主光打在角色身上,背景T台以台下很明显的虚化和暗场。

我同样使用 Seedance 做了这个走秀视频,同样的提示词分毫不改。
但实际的出片效果,甚至可以用非常差来形容。
走秀过程,三个人物直接用了参考图上的背景来走,而不是在同一个舞台里。
最后 Pose 阶段,左边两个人物的衣服甚至都是错的,其次是脸型完全趋同,左二的心怡脸化成灰我都认得出来。

4.视觉创意手绘动画(含对比)
前面的案例更多是在验证“还原能力”,但是 AI 创作还有另外一个方向,创造力融合。也就是把现实世界和想象世界结合起来。
那么纯文本生成的效果如何呢?我决定给 MiniMax H3 上点难度,直接来个不同风格在同个视频内的展示效果。
风格我选择了非常火的彩色手绘创意,加上个人旅拍真人 Vlog,也就是现在非常流行的真人 Vlog + 手绘动画,典型的跨模态创作。
过去这种内容通常需要拍摄、后期、动画制作多个环节,现在模型开始尝试一次完成。
当然,最好的效果还是自己拍摄真实 Vlog ,然后作为输入侧参考视频丢进来,让模型直接根据视频内容添加手绘风格画面。
这个案例我也做了,但是放到后面,作为 MiniMax H3 修改视频精准度的案例分享。
15 秒、16:9 横版旅拍换场景视频。真人实拍vlog记录与发光手绘动画融合,一位年轻女孩@图片1背着旅行包、手持相机快速穿行于不同目的地,整体动作紧密连贯,严格跟随强节拍音乐卡点切换(生成一段卡点节奏感很强的音乐)。
开场女孩在机场落地窗前快步行走,远处手绘风格的飞机从地面向天空飞起穿入云朵,镜头跟随节奏拉近到云朵后完全遮挡;鼓点落下瞬间,云朵三开,场景无缝切换为海边椰林里。
女孩抬头看向椰树,镜头跟随女孩视角向上,椰树上一个手绘风格椰子掉了下来,砸到镜头里遮盖;镜头重新打开,女孩穿着滑雪服,从高处滑雪下来,身边手绘的女孩,真人比例,和女孩子一起滑雪冲下来,两人完成滑雪后,拥抱在一起,抱着转圈。
镜头以跟拍、甩镜、遮挡转场、动作匹配转场为主,节奏明快,可以有轻微真实手拍抖动,光影自然,真实旅行纪录片质感,不要商业广告感。
同样的,我用这个提示词继续跑了一个 Seedance 的视频。开头部分其实还好,人物的真实性 Seedance 优势也非常明显。
但缺点就更明显了,首先是真实的椰子下落过程中发生了变化,变成了栗子;接着是滑雪场当人物和手绘动画拥抱的时候,镜头一切,手绘人物变成了真实人物。
这种换镜头就换人物的问题,seedance 依旧没办法解决。
反观 MiniMax H3 ,在影片中就非常好的延续了主体不发生变化。

5.电商 TVC 广告片
商业广告其实是检验 AI 视频价值最直接的场景。因为广告不是单纯追求画面漂亮,而是要求产品不能变形、卖点必须突出、人物必须服务于商品。而 TVC 类内容,就是 AI 视频从“创作玩具”走向“生产工具”的关键一步。
说简单点,AI 视频模型有无价值,除了在做短剧、短视频等内容上,最重要的还在于能否在商业场景里直出。
我参考了一些耳机、TVC 广告内容,做了一个耳机的宣传片。
参考图片也很简单,两个模特的三视图,然后产品的三视图,这是电商 TVC 的一些基本素材,没有太多的要求。

提示词方面稍微复杂一点,我也放出来给大家作为参考。
这个提示词部分重点是根据商品性质来定义的,不过商品肯定有所区别。比如耳机重点展示的就是耳罩、机身外观、舒适度等几个特点场景。
那 MiniMax H3 在这里非常准确的执行了我的指令,从开场的耳机特效、缓慢旋转,以及两位模特分批入场后侧身特写,同框展示。到整体氛围的高级感、留白商业感、模特妆容的紧致感等等。
生成一支级时尚耳机广告,整体参考时尚品牌广告的分镜节奏、剪辑速度、白棚质感和冷峻高级氛围。
画面采用极简白棚场景,无缝纯白背景,整体强调强烈的高定广告感、干净、简约、先锋、国际一线时装大片质感。
主视觉围绕一款未来感高端耳机展开,可根据产品类型表现为头戴式耳机或高端无线耳机,重点突出耳机的高级工业设计、流畅轮廓、精致材质、金属细节、磨砂或镜面质感、结构层次和科技奢侈品气质。
开场先以耳机产品特写为主,运用悬浮展示、缓慢旋转、局部微距推进等镜头语言,依次展现耳罩/耳机腔体、头梁弧线、按键细节、金属转轴、充电接口、品牌工艺和材质反光,强化产品的设计感与高级感。
随后切入人物展示,画面中可出现两位全身模特,一位黑人女模特、一位欧美女模特,保持她们的服装高级感、身体姿态、白棚光影、时装秀场气质和整体冷峻态度。
两人佩戴耳机,以时尚大片式站姿、回头、侧脸特写、行走定格、双人同框构图等形式出镜,突出耳机与时尚造型的融合感。
镜头要重点表现耳机佩戴后的贴合轮廓、未来科技感、精致饰品属性与高端消费电子质感,同时通过人物神态传达沉浸、专注、自信、享受音乐的感觉。
整体视觉需强调高级留白、利落构图、冷白色主调、局部金属高光、清透反射、轻奢科技美学,成片风格接近国际时尚品牌广告,兼具科技产品展示与奢侈品时尚大片的双重质感。
二、多模态理解与精准修改
上一个部分,跑的主要都是 MiniMax H3 直出视频的效果。其实对 MiniMax H3 来说,真正给力的是它的视频编辑能力,因为实际生产中,绝大部分时间并不是从零开始生成,而是在已有素材基础上修改。换人物、换背景、改动作、调整风格,这些才是创作者每天真正面对的问题。
MiniMax H3 支持多种维护的视频编辑和修改能力,最常见的就是原视频动作参考、角色更换、台词更换、背景替换,而且在替换的同时,还可以保持高精度的指令理解。
6.动作参考
憨豆先生有个很有意思的片段,在寺庙和和尚对打,然后趁着和尚沉迷打拳的时候绕到大锣后面,给和尚来了一个暴击。

于是我参考这个视频片段,让 MiniMax H3 模仿动作片段,并且更换了片中的人物形象。
虽然最终成片里,和尚打完一套拳的镜头略有差异,毕竟原视频是近景过肩镜头,而新生成的视频是中景镜头,但是在剧情演绎上没有任何改变。
完整参考视频动作,用一只2D卡通漫画拟人猫代替和尚,2D卡通漫画拟人老鼠代替憨豆,不改变视频节奏、剧情。
给大家可以暂停看一下憨豆出现的这张截图。这里有我觉得 MiniMax H3 非常给力的几个证据。
首先是左手前部虚化,原片中憨豆左侧有一个虚化效果,这一点在改编的新视频中同样被呈现了出来,这种细节处的原视频理解和遵循,非常到位。
其次是场景的补充,我给的原视频里,锣是只有一点点的,但是新的视频里这个锣的棒槌被补全了。
最后是光影,整个片段背景依旧是真人风格,但是当我把人物更换为 2D 动画角色后,人物的光影效果依旧遵循了原始视频,比如老鼠双手下方的阴影、背部的虚化阴影等。

7..视频精准修改
文章的最后,我们来个哈基米吧!
我找了一个哈基米的海边晒太阳的视频,时间很短,只有 6s 左右。最后我们再来测试一下 MiniMax H3 的视频修改能力。
写在最后
测试完这 7 个案例,其实我最大的感受不是 AI 视频又新出了一个神,它叫 MiniMax H3,它有很强大的实力,而且支持视频内编辑,很适合商业大片。
我觉得真正重要的是,MiniMax H3 开始接近一个“视频创作助手”的形态。
如果说过去 AI 视频更像,我给一个提示词,它帮我生成一个片段。而 MiniMax H3 问世后,开始变成它理解我的创作目标,然后帮我完成整个视觉表达。
从参考图理解,到多人一致性;从网页 UI 动态,到商业广告;从动作迁移,到视频修改。MiniMax H3 展示出来的方向,是 AI 视频开始从随机生成进入可控生产。
当然,它并不是所有场景都已经完美,比如短剧场景、时长等等。
但更有价值的是,MiniMax H3 是可以本地部署的,这种强大实力的模型一旦被纳入本地部署之后,商业化程度会立马提升,并且价格越来越低。
当生成成本降低,多模态理解增强,AI 视频真正的大规模应用,也许才刚刚开始。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~


