我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

2026-08-01 23:47:25 0点赞 0收藏 0评论

MiniMax H3 终于来了。

过去一年,AI 视频最大的变化是模型已经从“能不能生成”进入到了“能不能用”的阶段。

但当真正商业创作需求接入 AI 视频模型后,会发现新的问题又出来了,强的模型更偏向了真人影视作品和短剧创作,而偏向商业场景的模型又不够强,MiniMax H3 的出现,正式解决了这个问题。

其实前段时间 WAIC 大会上,我就看到了 MiniMax H3 的预热亮相。

当时 MiniMax 提到 MiniMax H3 将不再以单独的图片或视频或声音生成、编辑为任务,它会是一个从 “特化任务模型” 迈向 “通用多模态智能” 的新范式代表。

什么意思呢,就是说 MiniMax H3 不再局限于某一种输入类型,无论是参考图、参考视频、文本、音频都可以自然解析,完成创作意图的统一理解,并实现更自然、连贯的内容表达。

换成大家最容易接受的表达,就是全能参考

简单来说,以往 AI 视频模型更像是在“看一张图,然后猜作者想表达什么”。而 MiniMax H3 更像是在理解一个完整创作需求:人物是谁、场景是什么、动作应该如何发展、不同素材之间有什么关系。

Seedance 的护城河,被 MiniMax H3 拿下。

当然,这句话不是说某个模型全面超过另一个模型,而是在“多模态参考、商业化生成、成本控制”这个方向,MiniMax H3 给出了非常有竞争力的答案。

下面,我们通过 7个不同场景下的案例展示,以及 Seedance 做了2组对比,一起来看看 MiniMax H3 的实力究竟如何。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

过去 AI 视频最大的矛盾就是:能力越强,价格越贵。

很多强大的模型效果的确很棒,但是当我们把价格纳入到整个商业体系里去看,会发现几十秒甚至几分钟的视频成本,很快就会占用大量的预算,再加上抽卡行为,更是无法忽略。

所以 AI 视频真正进入生产环节,需要的不只是 SOTA,而是“足够强 + 用得起”。

MiniMax H3 最让我关注的一点,就是它把商业生产最核心的成本问题解决了一部分。

以下价格来源即梦和海螺两个平台,MiniMax H3 2K 视频的每秒均价,连 Seedance 的一个零头都不到,但是能力已经赶上。

这还有啥可说的?便宜就是 AI 时代的硬道理。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

一、商业级成品大片,游戏网页 UI

经过实测,我发现成品商业片和 UI 类视频是 MiniMax H3 的黄金领域,它可以非常自然的融合多个参考内容的信息,而且提示词理解的很透彻。

1.游戏 UI

第一个测试,我没有选择普通人物动画,而是直接挑战商业设计场景。

原因很简单:游戏 UI、网页设计、电商广告这些内容,看似只是视频,其实背后包含大量需要模型理解的信息。

一个按钮的位置、一个角色装备、一套视觉语言,如果模型理解错误,最终效果就会完全崩坏。

拿我最喜欢的游戏 UI 风格,我在海螺里生成了三张游戏截图作为视频参考图,选用全能参考。

角色与美术风格严格参考三张图片,保持同一人物、同一背包、同一服装与游戏世界观。整体为高饱和街头涂鸦风3D游戏画面,青蓝、亮黄、橙色与黑色为主色,UI带喷溅油墨、粗线条、贴纸与霓虹描边效果。视频时长约10秒,画面流畅,角色动作自然,所有UI文字清晰稳定,不出现真实游戏Logo或已有角色。 [0秒-3秒] 角色选择界面 @图片1 高角度镜头缓慢向前推进,青绿色短发角色站在圆形展示台中央,微微侧身,单手抓住背包肩带,面向镜头露出自信表情。左侧依次滑入角色选择头像列表,当前角色被黄色边框与喷溅特效高亮;右侧展开人物介绍面板,显示角色名称、定位、能力图标与简短属性条。镜头轻微向右环绕角色,展示人物服装、鞋子与背包细节,展示台下方出现旋转预览提示。 [3秒-6.5秒] 打开背包与装饰选择 @图片2 镜头顺势移动到角色侧前方,角色取下背包并在胸前展开。背包内部整齐排列徽章、挂件、贴纸、小罐子等装饰物,所有物品出现青蓝、紫色和橙黄色轮廓高亮。右侧UI切换为背包装饰选择栏,物品格依次亮起,当前选中的青色骷髅徽章带黄色选框。镜头缓慢推近背包内部,角色伸手点击并更换装饰,选中物品产生短暂发光、弹跳和墨水喷溅反馈。 [6.5秒-10秒] 取出饮料与气泡属性展示 @图片3 角色从背包侧袋中拿出一瓶蓝色发光饮料,并伸向镜头展示。镜头快速聚焦饮料,角色与背景轻微虚化。画面右侧切换为蓝色游戏信息面板,显示饮料名称、稀有度、持续时间、气泡增幅与泡沫护盾属性。瓶内不断上升细小气泡,周围出现蓝色扫描线、透明泡泡与柔和霓虹光晕。最后角色轻轻晃动饮料,瓶身爆发一圈蓝色气泡能量,UI中的“使用”按钮高亮,画面定格在角色、背包与饮料属性界面。

对于游戏 UI 来说,我最关心的就是文字是否变形,尤其是在 UI 在动态展示过程中。这个案例其实验证的是 MiniMax H3 对“结构化视觉信息”的理解能力。

成品来看效果还是很不错的,清晰度很高,而且 UI 界面完全没有变形。第二张图片转换成视频的时候,模拟了游戏中框选物品的过程,到角色手指点击物品拿蓝屏,也都非常丝滑。而 MiniMax H3 在这个场景里的表现,更接近一个真正理解游戏界面的设计助手。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

2.网页 UI

如果说游戏 UI 测试的是静态视觉理解,那么网页 UI 测试的就是动态叙事能力。于是我又做了一个网页的 UI 视频。模仿的是cyclemon.com 网页风格,实现的是超跑商品动态展示过程和网页切换的丝滑表现。

网页本质上就是一个连续动画:滚动、切换、视差、交互反馈缺一不可。这也是为什么很多人过去会尝试用 AI 生成网页动态背景,但最终还是需要自己写代码控制。

整个场景跑下来,我是真的被 MiniMax H3 的丝滑呈现所折服。画面右侧有一个网页的动态轴,可以看到每一次切换背景主色调、网页 UI 展示内容的时候,右侧网页滚轴会变化,它是随着画面切换而动态展示的。

之前不是有一个很多的玩法么,就是让 AI 生成网页 UI 动态背景视频,然后整合到代码下去通过鼠标控制播放,现在我觉得直接使用 MiniMax H3 生成效果播放就可以了。

生成一段 15 秒以内的高端超跑品牌网页前端 UI 展示视频,整体采用大胆扁平插画、强对比配色、全屏滚动叙事和视差动画风格。 0—3 秒:画面从纯色背景开始,一辆流线型未来超跑从画面右侧高速滑入中央,车身以高级 3D 渲染结合扁平插画质感呈现。镜头快速推进,展示前灯、轮毂、进气口和碳纤维车身细节,页面左侧出现超大无衬线标题“BORN TO OUTRUN”,右侧显示简洁的纵向滚动导航。 3—7 秒:网页开始向下滚动,超跑主体固定在画面中央,背景色从明亮橙色切换为深蓝、荧光绿和黑色。每切换一个页面章节,车辆同步更换车漆、轮毂和尾翼造型,文字以错位滑入、数字放大、线条延伸的方式出现,展示“0–100 KM/H 2.7S”“V8 TWIN TURBO”“TOP SPEED 350 KM/H”。 7—11 秒:镜头跟随网页滚动产生明显视差,背景中的城市道路、霓虹灯带和赛道线条以不同速度移动,轮毂持续旋转,车身产生轻微悬浮和动态倾斜。鼠标指针划过车辆时,车身局部高亮,性能参数以半透明悬浮 UI 标签展开。 11—15 秒:页面快速滚动至最终首屏,背景切换为纯黑色,超跑正面居中停下,车灯瞬间点亮,地面出现流动光带。品牌 Logo 和标题“CHOOSE YOUR MACHINE”从下方缓慢升起,底部出现极简按钮“EXPLORE THE DRIVE”,最后镜头轻微拉远并定格。 整体要求:高端汽车广告质感,流畅网页滚动动画,强烈视觉节奏,极简但有冲击力的前端 UI,干净排版,圆角按钮,粗体英文字体,顺滑转场,真实光影反射,电影级运动模糊,16:9 横屏,4K,24fps,不出现真实汽车品牌 Logo,不出现复杂后台界面。我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

3.品质大片(含对比)

多人一致性一直是 AI 视频最难的问题之一。

单个人物还能靠参考图约束,但是五个人、五张脸、五套服装,同时保持真实动作和差异化表现,对模型理解能力要求非常高。

商业内容下,我又做了一个走秀 T 台片。这里主要是想观测一下 MiniMax H3 在高质感品质内容呈现上的效果。所以我的提示词非常简单,就是一句话,尽量是想让模型自己思考和创作方向,不被提示词束缚。

一个品牌的服装展示,请让参考图里所有的人物一起走梯台,实现一个时尚秀的表演,保持人物的样貌、真实感。

这里要说一下参考图,我生成的是五个差异性极大的模特图片,无论是风格、产品卖点、光线都有明显差异。在使用 MiniMax H3 生成视频时,最大的感受就是它对人脸的校验更自由一些,而且脸部更千变万化、更依循参考图,不会出现 Seedance 明明上传的是 A 脸,但是出片后被污染成 Seedance 模板库里 B 脸的情况。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

在 T 台走秀的实际产出里,我注意到了五个美女在姿态、动作、神态、步伐上的不一致。这种不一致大家应该很清楚,以往的 AI 视频出来的效果,我们写了五个人,大部分时候这五个人是一起迈着六亲不认的步伐,一个模子里的动作,毫无差异。MiniMax H3 的产出里,就不一样了,人物有个自己的节奏和感觉。

其次是灯光效果,主光打在角色身上,背景T台以台下很明显的虚化和暗场。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

我同样使用 Seedance 做了这个走秀视频,同样的提示词分毫不改。

但实际的出片效果,甚至可以用非常差来形容。

走秀过程,三个人物直接用了参考图上的背景来走,而不是在同一个舞台里。

最后 Pose 阶段,左边两个人物的衣服甚至都是错的,其次是脸型完全趋同,左二的心怡脸化成灰我都认得出来。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

4.视觉创意手绘动画(含对比)

前面的案例更多是在验证“还原能力”,但是 AI 创作还有另外一个方向,创造力融合。也就是把现实世界和想象世界结合起来。

那么纯文本生成的效果如何呢?我决定给 MiniMax H3 上点难度,直接来个不同风格在同个视频内的展示效果。

风格我选择了非常火的彩色手绘创意,加上个人旅拍真人 Vlog,也就是现在非常流行的真人 Vlog + 手绘动画,典型的跨模态创作。

过去这种内容通常需要拍摄、后期、动画制作多个环节,现在模型开始尝试一次完成。

当然,最好的效果还是自己拍摄真实 Vlog ,然后作为输入侧参考视频丢进来,让模型直接根据视频内容添加手绘风格画面。

这个案例我也做了,但是放到后面,作为 MiniMax H3 修改视频精准度的案例分享。

15 秒、16:9 横版旅拍换场景视频。真人实拍vlog记录与发光手绘动画融合,一位年轻女孩@图片1背着旅行包、手持相机快速穿行于不同目的地,整体动作紧密连贯,严格跟随强节拍音乐卡点切换(生成一段卡点节奏感很强的音乐)。 开场女孩在机场落地窗前快步行走,远处手绘风格的飞机从地面向天空飞起穿入云朵,镜头跟随节奏拉近到云朵后完全遮挡;鼓点落下瞬间,云朵三开,场景无缝切换为海边椰林里。 女孩抬头看向椰树,镜头跟随女孩视角向上,椰树上一个手绘风格椰子掉了下来,砸到镜头里遮盖;镜头重新打开,女孩穿着滑雪服,从高处滑雪下来,身边手绘的女孩,真人比例,和女孩子一起滑雪冲下来,两人完成滑雪后,拥抱在一起,抱着转圈。 镜头以跟拍、甩镜、遮挡转场、动作匹配转场为主,节奏明快,可以有轻微真实手拍抖动,光影自然,真实旅行纪录片质感,不要商业广告感。我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

同样的,我用这个提示词继续跑了一个 Seedance 的视频。开头部分其实还好,人物的真实性 Seedance 优势也非常明显。

但缺点就更明显了,首先是真实的椰子下落过程中发生了变化,变成了栗子;接着是滑雪场当人物和手绘动画拥抱的时候,镜头一切,手绘人物变成了真实人物。

这种换镜头就换人物的问题,seedance 依旧没办法解决。

反观 MiniMax H3 ,在影片中就非常好的延续了主体不发生变化。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

5.电商 TVC 广告片

商业广告其实是检验 AI 视频价值最直接的场景。因为广告不是单纯追求画面漂亮,而是要求产品不能变形、卖点必须突出、人物必须服务于商品。而 TVC 类内容,就是 AI 视频从“创作玩具”走向“生产工具”的关键一步。

说简单点,AI 视频模型有无价值,除了在做短剧、短视频等内容上,最重要的还在于能否在商业场景里直出。

我参考了一些耳机、TVC 广告内容,做了一个耳机的宣传片。

参考图片也很简单,两个模特的三视图,然后产品的三视图,这是电商 TVC 的一些基本素材,没有太多的要求。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

提示词方面稍微复杂一点,我也放出来给大家作为参考。

这个提示词部分重点是根据商品性质来定义的,不过商品肯定有所区别。比如耳机重点展示的就是耳罩、机身外观、舒适度等几个特点场景。

那 MiniMax H3 在这里非常准确的执行了我的指令,从开场的耳机特效、缓慢旋转,以及两位模特分批入场后侧身特写,同框展示。到整体氛围的高级感、留白商业感、模特妆容的紧致感等等。

生成一支级时尚耳机广告,整体参考时尚品牌广告的分镜节奏、剪辑速度、白棚质感和冷峻高级氛围。 画面采用极简白棚场景,无缝纯白背景,整体强调强烈的高定广告感、干净、简约、先锋、国际一线时装大片质感。 主视觉围绕一款未来感高端耳机展开,可根据产品类型表现为头戴式耳机或高端无线耳机,重点突出耳机的高级工业设计、流畅轮廓、精致材质、金属细节、磨砂或镜面质感、结构层次和科技奢侈品气质。 开场先以耳机产品特写为主,运用悬浮展示、缓慢旋转、局部微距推进等镜头语言,依次展现耳罩/耳机腔体、头梁弧线、按键细节、金属转轴、充电接口、品牌工艺和材质反光,强化产品的设计感与高级感。 随后切入人物展示,画面中可出现两位全身模特,一位黑人女模特、一位欧美女模特,保持她们的服装高级感、身体姿态、白棚光影、时装秀场气质和整体冷峻态度。 两人佩戴耳机,以时尚大片式站姿、回头、侧脸特写、行走定格、双人同框构图等形式出镜,突出耳机与时尚造型的融合感。 镜头要重点表现耳机佩戴后的贴合轮廓、未来科技感、精致饰品属性与高端消费电子质感,同时通过人物神态传达沉浸、专注、自信、享受音乐的感觉。 整体视觉需强调高级留白、利落构图、冷白色主调、局部金属高光、清透反射、轻奢科技美学,成片风格接近国际时尚品牌广告,兼具科技产品展示与奢侈品时尚大片的双重质感。我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比


二、多模态理解与精准修改

上一个部分,跑的主要都是 MiniMax H3 直出视频的效果。其实对 MiniMax H3 来说,真正给力的是它的视频编辑能力,因为实际生产中,绝大部分时间并不是从零开始生成,而是在已有素材基础上修改。换人物、换背景、改动作、调整风格,这些才是创作者每天真正面对的问题。

MiniMax H3 支持多种维护的视频编辑和修改能力,最常见的就是原视频动作参考、角色更换、台词更换、背景替换,而且在替换的同时,还可以保持高精度的指令理解。

6.动作参考

憨豆先生有个很有意思的片段,在寺庙和和尚对打,然后趁着和尚沉迷打拳的时候绕到大锣后面,给和尚来了一个暴击。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

于是我参考这个视频片段,让 MiniMax H3 模仿动作片段,并且更换了片中的人物形象。

虽然最终成片里,和尚打完一套拳的镜头略有差异,毕竟原视频是近景过肩镜头,而新生成的视频是中景镜头,但是在剧情演绎上没有任何改变。

完整参考视频动作,用一只2D卡通漫画拟人猫代替和尚,2D卡通漫画拟人老鼠代替憨豆,不改变视频节奏、剧情。我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

给大家可以暂停看一下憨豆出现的这张截图。这里有我觉得 MiniMax H3 非常给力的几个证据。

首先是左手前部虚化,原片中憨豆左侧有一个虚化效果,这一点在改编的新视频中同样被呈现了出来,这种细节处的原视频理解和遵循,非常到位。

其次是场景的补充,我给的原视频里,锣是只有一点点的,但是新的视频里这个锣的棒槌被补全了。

最后是光影,整个片段背景依旧是真人风格,但是当我把人物更换为 2D 动画角色后,人物的光影效果依旧遵循了原始视频,比如老鼠双手下方的阴影、背部的虚化阴影等。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

7..视频精准修改

文章的最后,我们来个哈基米吧!

我找了一个哈基米的海边晒太阳的视频,时间很短,只有 6s 左右。最后我们再来测试一下 MiniMax H3 的视频修改能力。

把视频里的猫的眼睛换成蓝色。背后的大海换成草原。我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

写在最后

测试完这 7 个案例,其实我最大的感受不是 AI 视频又新出了一个神,它叫 MiniMax H3,它有很强大的实力,而且支持视频内编辑,很适合商业大片。

我觉得真正重要的是,MiniMax H3 开始接近一个“视频创作助手”的形态。

如果说过去 AI 视频更像,我给一个提示词,它帮我生成一个片段。而 MiniMax H3 问世后,开始变成它理解我的创作目标,然后帮我完成整个视觉表达。

从参考图理解,到多人一致性;从网页 UI 动态,到商业广告;从动作迁移,到视频修改。MiniMax H3 展示出来的方向,是 AI 视频开始从随机生成进入可控生产。

当然,它并不是所有场景都已经完美,比如短剧场景、时长等等。

但更有价值的是,MiniMax H3 是可以本地部署的,这种强大实力的模型一旦被纳入本地部署之后,商业化程度会立马提升,并且价格越来越低。

当生成成本降低,多模态理解增强,AI 视频真正的大规模应用,也许才刚刚开始。

我把 MiniMax H3 榨干了,7 个深度玩法,2组 Seedance 对比

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松