参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

源自367位全网作者

08:14

9月20日的抖音创作者大会上,剪映发布了叫"剪映Hub"的一站式创作工作台,剪映、即梦、小云雀的产品链路被打通。过去一年,AI视频创作平台的国内市场规模冲到62.8亿元,同比增长127%,光抖音平台上上半年新增的AI微短剧就有22.19万部。工具层的混战看似到了新阶段,但如果你常泡AI漫剧、AI短剧创作者的评论区,会发现9月被问得最勤的根本不是"用哪个工具",而是五个字:36氪

“怎么又崩了。”

镜头一切,脸换了;一张口,开始演了;时长一拉长,后半段谁都认不出来。知乎上一个高赞判断说得很直白:2024、2025年大家讨论的是"能不能生成",现在创作者关心的是"能不能稳定地做完整项目"。知乎

这篇只回答一件事:对正在做连载漫剧、短剧、商单的创作者,9月这四种"崩",哪几种模型的更新真的吃掉了,哪几种只吃掉一半,哪几种还得用你的人工和时间买单。

一、9月社区在骂什么:崩点已经从"画质"挪到"跨镜头成立"

把小红书、知乎、B站近一个月的吐槽和实测摆在一起,崩法收敛成四类,每一类都有观众能一眼看穿的现场。

第一种:换脸崩——单帧是你,下一帧就不是你。

小红书上做AI漫剧教学的说法很代表性:"镜头一切角色就变脸,还经常出现半脸残缺,画面晃来晃去很违和,观众一眼看出廉价感。“知乎上FansAI把标准说得更狠:角色一致性不是"长得像”,而是跨镜头成立——一张静态图准确,不等于动起来还准确,角色转头、奔跑、遮挡、换光线,才是真正的考场。B站九月底最热的实测视频,测的就是Seedance 2.5在同一段30秒短片里,“角色能否保持同一张脸、同一件夹克和同一把声音”。小红书知乎哔哩哔哩

值得警惕的是"单帧幸存者偏差"。知乎答主"知夏"做完一段约20秒的三套换装短片后自己备注:这个结果只能说明这组镜头里人物还能被认成同一个人,换到侧脸、远景和大动作后稳不稳,还得另外测。一句话很值得贴在显示器上:最好看的那一帧,不能替整段视频交作业。知乎

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

第二种:表演崩——一开口就用力过猛,动作没有重量。小红书

知乎9月中旬一个问题拿了上百收藏:为什么AI视频里的人说话时嘴部动作幅度特别大,看着很别扭?评论区一堆同款体感:"下半张脸奇奇怪怪,讲话的时候嘴巴用力过猛,好怕他们抽筋。"有人从语料层面给了解释:训练数据里大量是"字面化演出"的动画——表情等价于心情,高兴就要手舞足蹈,含蓄的表演反而在语料里占比少,模型学出来的就是"情绪做了点乘"的脸。小红书知乎

小红书上做AI导演的博主9月21日说得更直接:写满提示词,AI动画依旧崩成表情包——AI会补帧,但不懂动作重心、节奏重量。

第三种:时空崩——窗口越长越放飞,一镜到底变"一镜到底露馅"。

单次30秒是这一轮模型更新最大的卖点,但拿它拍长镜头的人反馈恰好相反:知乎"囡囡"9月21日拿即梦里的Seedance 2.5跑对话漫剧,结论是一条别赌超长——能到180秒是手册上限,“窗口一多,后半段更容易漂”;切镜窗口建议不少于3秒,“过短,动作完成不了,脸和站位先崩”。小红书上做一镜到底的玩家的对策原始但有效:先在白模场景里把起镜、运镜、收尾路径、人物走位完整预演一遍,确认空间、遮挡、节奏没问题,再生成成片——空间错乱、人物漂移、镜头断层,靠的不是运气,是预演。知乎小红书

第四种:资产崩——脸还是那张脸,人和世界不再是同一套。

做AI短剧的人普遍撞到过:第一段角色的声音生成得很好,第二段开始"角色没变、场景没变,声音像换了一个演员"。还有更隐蔽的:有做了200多条AI动画的作者发现,模型会把背景信息当成角色特征的一部分——同一个角色换个场景就变脸,所以定妆照必须统一用纯色背景。小红书8月底一条363赞的吐槽说的是同一件事的另一面:“一张AI脸撞遍全网,表情僵得像面具”——崩,已经卷到连普通观众都能识别的程度。知乎知乎小红书

二、模型这个月真吃掉了什么:Seedance 2.5上线一个月,换脸崩只缓解了半步

字节7月31日正式发布Seedance 2.5,到现在整一个月。按照官方公开介绍,这代产品走音视频联合生成路线,单次最长生成30秒,支持最多30张图片、10段视频和10段音频作为参考素材,并强化了长叙事、多模态参考和时间戳级编辑能力。36氪8月做的七维实测给的评价是:AI视频正在"从片段走向叙事"。知乎36氪

对上面的四种崩法,这轮更新的实际覆盖面要说清楚三件事。

第一件:多参考素材确实能压住"上一秒是你、下一秒不是你"。 实测作者的用法是"使用图片1的人物,在图片3的场景中,完成图片4的动作"——人物、场景、动作分开锚定,不用反复用文字描述角色。对做连载的创作者,这是本月真正能省钱的变化。知乎

第二件:官方自己划了线。 公开介绍里明确承认:复杂动作的物理合理性、多主体互动的稳定性,仍有提升空间。对照第一节的清单——表演崩(动作重心、节奏重量)和多人对话场景的时空崩,恰好就是官方点头说"还没做好"的那两块。别听营销号说"30秒直出一切"。知乎

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

第三件,也是最反常识的一件:参考素材给得越多,不等于越稳。 知乎"灰原琦"9月20日给了一个很实用的工程判断(他本人强调这不是模型内的严格公式,只是经验规则):冲突风险大致随素材数量、信息重叠程度、指令歧义程度一起上升——多份素材同时争夺同一个控制维度时,模型收到的不是更多参考,而是互不兼容的参考。知乎

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

“吾鳴"9月17日拿Wan3.0做的实测把这个坑演示得很完整:想换掉参考视频里的模特,同时上传了"原始参考视频+新模特图+商品图”,结果动作、景别都保住了,脸却没换成——因为商品图里顺手带着旧模特的脸和手,旧人物的视觉特征出现在两份素材里,新人物的只有一份,而提示词没说清该听谁的。他的结论值得所有做电商素材的人抄走:一份素材只负责一件事情;处理干净素材,比多写几句提示词管用。知乎

一句话总结这个月的真实进度:模型把"证据箱"做大了,但"给证据分工"的活,还是人干。

三、模型没吃掉、短期也别指望的三块

  • 克制的表演。 嘴部用力过猛的根子在语料,不是参数。短期解法只有两个:生成端把提示词里的夸张情绪词收住,验收端人工筛片重出。指望下一版模型"演得高级",至少现在没有信号。

  • 动作的物理与重心。 “AI会补帧,但不懂动作重心”——这是传统动画思维最后的护城河,也是为什么B站教程区开始有人卖"视听语言"而不是"提示词"。

  • 长片项目的验收。 单次窗口拉到30秒甚至更长之后,漏检的代价也同步变大:延长会把错误一起拉长。对话镜没锁死之前,不要用延长去补剧情。

四、当下能抄的最小工作流:把角色当资产管理

把这月份多位实测作者的共同经验去重,能收敛成五步。不是方法论,是今天就能用的生产动作:

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

  1. 角色资产先行。 定妆照用纯色背景;参考图补齐正面、3/4侧、全身。B站ZAKA工作室做AI长电影的提醒同样重要:三视图不是不能用,但别理解得太死——有效的不是"有三张图"这个形式,而是人物的整体结构被补全了。

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

  1. 一份素材一个职责。 给每份素材写两行说明:参考什么(面部结构、发型、服装)、不参考什么(背景、姿势、构图、光线)。参考视频最容易"夹带"原片的人物、发型、服装、环境——要换人,先把素材里的杂信息删干净。

  2. 时间戳编排。 每个切镜只承担一件事,谁在第几秒开口写死;窗口不少于3秒;先跑通12秒,再在原片尾帧上做延长,不要一条没过就套娃点超长。

  3. 一次只改一个变量,并且全部记录。 模型版本、角色参考、风格设置都记档;seed可以记,但别只凭"seed相同"判定人物一致。

  4. 切点暂停对比验收。 把切换前后的画面暂停并排看:脸型变没变、发型轮廓接不接得上、肩颈比例是否突然不同;再对三件事:嘴型和台词主人是否一致、同框脸和站位是否还是参考图里那几位、每个切镜是否只说清了一件事。

参考素材越多,越容易换脸?9月AI视频的“一致性大结算”:四种崩法,模型只吞掉一半

这套动作看着"土",但它决定了你做10集漫剧的返工成本是线性增长还是指数增长。

五、按人分:谁可以淡定,谁值得先测,谁还要再等等

  • 单点特效、转场玩法的玩家:画质早过关了,这波更新跟你关系不大,别为"剪映Hub还是LibTV"焦虑搬家。你们真正的稀缺已经从画质挪到了表演克制。

  • 连载漫剧、短剧创作者:一致性正在变成新的用工成本。先花小成本把"同一张脸、同一件夹克、同一把声音"的30秒自测跑通,再谈批量和报价;各家平台的免费额度和限时权益每隔几周就放一波,拿来跑自己的自测,比收藏第20个工具测评有用。

  • 电商、品牌向:“参考视频夹带原模特”"商品图带人"是本月最容易翻车的两个坑,素材拆解优先于提示词优化。

  • 继续观察的信号:官方自认短板的"复杂动作物理合理性、多主体互动稳定性",就是下一轮版本更新最可能命中的地方;剪映ICG Studio还停在限量内测,角色资产能不能在即梦—剪映—抖音之间流转,决定第三方平台用户的迁移成本——现在下"生态定型"的结论为时过早。36氪

AI视频的上半场拼"把画面做像",下半场拼的是"把人物留住"。工具在卷链路,模型在卷窗口,而9月的创作者们真正要解决的只有一件事:镜头一切过去,观众还认得出他。

内容由AI生成

精选参考来源

1. 剪映杀入AI视频赛道,LibTV们将迎来冲击波?

2. 国内有没有AI在线图片视频创作工具?

3. https://www.xiaohongshu.com/explore/6a5440ad000000000702db04

4. AIGC动画怎么做IP角色一致性?8项能力拆解

5. Seedance2.5实测:FlovaAI30秒AI短片,能否保持同一张脸?

6. AI 视频保持角色一致性,应优先依靠参考图,还是依靠工作流与参数控制?

7. https://www.xiaohongshu.com/explore/6ab11ba8000000003a02eaf9

8. https://www.xiaohongshu.com/explore/6a92816b000000000700591f

9. 为什么AI视频里的人,说话时嘴部的动作幅度都特别大,看得觉得很别扭?

10. 即梦 Seedance 2.5:半小时用时间戳拍一集对话漫剧(附可复制提示词)

11. AI视频超简单!一镜到底拍摄实操

12. 解决AI短剧角色、场景、声音一致性,3个关键方案,附教程!

13. 做了200多条AI动画之后,我终于把人物一致性这事儿搞明白了

14. https://www.xiaohongshu.com/explore/6a90e924000000002102ff4c

15. 从 Seedance 2.5 看 AI 视频的新变化:多参考素材怎么编排才不打架?

16. Seedance 2.5测评| 七维实测,AI视频从片段到叙事,到底进步了多少?

17. 别只会生成10秒视频了,Seedance 2.5这3个隐藏玩法才是真正的生产力

18. 首尾帧、参考图、参考视频:想控制AI视频,到底该给它什么素材?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章