先说一个被弹幕问烂的场面:AI短剧第一集,女主还是圆脸短发,第三个镜头变瓜子脸,第五个镜头像换了个演员,评论区高赞是"这是同一个人吗"。7月中青聊AI那篇复盘写得很直白——做AI短剧的人,几乎人人遇到过这个瞬间。微信公众平台抖音6月10日一条讲"3招写对提示词"的视频,16315个赞、787条评论。抖音8月31日B站一条"用角色卡锁定多镜头一致性"的实操,发布两天347赞,UP主置顶的问题就是:你做AI视频时,最容易变化的是脸、发型还是服装?哔哩哔哩
这不是小众烦恼。2026年这半年,从字节到快手到MiniMax到阿里云,模型军备竞赛的火力,几乎全压在同一个词上:一致性。
一、先别急着改提示词:你说"不一致",其实是四个不同的问题
8月25日头条有人做了6款工具的横评,提出一个值得抄进工作笔记的框架:「角色一致」不是一件事,是四层——静态相似(多张图里像同一个人)、单镜参考(一个片段内不崩)、多镜头一致(换机位、换场景还是那个人)、跨集一致(几十集连载里,角色换装受伤了还是他)。今日头条这篇横评自己注明是按公开机制做的分析、不是实测打分,但分层本身是清楚的:前两层今年基本被模型收编,第三层正在收编,第四层还开着口子。很多人骂"不一致",其实是把第一层的问题当成了第四层的问题,药自然抓不对。
二、为什么会换脸:模型根本没有"角色记忆"
7月9日那篇复盘把机制讲透了:生成模型每次出图都是全新的独立采样,它不记得上一个镜头。你写"短黑发的年轻女性",模型就从训练分布里重新抽一张脸,10个镜头抽10次,自然是10个人。人类画师脑子里有固定参照,AI没有。微信公众平台所以社区整套土办法——垫图、三视图、角色卡——本质都不是"让模型记住",而是"每次生成前,把记忆重新喂给它"。理解了这一条,下面所有规则都能自己推出来。

三、半年时间线:模型正在把社区补丁一条条吞掉
把今年2月到现在的关键发布排开,方向异常一致:
2月5日,可灵3.0系列上线,主打"从生成到编辑"全流程。微信公众平台 2月12日,豆包视频模型Seedance 2.0发布,接入豆包、即梦,角色锁定和多镜头是核心卖点。今日头条 3月就有创作者晒实测说崩坏率明显下降(自报,样本不大)。
6月23日火山引擎FORCE大会预告Seedance 2.5:原生直出30秒、单项目参考素材从2.0的12份扩到50份、3D白模预演、原生4K。抖音 7月31日正式发布——单次生成30秒、支持多轮延长且延长时保持主体特征一致,单次最多输30张图片、10段视频、10段音频当参考,带时间戳定向编辑、绿幕和视角编辑,即梦AI和豆包专业版陆续接入,API随后上火山方舟。微信公众平台
7月31日MiniMax发布H3,发布即Artificial Analysis国内视频榜第一、全球第二。微信公众平台 8月3日该模型开源:全模态参考生成、V2V动作迁移、2K+15秒+原生立体声,号称全球首个达到Seedance 2.0级别生成效果的开源模型,权重挂上Hugging Face和ModelScope。今日头条
8月24日,阿里云Wan3.0上线,单次生成30秒,还支持文档输入。小红书
看出规律了吗:现在各家发布会拿来对标比的参数——参考位数量、多轮延长、多镜头一镜到底、可编辑——全是去年个人创作者用垫图和抽卡土法解决的东西。竞赛从"单条抽得像不像",挪到了"一整个项目能不能立住"。

四、但收编是有边界的:跨集这一层,还得靠资产层自己
以Seedance 2.5为例:30秒内组织多个有逻辑关联的镜头、延长时不丢主体,解决的是第三层;可你的短剧是3集×30秒、2个主角、4个常出现场景、18个关键镜头(这是横评设的基线,也是多数一人剧组的真实体量),第9个镜头在哪个版本里、女主换了装观众认不认得出,模型不替你做这个决定。8月25日那篇横评给各工具标的"停止位置"(重申:机制分析,不是实测):即梦、可灵停在单镜到多镜头之间;Runway单镜运镜控制最细,但切镜不携带角色;真正冲着跨集去的是两条路线——剪映团队小云雀这类把角色设定、三视图、场景全景、故事板组织成"资产画布"的项目平台,和LiblibAI这类靠LoRA训练+工作流沉淀角色资产的技术路线。今日头条所以"一镜到底"的宣传语不等于"跨集解决",听到后者要自动打折。

五、社区还在把争论往前推:9月的平台盘点已经在考"跨集"
8月底到9月初,头条一个自媒体账号连着发了两篇AI短剧创作平台的批量能力对比(9月2日、9月4日),给出的判断标准已经不再是"单条像不像",而是三条硬指标:剧本能不能自动分集、角色资产能不能全局锁定(跨集不换脸)、单镜头能不能独立回退(改1个镜头不触发整批重跑),并直言"多开10个窗口不等于产线"。今日头条 其中"第1集到第3集角色锁定稳定、第5集开始服饰细节漂移"这类"功能表不会标注的衰减曲线"的说法,和前面四层框架互相印证。今日头条需要提醒的是,这类盘点本身带推广背景(通篇给某代工平台导流),三档划分只能当社区共识的方向参考,不能当基准测试——但这至少说明:讨论的主战场,确实已经从提示词挪到了资产和产线。
六、模型还没到位,这五个社区补丁依然值钱(按事故场景对号入座)
脸不稳——建角色卡。B站8月31日的实操路径:拿2-3张有授权的参考图,先固定生成三视图、全身图和常用表情,做成统一角色卡,之后只改场景、动作、镜头。UP主自己话说得很克制——不能保证每一帧完全相同,但可以减少返工。哔哩哔哩
描述太笼统——给脸发"身份证"。7月9日的做法是把面部结构、五官细节、发型特征、体态特征、辨识标记五个维度写成固定段落,每个镜头原样贴进提示词;作者自报组合下来"大概85%的镜头能认出是同一个人"——记住是单一作者的自报数,不是实测基准。微信公众平台
侧面、背面必崩——三视图不能省。3月抖音有条估算被反复引用:只垫正面图,等于让AI自己脑补侧面;建角色库第一次花了一个半小时,但后面8个分镜"每次第一两张就是对的",省下的抽卡时间远超建库成本。抖音
画面里多出陌生的脸、角色提前乱入——用"全面封装图"。7月1日抖音创作者的解法:把角色、场景、机位打包进一张总览图喂给模型,让它先看懂整场戏再动笔。抖音
打戏、复杂动作崩——动作分镜先行。5月12日做武侠的创作者晒过对比:先出动作分镜图再生成,抽卡从十几次降到两三次。微信公众平台 6月11日抖音有条讲"人物站位"的视频拿了542赞——双人戏光靠文字定谁左谁右,本来就不稳。抖音

七、三个反直觉的坑,比提示词模板更值得记
第一,参考图不是越多越好。2.5给你30个图位,但参考的作用是"锚定同一个人",塞进互相冲突的版本等于自找事故——社区经验是:素材要覆盖同一角色的不同角度和状态,而不是同一角色的不同长相。
第二,首尾帧不解决一致性。它管的是"从A画面怎么过渡到B画面",不管"B里的人还是不是刚才那个"——6月16日有人拿同一组首尾帧,在Seedance 2.0、可灵、海螺2.0下各跑了一遍动画过渡,三家的差异全在"怎么过去",不在"过去之后脸还对不对",去年拿首尾帧当一致性神器的用法,基本都属于错位。微信公众平台
第三,故事板最近很火,但6月27日抖音的避坑视频说得很具体:单张看都行,连成视频"人物变、场景变、镜头关系也乱"——故事板是资产不是保险,角色没锁三视图,它只是把换脸排得更整齐。抖音顺带校准一句流行判断:"八成翻车是提示词写偏"只说对三分之一:8月24日头条总结的三大坑是手部崩坏、人物变脸、画面抖动,后两个都不是文案问题。今日头条

八、所以:先定层,再决定动手还是等版本
卡在第一、二层(单图不像、单镜崩):这是你的素材精度问题,先补角色卡和五维锚点,换模型没用。卡在第三层(多镜头换脸):优先评估"模型收编"路线——角色锁定、多轮延长、大参考位,Seedance 2.5、MiniMax H3都是冲这里来的,已经在即梦、豆包里能用,API上火山方舟后你现有的工作流也能接。微信公众平台卡在第四层(多集连载):目前没有模型化终解,要么上项目资产平台,要么跑LoRA工作流,要么干脆等。
继续观察三个信号:H3开源权重这一批的社区部署实测会不会给出真正的崩坏率数据;"50份参考素材"会不会在下半年变成各家标配参数;以及那套四层"停止位置"横评,会不会被一波实测打脸。在有人给出可复现的崩坏率之前,今天所有百分比只能当经验值,不当结论。
最后留个B站原帖同款的问题:你做AI视频,最先崩的是脸、发型还是服装?欢迎带上工具和镜头类型来评论区对账。