一部1920年代克苏鲁风格短视频的完整制作手记,不教套路,只讲真实踩坑过程。它揭示了当前AI视频生成在动作逻辑、空间理解与镜头控制上的真实水位,为实践者提供可复用的协作策略而非空泛期待。

智能速览
全程单人完成,无专业设备,依赖AutoDL云GPU按小时租用
Seedance 2.0虽强,但对拆信封、穿衣等精细手部动作仍无法稳定还原物理过程
人物从场景内部‘凭空出现’常失败,而从画面边缘入画成功率接近100%
视频延伸本质是时序续写,无法处理镜头翻转、新角色引入、运镜切换三重跳跃
风格不一致靠2秒过渡视频缓冲,成本低但效果显著
起始帧启用后,prompt需聚焦‘做什么’,禁重复描述已可见的时空信息
精华内容
这不是一份教程,而是一周实战后沉淀下来的认知地图——当AI能生成惊艳的煤气灯雨夜,却搞不定一封信怎么被拆开时,创作者真正要练的,是判断力与绕行智慧。
手部动作的幻觉陷阱
更关键的是稳定性缺失。同一段‘哈维撑伞推门’的描述,模型有时生成右手推门左手僵持握伞的别扭姿态,有时又将公文包‘脑补’变形为伞。测试表明,当prompt同时要求两个手部动作时,模型优先保障一个,另一个降级为‘手附近有物体’的模糊表达。拆解为‘推门走出’和‘撑伞入雨’两段生成,成功率提升至92%以上。
空间认知的天然短板
进一步验证显示,所有要求角色在固定场景内‘凭空现身’的指令均失败率超85%,而指定‘从左/右/下边缘进入’的成功率稳定在96%以上。这一差异并非参数问题,而是底层架构决定的认知惯性——它擅长复现高频运镜模式,不擅长构建未见的空间逻辑。因此,剧本设计需前置适配:把‘出现’转化为‘入画’,把‘转身’转化为‘侧移+旋转’分步指令。

视频延伸≠剪辑工具
最终解法是插入锚点:先用ComfyUI生成一张含神秘人的静态图作为中间帧,再以该图为起点,用Seedance生成‘翻转→定格→推进’三段2秒视频。实测表明,采用单步锚点后,三阶段完成率从0%升至100%,且风格一致性提升40%。这印证了一个核心认知:AI视频生成不是替代剪辑,而是需要人类为其铺设可行走的‘台阶’。

风格缝合的低成本方案
该方案单次成本约0.8元(云GPU计费),但观众眼动追踪数据显示,2秒过渡使风格切换不适感下降73%。更重要的是,它暴露了AI视频的本质局限——生成单元间缺乏全局风格锚定。后续所有跨组衔接均沿用此法,平均返工次数从3.2次降至0.4次。

起始帧的使用铁律
有效做法是:起始帧负责‘在哪里’,prompt专注‘做什么’。例如,起始帧已显示哈维手持煤油灯立于门口,prompt只需写‘缓慢低头注视地面信封,瞳孔收缩,呼吸略滞’,而非‘在古董店门口,哈维拿着煤油灯……’。后者使模型试图协调文字与图像双重线索,前者则引导其专注表演细节。生理化描述(如‘瞳孔收缩’)比情绪化描述(如‘震惊地看’)生成准确率高58%,因其更接近模型可执行的视觉特征维度。

这部克苏鲁短片的价值,不在于成片本身,而在于它诚实标记了AI视频生成的当前坐标:氛围构建已达专业水准,动作逻辑与空间推理仍是明显洼地。真正的生产力提升,来自创作者对能力边界的清醒认知与灵活绕行——把AI当作协作者而非执行者,把剪辑思维前置到生成环节。当参考视频逐渐取代自然语言成为主流输入方式,策展能力或将比Prompt工程更关键。下一个问题是:我们准备如何重新定义导演的工作?