探索一套全自动短视频生产工作流,通过自动化脚本、关键帧和视频合成,实现科普动画的批量产出。这套方案有效解决了传统制作周期长、效率低的痛点,为内容创作者提供了快速验证和迭代新思路的可行路径。
智能速览
输入科普问题,AI自动生成视频脚本和分镜。
利用关键帧技术确保多段视频无缝衔接。
结合Seedance、可灵等模型实现音画同步生成。
支持快速测试不同视频内容,找到爆款后批量复制。
可通过无声视频+TTS配音,实现更灵活的音频控制。
精华内容
这套自动化工作流的核心在于将复杂的视频制作拆解为多个可控环节,通过AI工具链串联,实现高效产出。
脚本生成
输入一个科普问题,AI首先设计两轮问答对话,并将其切分为四个视频切片。每个切片都详细定义了说话者、台词、时长、场景元素、肢体表情变化以及所需插画,最终输出结构化的JSON文件,为后续步骤提供精确的数据基础。
关键帧制作
为解决AI视频生成普遍存在的8-12秒时长限制,工作流采用关键帧技术。系统会读取每个切片的场景描述,调用Seedream 4.5模型生成N+1张关键帧图片。这确保了前一片段的尾帧与后一片段的首帧一致,从而实现视频拼接后的连贯视觉效果。
视频与插画
根据切片内容,使用Seedream 4.5生成对应的静态解释插画。视频生成则采用Seedance 1.5 Pro,利用首尾帧固定的方式生成4-12秒的片段,并支持音画同步直出1080P竖屏视频。实测中,Seedance 1.5 Pro效果不错,但若不加强约束,模型有时会自由发挥台词和动作。
合成与后处理
后期处理环节由Claude Code通过命令行调用ffmpeg自动完成。流程包括:将插画叠加到视频顶部形成画中画效果,使用concat命令无损拼接所有片段,并根据JSON文件中的台词和时长生成SRT字幕文件,最终输出成片。
替代方案
针对Seedance 1.5 Pro在中文音频上的不稳定性,工作流提供了另一套思路:使用可灵先生成无声视频片段,再通过阶跃或Minimax的TTS模型进行配音。这套方案能实现更多样的音频效果,如方言或唱歌,且对音频的控制更为精准。
这套全自动工作流极大降低了短视频的生产门槛,让创作者能专注于创意本身而非重复劳动。未来,随着AI工具能力的进一步整合,从创意到成片的链路或许将更加智能和无缝。