SkyReels V3 新增的多图参考生视频功能为创作带来新可能。本文提供基于 ComfyUI 的官方节点工作流详解与实操体验,帮助用户快速上手本地部署,避开常见设置误区,高效生成视频。
智能速览
SkyReels V3 包含多图生视频、视频扩展和数字人对口型三大功能。
模型基于 Wan2.1 架构,官方已做蒸馏处理,无需额外加速 LoRA。
提供一套完整的 ComfyUI 工作流,支持 1-4 张参考图灵活输入。
推荐采样参数为 8 步、CFG 1,调度器可自由选择。
实测模型融合效果佳,但对复杂指令的遵从度有限。
精华内容
下面是这套工作流的详细拆解,涵盖模型加载、参数配置及核心节点用法,助你轻松玩转多图视频生成。
模型基础
SkyReels V3 的多参考图视频生成模型基于 Wan2.1 架构构建,同时使用了 Wan2.1 的 VAE 和 U-Net,文本编码器则采用了 umt5_xl_fp16。该模型官方已经过蒸馏处理,因此在使用时无需额外加载类似 LightX 的加速 LoRA,简化了部署流程。此外,kijai 社区也发布了 fp8 版本,为显存有限的用户提供了便利。
工作流核心
工作流的核心是 `phantom_to_video` 节点,所有参考图片均以图片形式直接输入该节点,无需 ClipVision 处理,使用上非常便捷。采样设置方面,官方推荐 8 步,CFG 值设为 1。调度器可根据个人偏好选择,例如 euler a 配合 simple 调度器。视频生成参数建议设置为 24fps,以保证流畅度。
灵活输入设计
为提升实用性,工作流设计了四个图片加载节点,除第一个外,其余均配有开关,可按需启用 1 至 4 张参考图。每个图片加载节点后串联了一个 RMBG(移除背景)节点,用户可根据参考图背景的干扰情况选择性开启,避免不必要的计算。后续节点会将图片按视频比例调整并组成 Batch,送入核心生成节点。
生成效果评估
实际测试表明,该模型在融合多张参考图元素方面表现出色,效果自然。然而,其在处理复杂动作和遵循复杂提示词方面能力有限,当提示词指令过于具体或复杂时,模型可能无法准确生成相应动作。总体而言,该模型趣味性强,适合进行创意探索,但对提示词的精准控制有待提高。
SkyReels V3 的多图生视频功能为创作者提供了新工具,虽然对提示词的理解仍有提升空间,但其融合效果已相当不错。这套工作流能降低使用门槛,你会用它来创作怎样的故事呢?