本教程详细介绍ComfyUI中VibeVoice节点的免费文字转语音工作流程,帮助用户实现高质量AI语音生成和声音克隆。内容涵盖安装、模型配置及实用技巧,适用于视频配音和创意项目,解决了语音合成成本高和操作复杂的问题。
智能速览
使用ComfyUI Manager安装VibeVoice自定义节点。
下载Qwen2.5-1.5B分词器和VibeVoice模型文件。
配置Load Audio、VibeVoice和Save Audio节点生成语音。
支持单人及多人语音克隆功能。
常见问题如音频故障的排查方法。
精华内容
探索VibeVoice的免费TTS功能,轻松实现逼真语音合成。本节深入解析安装步骤和模型配置,确保快速上手。
安装准备
首先通过ComfyUI Manager安装VibeVoice节点。访问ComfyUI自定义节点管理器,搜索VibeVoice并点击安装。安装后重启ComfyUI以加载节点,确保在节点列表中可见VibeVoice相关选项。此步骤无需额外成本,支持Windows、Linux和macOS系统。
模型配置
下载并整理模型文件是关键。创建文件夹路径`ComfyUI/models/vibevoice/tokenizer/`,从Hugging Face获取Qwen2.5-1.5B分词器文件,包括tokenizer_config.json和vocab.json。随后创建`VibeVoice-1.5B`子文件夹,下载1.5B模型(约6GB VRAM)或Q8量化模型(约12GB VRAM),后者适合RTX 3060等GPU,VRAM占用减少约30%。文件组织后刷新ComfyUI界面,模型即可在下拉菜单中选择。
工作流程
配置工作流程进行语音生成。使用Load Audio节点上传音频样本(如`sample_man_voice_demo.mp3`),连接至VibeVoice Single Speaker节点。输入文本并调整参数如temperature(默认0.95)和repetition_penalty(默认0.95)。最后通过Save Audio节点输出FLAC或MP3文件。测试单人语音时,生成速度约为0.05秒/字;多人模式下,支持最多4个说话者,需在文本中用`[speaker:N]`标签区分,输出时长可达25秒。
问题排查
常见问题如音频故障或输出缓慢可快速解决。音频故障通常由模型文件损坏引起,需重新下载并检查文件完整性;输出缓慢时,调整attention_type为flash_attention_2或降低量化精度至Q8,可提升生成速度20%-40%。确保VRAM充足,1.5B模型最低需6GB,Q8模型需12GB,否则会报错。