Qwen3 TTS 是一款支持本地运行的高效文本转语音模型,具备多音色、多语言及声音克隆能力。本指南将详细介绍其在 ComfyUI 中的部署与使用方法,为需要高质量 AI 配音的视频创作者和开发者提供一个免费且功能强大的解决方案。
智能速览
Qwen3 TTS 支持十种主要语言及多种方言,如四川话和北京腔。
官方提供三种核心模型:基础模型用于克隆,预设音色模型内置角色,声音设计模型支持自定义。
在 ComfyUI 中需安装专用插件,并正确配置模型路径才能使用。
使用 1.7B 模型生成短音频时,显存占用低于 8GB,实测耗时约 37 秒。
声音克隆功能要求原音频与转录文本严格对应,否则易引发显存溢出。
模型能准确识别并朗读中英混合文本、标点及特殊符号。
精华内容
探索 Qwen3 TTS 的强大功能,从预设音色到自定义声音设计,再到精准的声音克隆,开启本地化 AI 配音的新可能。
模型功能解析
Qwen3 TTS 提供了三种不同功能的模型以满足多样化需求。首先是 Base 基础模型,它主要应用于声音的克隆功能。其次是 Custom Voice 模型,该模型内置了多种预设音色,包括中文角色(如 VVian、Uncle Fan)、英文角色、日语角色和韩语角色,以及特定的方言音色,如北京腔的 Dylan 和四川话的 Erik。最后是 Voice Design 模型,允许用户通过文字描述来创造全新的、独特的音色,实现高度的自定义化。
ComfyUI 实战部署
在 ComfyUI 中使用 Qwen3 TTS,首先需要安装对应的插件。用户可以在 ComfyUI Manager 中搜索“Qwen3-TTS”进行一键安装,或前往 GitHub 手动下载插件源码并放置到 custom_nodes 目录下。安装插件后,需下载官方模型文件,包括 1.7B 参数的 Base、Custom Voice 和 Voice Design 三个模型文件夹。将这些文件夹完整地放入 ComfyUI 根目录下的 `models` 文件夹内,以便工作流调用。
工作流与性能表现
部署完成后,在工作流中通过 Qwen3TTSLoader 节点加载模型。关键在于 `model_path` 参数,必须根据所需功能精确指向对应的模型文件夹,例如使用预设音色时指向 Custom Voice 文件夹,进行声音克隆时则指向 Base 文件夹。在性能方面,实测使用 1.7B 模型生成一段约 20 秒的音频,耗时约 37 秒,期间 GPU 显存占用峰值约为 6.9GB,这表明配备 8GB 或以上显存的显卡可以流畅运行。
音色克隆与设计
实现高质量的声音克隆,核心步骤是确保源音频的文本转录与原音频内容完全一致,任何出入都可能导致模型运行错误或显存占用激增。而对于声音设计,用户可在 `instruct` 字段中用自然语言描述期望的声音特质,如“展现出悲苦沙哑的声音质感,语速偏慢”或“语速稍快,节奏紧凑的低沉中老年音域”,模型将根据指令生成符合描述的语音,为创作提供了极大的灵活性。