这篇内容详细介绍了ComfyUI-Qwen3-TTS插件的模型微调功能,通过实际演示展示了如何训练专属音色。包含数据集准备、参数设置、显存优化等关键技术点,并提供云端训练解决方案,帮助用户快速掌握音色克隆技术。
智能速览
支持0.6B和1.7B版本Base模型微调
数据集需包含音频文件和对应的TXT文本
16G显存推荐批次大小为1
新增停顿时长控制功能
支持中文、英文、日语和韩语训练
精华内容
模型微调是Qwen3-TTS的核心功能之一,通过特定数据集训练可实现音色克隆。以下将从环境准备、参数设置到实际应用,全面解析微调流程。
训练环境准备
微调代码已更新至RunningHub平台,注册可获得1000点积分,每日登录额外获100点。本地训练需准备ComfyUI环境和插件,云端训练则可直接上传数据集压缩包。16G显存用户需特别注意批次大小设置。
数据集构建规范
训练数据集需包含音频文件和对应的TXT文本文件,两者名称必须严格对应。音频要求24kHz采样率。测试表明,仅用3组韩语音频即可实现中文语音生成,且能保持原音色特征,无明显外国口音。
关键参数配置
学习率推荐设置为2e-4,训练轮次根据数据量调整,小数据集建议10轮。批次大小对显存影响显著,16G显存务必设置为1,否则会报错。gradient_accumulation_steps参数可缓解显存压力。
新增停顿控制
最新更新支持通过标点符号控制停顿时长。句号、逗号、问号和连接符可设置不同停顿时长参数。实测对比显示,合理设置停顿能让语音更自然流畅,明显改善衔接效果。
模型应用方法
训练完成后,通过custom_model_path指定模型路径,配合speaker_name调用。保存频率由validate_every参数控制,10轮训练默认保存5个检查点。微调模型可直接用于语音生成,与标准模型使用方式一致。
Qwen3-TTS微调功能为个性化语音生成提供了可靠方案。随着官方持续更新,未来有望支持更多训练模式和高级控制功能,为创意内容生产注入新可能。
关键评论
微调训练的音频必须是24khz采样率,已更新最新工作流
期待官方后续发布更多训练代码功能
训练后的模型不支持Custom模块的情绪控制
实测微调后音色转换效果地道,节奏自然