张大妈

【cpmfyui】Qwen3TTS声音模型开源!一大波工作流 同名Runninghub主页(每日更新好用的工作流) #runninghub #comfyui #qwen3TTS

源自抖音:Adventurer17

02-04 12:55

Qwen3TTS的开源为语音合成领域带来了新的可能性。它不仅提供了高效的声音克隆,还创新性地加入了声音设计功能,极大地降低了创作门槛。通过一系列精心设计的ComfyUI工作流,可以快速实现从单一声音复制到多角色配音、乃至数字人视频制作的完整流程,是探索AI语音应用的实用指南。

【cpmfyui】Qwen3TTS声音模型开源!一大波工作流 同名Runninghub主页(每日更新好用的工作流) #runninghub #comfyui #qwen3TTS智能速览

  • Qwen3TTS开源,提供声音克隆、设计与自定义三大核心功能。

  • 模型速度快、质量高,支持多语言,实测泰语也能合成。

  • 提供声音克隆、情感控制及多角色配音等实用ComfyUI工作流。

  • 声音设计功能可通过描述或图片生成音色,体验类似“抽卡”。

  • 可结合数字人生成工具,快速对口型视频,效率高。

【cpmfyui】Qwen3TTS声音模型开源!一大波工作流 同名Runninghub主页(每日更新好用的工作流) #runninghub #comfyui #qwen3TTS精华内容

要真正发挥Qwen3TTS的潜力,关键在于掌握其核心功能与相应的ComfyUI工作流。通过这些工作流,用户可以解锁从基础到高级的语音创作能力,将想象力转化为逼真的声音。

模型功能初探

Qwen3TTS提供0.6B和1.7B两种参数版本。0.6B资源消耗低,适合配置有限的环境;1.7B则在精度上更胜一筹,是体验完整功能的首选。

1.7B版本下分三个模型:Base Voice负责声音克隆,仅需3秒音频即可复制音色;Voice Design允许通过文本描述创造全新声音;Custom Voice则通过指令对九种预制音色进行风格、情绪等精细控制。

与Index TTS相比,Qwen3TTS在速度上更快,质量也更高,能够实现实时对话,适用于直播或虚拟主播场景。而Index TTS的长处在于长文本生成和情感量化控制,更适合配音和音频剧制作。

声音克隆与设计

声音克隆工作流操作直接,上传目标音频和文本后,TTS节点便会生成克隆语音。使用时需注意,文本中的英文缩写如“GGUF”应用空格隔开字母,以确保模型识别正确。模型还支持批量处理,通过提示词列表一次性生成多段语音,有助于保持长文本的输出质量。

声音设计是Qwen3TTS最富创造力的功能。用户只需输入描述性的提示词,如“一个温柔、有磁性、语速稍慢的中年男声”,模型便能生成相应的音色。更有趣的是,可以上传图片让模型自动反推声音,这种随机性带来了类似“抽卡”的惊喜体验。

高级控制技巧

为实现更精细的声音控制,可以将声音克隆与情感增强结合。在工作流中,将克隆后的声音接入Index TTS节点,利用其八种情感维度(如快乐、悲伤)进行量化调节,通常将强度设置在0.25至0.5之间,即可获得情感饱满且不失真的效果。

多角色配音则通过TTS Raw Bank和对话参考节点实现。首先为每个角色配置声音(通过设计或克隆),然后整理好包含角色名和台词的文本,工作流会自动分配音色,并允许精确设置逗号、问号等标点符号的停顿时长,确保对话节奏自然流畅。

数字人应用实战

将Qwen3TTS与Infinite Talk等数字人工具结合,可以快速生成对口型视频。工作流首先通过声音克隆或设计生成音频,再由节点计算音频时长,最后将音频与图片一同输入Audio Image to Video节点。

为获得更好的口型同步效果,建议使用面部占比较大的图片,或将横屏图片裁剪为竖屏。输出分辨率可缩放至540P,5秒视频约5分钟即可生成,支持多工作流并行运行,极大提升了创作效率,让AI视频“抽卡”成为可能。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章