千问团队开源的Qwen3-TTS在语音合成领域带来了突破性进展,支持10种主流语言,仅需3秒音频即可克隆任意音色,还能通过自然语言指令精细控制音高、语速、情绪等参数,在多项指标上超越闭源模型,为开发者和创作者提供了强大的语音生成工具。
智能速览
仅需3秒参考音频即可克隆任意音色
支持自然语言指令控制音高/语速/音量/情绪/语调
1.7B版本提供VoiceDesign/CustomVoice/Base三种功能模型
在PESQ/UTMOS等关键指标上超越MiniMax、豆包等闭源模型
支持跨语种音色克隆与复杂文本处理
提供本地部署方案,支持Mac和NVIDIA GPU环境
精华内容
Qwen3-TTS不仅是一个技术突破,更是一个实用的创作工具。从音色克隆到风格控制,从自然语言指令到多语言支持,这个开源模型为语音生成领域带来了新的可能性。
模型架构与性能
Qwen3-TTS采用自研的Qwen3-TTS-Tokenizer-12Hz与离散多码本LM架构,实现了极低的端到端延迟。模型分为1.7B和0.6B两个尺寸,其中1.7B版本包含VoiceDesign(音色创造)、CustomVoice(风格控制)和Base(音色克隆)三个功能模型。
在性能表现上,Qwen3-TTS的PESQ(客观语音质量评估)达到3分多(满分4.5分),STOI(语音清晰度)接近1,UTMOS超过4分(满分5分),说话人相似度接近1,各项指标均达到高质量语音标准。
音色克隆技术
Base模型仅需3秒参考音频即可快速克隆任意音色,支持跨语种克隆,能够处理混合语言、特殊符号和生僻字。实测显示,其音色克隆能力超越了MiniMax和豆包SeedTTS。
克隆后的音色在长语音生成中表现出色,一次性合成10分钟语音的错词率较低,能够保持音色的一致性,特别适合有声书、播客等长内容制作。
自然语言控制
CustomVoice模型支持通过自然语言指令精细控制语音参数,包括音高、语速、音量、清晰度、流畅度、口音、音色质感、情绪、语调等。单属性或多属性组合控制都能实现,还能进行复杂表达风格的融合。
特别的是渐变控制功能,可以让语音从平稳逐渐变得激动,通过语速渐变、音量渐变、情绪渐变或语调渐变实现自然的表达变化。同时支持拟人化表达,如笑声、叹气、停顿、语气词等。
音色创造能力
VoiceDesign模型可以根据用户输入的描述进行音色创造,支持调节年龄、性别、性格特质等属性。通过角色设定和背景故事,能够生成符合人物形象的语音。
创造的音色可以持久存储,支持多人次、多角色、长篇章的对话生成,为游戏配音、虚拟主播等场景提供了强大工具。官方提供的9个精品音色覆盖了多种性别、年龄和语种。
部署与使用
用户可以通过Hugging Face或ModelScope的在线Demo快速体验,也可以在本地部署。官方提供了详细的Python包使用文档,支持Web UI演示,通过简单的命令即可启动服务。
对于NVIDIA GPU用户,安装相对简单;Mac用户则可通过MLX社区版本运行,但可能需要一些脚本调整。部署后可以选择VoiceDesign、音色克隆或自定义语音等功能页面进行操作。
Qwen3-TTS的开源为语音合成领域注入了新的活力,其强大的音色克隆和自然语言控制能力,加上优秀的本地部署支持,使其成为当前开源TTS的标杆。无论是内容创作者还是开发者,都能从中找到价值,未来值得期待更多创新应用的出现。