张大妈

🚨 阿里 Qwen3-TTS 全家桶正式开源

源自小红薯:有点儿西东

01-28 19:18

阿里正式开源Qwen3-TTS语音生成全家桶,提供从音色创造、指令控制到极速克隆的全链路能力。其强大的自然语言控制与超低延迟特性,为开发者构建高交互性语音应用提供了新的可能,标志着开源语音技术迈向新高度。

🚨 阿里 Qwen3-TTS 全家桶正式开源智能速览

  • 开源Qwen3-TTS套件,含1.7B与0.6B两种参数规模的模型。

  • VoiceDesign支持通过自然语言描述创建全新音色。

  • Base模型仅需3秒音频即可完成高质量的音色克隆。

  • 采用Dual-Track架构,可实现极致低延迟的流式语音生成。

  • 实测性能超越ElevenLabs等商业模型,词错率更低。

🚨 阿里 Qwen3-TTS 全家桶正式开源精华内容

此次开源的Qwen3-TTS不仅是模型的集合,更是一套完整的语音生成解决方案,通过技术创新在音质、效率和可控性上设立了新的标杆。

模型矩阵

Qwen3-TTS全家桶主要分为1.7B和0.6B两个参数版本。1.7B旗舰版包含三个模型:VoiceDesign可根据文本描述创造指定性别、情绪的声音;CustomVoice提供9种预设音色并支持精细指令控制;Base模型则专为3秒音频快速克隆优化。0.6B高效版移除了指令控制功能,专注于核心语音生成,追求更高运行效率。

技术架构

其核心技术亮点在于四个方面。首先,基于Qwen3-TTS-Tokenizer-12Hz实现高效声学压缩,保留副语言信息。其次,采用离散多码本LM架构,提升了通用性与生成上限。第三,通过Dual-Track混合流式架构,实现输入单字后即可输出音频的极低延迟。最后,深度融合文本语义理解,支持自然语言指令驱动的语音控制。

性能实测

性能测试数据显示,Qwen3-TTS表现优异。在语音设计上,其InstructTTS-Eval得分达到84.1/81.8,超越MiniMax。在语音克隆任务中,词错率仅为1.835%,说话者相似度达0.789,均高于ElevenLabs和CosyVoice3。长语音生成方面,中文词错率2.36%,英文2.81%,展现了高保真度和稳定性。

Qwen3-TTS的开源,无疑为语音技术领域注入了强心剂,降低了高质量、高可控性语音生成的门槛。它不仅为开发者提供了强大的工具,也为未来更具沉浸感和交互性的AI应用打开了想象空间,我们或许将迎来一个万物皆可发声的时代。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章