张大妈

Qwen3-TTS技术报告

源自公众号:苏哲管理咨询

02-04 13:11

Qwen3-TTS 是一个突破性的多语言语音合成模型家族,它首次实现了高保真音质与超低延迟的平衡。通过创新的双 Tokenizer 架构,该模型不仅能以3秒音频实现零样本语音克隆,还能根据文本描述精细控制语音风格,覆盖10种语言,为实时交互和内容创作提供了强大的新工具。

Qwen3-TTS技术报告智能速览

  • 模型核心亮点是3秒语音克隆与文本描述的语音定制。

  • 创新双 Tokenizer 架构分别优化了高保真与低延迟场景。

  • 基于双轨 LM 与六阶段训练,在多项任务中达到 SOTA 性能。

  • 支持10种语言,跨语言合成表现优越,音色保持一致。

  • 0.6B 模型首包延迟低至97ms,适合实时流式服务。

  • 全系列模型已开源,推动社区语音技术发展。

Qwen3-TTS技术报告精华内容

深入探究 Qwen3-TTS 的技术内核,其独特的双轨架构与双 Tokenizer 设计,是实现高保真、低延迟与强可控性的基石,为语音交互领域带来了新的可能。

双轨架构设计

模型采用双轨自回归 LM 架构,将文本 Token 与声学 Token 在通道级进行拼接,实现对声学 Token 的实时预测。该架构包含一个用于多码本序列联合建模的 MTP 模块,以及一个联合训练的说话人编码器,旨在精准保持说话人音色。

核心创新在于两款专属的语音 Tokenizer。25Hz Tokenizer 采用单码本设计,融合语义与声学特征,配合块级 DiT+BigVGAN 解码,追求高保真音质,其 UTMOS 分数达到 4.16,适用于高质量语音合成场景。

12Hz Tokenizer 则采用16层残差向量量化(RVQ)的多码本设计,实现了语义与声学特征的解耦。其解码器为轻量级因果 ConvNet,仅需左上下文即可解码,将首包延迟压低至 97ms,计算量小,专为实时流式服务量身打造。

六阶段训练法

模型的训练过程分为预训练和后训练两个大的阶段,每个阶段又包含三个子阶段,确保模型能力的全面与稳定。

预训练阶段,S1 阶段利用 500 万小时多语言数据,建立文本到语音的基础单调映射;S2 阶段使用高质量数据进行持续预训练,以减少噪声数据导致的语音幻觉问题;S3 阶段则将上下文窗口扩展至 32768 tokens,大幅提升了模型生成 10 分钟以上长语音的能力,避免了韵律断层。

后训练阶段聚焦于对齐与优化。DPO 阶段基于人类偏好对,让模型输出更符合人类听觉习惯;GSPO 阶段引入规则奖励,优化任务稳定性,确保长语音不重复、指令跟随精准;最后的轻量化说话人微调阶段,在基础模型上适配特定语音,高效提升了自然度、表达力与可控性。

SOTA 性能数据

在权威基准测试中,Qwen3-TTS 展现了卓越的性能。在零样本语音克隆任务中,其 1.7B 模型在 Seed-TTS 测试集上取得了 WER=0.77 的 SOTA 成绩。

多语言生成方面,模型在中文、英文、意大利语等 6 种语言的 WER 指标上均取得最优成绩。在所有 10 种支持的语言中,其说话人相似度(SIM)分数全部超越了 MiniMax、ElevenLabs 等商业基线,其中中文 SIM 高达 0.811。

跨语言合成能力尤为突出,从中文合成韩语的错误率仅为 4.82,相比 CosyVoice3 降低了 66%。在流式延迟方面,0.6B-12Hz 模型在单卡 vLLM 引擎下,可实现 197ms 的首包延迟和 0.288 的稳态 RTF,满足严苛的实时交互需求。

开源社区贡献

Qwen 团队此次不仅发布了技术报告,更将全系列模型及核心 Tokenizer 完全开源,采用 Apache 2.0 协议,允许社区自由地进行二次开发与商业使用。

这是业界首个统一了语音克隆、跨语言生成、指令控制等复杂任务的多语言、低延迟、可控流式 TTS 模型家族。通过开源,Qwen3-TTS 为研究人员和开发者提供了强大的基础设施,有望加速下一代音频系统的构建与创新,推动整个语音技术生态的繁荣。

Qwen3-TTS 通过其精巧的架构设计与全面的训练策略,成功整合了语音克隆、多语言支持与超低延迟等前沿特性,为构建更自然的语音交互系统奠定了坚实基础。它的开源无疑将加速相关技术的迭代与创新,未来如何将这种能力与 LLM 更深度结合,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章