张大妈

哔哩哔哩:零样本多语言情感TTS的提速方案

源自小红薯:每日ComputerScience

01-30 11:12

面对多语言语音合成在速度与情感迁移上的瓶颈,哔哩哔哩推出的 IndexTTS 2.5 提供了一套系统性的解决思路。它在保持音质的同时,通过架构与训练策略升级,实现了显著的推理加速,为工业级多语言情感TTS的设计提供了可复用的新范式。

哔哩哔哩:零样本多语言情感TTS的提速方案智能速览

  • 通过语义编解码压缩,将codec帧率减半,为整体提速奠定基础。

  • S2M主干升级为Zipformer,在参数量更小的情况下主观听感更好。

  • 提出三种可组合的多语言建模策略,系统性解决发音混淆问题。

  • 引入GRPO强化学习后训练,显著提升跨语言场景下的韵律自然度。

  • 构建了覆盖约10万小时语音的工业级数据处理流水线。

哔哩哔哩:零样本多语言情感TTS的提速方案精华内容

要实现多语言语音合成的高效与高质,仅靠单点优化远远不够。IndexTTS 2.5 的突破在于,它通过系统级的架构革新与训练策略升级,共同构筑了其核心优势。

推理速度倍增

IndexTTS 2.5 实现的 2.28 倍实时率(RTF)提升,其关键在于对计算流程的精简。系统将语义编解码器的帧率从 50Hz 压缩至 25Hz,这一改动直接使得语义 token 的序列长度减半。

随之而来的是,在文本到语义(T2S)与语义到声学(S2M)两个核心阶段,计算量和显存开销均被显著降低,为整体的高效推理打下了坚实基础。

核心架构革新

在 Semantic-to-Mel 模块上,IndexTTS 2.5 用 Zipformer 替代了上一代的 U-DiT 架构。作为 Flow Matching 的主干网络,Zipformer 在参数量更小的前提下,获得了更优的主观听感。

在用户盲听测试中,Zipformer 获得了 56% 的明显偏好,显著高于 U-DiT 的 40%,证明了其在音质与情感表达上的优势。

多语言建模策略

针对多语言混合场景下的发音难题,系统提出了三种可组合的建模策略。边界感知对齐、Token 级语言拼接和指令引导生成,这些方法共同致力于解决中日共享汉字、多语言同形异音词导致的发音混淆问题。

该方案还给出了在不同语言组合与应用场景下的取舍原则,增强了其实用性。

训练与数据保障

为提升跨语言表现,系统在 T2S 阶段引入了 GRPO 强化学习进行后训练,以 ASR 的词错误率(WER)作为偏好模型信号,显著改善了跨语言与代码切换时的可懂度和韵律自然度。

这一训练成果的背后,是一套覆盖 VAD、ASR、伴奏分离与质量过滤的工业级数据流水线,支撑了约 10 万小时的中英日西语音数据规模。

IndexTTS 2.5 的价值远不止于速度的提升,它更提供了一套经过工业级验证的、可复用的零样本多语言情感TTS设计范式。它系统性地解决了多个长期存在的痛点,为未来更自然、更高效的多语言人机交互体验铺平了道路。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐