通义最新发布语音双模型,一句话即可自由生成!

源自公众号:语音之家

03-04 13:37

传统TTS常受限于预设标签,无法精准表达。通义实验室发布的Fun-CosyVoice3.5与Fun-AudioGen-VD模型,引入FreeStyle指令生成能力,支持通过自然语言直接控制语音表达与场景设计,大幅提升了语音生成的自由度与沉浸感。

通义最新发布语音双模型,一句话即可自由生成!智能速览

  • 引入FreeStyle范式,通过自然语言指令替代预设标签。

  • Fun-CosyVoice3.5支持多语种复刻与精细化表达控制。

  • Fun-AudioGen-VD实现“人物+场景”一体化声音设计。

  • 生僻字读错率降至5.3%,长文本朗读更流畅。

  • 通过强化学习调优,首包延迟降低35%。

通义最新发布语音双模型,一句话即可自由生成!精华内容

FreeStyle新范式的出现,标志着语音生成从“选项控制”迈向了“语言描述”的新阶段。

FreeStyle指令控制

Fun-CosyVoice3.5模型突破了传统TTS依赖固定情绪、语气标签的限制,实现了Instruct-TTS的能力升级。支持直接用自然语言描述表达方式,例如“语气坚定一点”、“稍微压低音调”等,模型即可理解并生成相应语音,实现了更细腻的自由表达控制。

多语种与准确度

模型新增了泰语、印尼语、葡萄牙语、越南语四种语言支持,并在13种语言的WER和SpkSim指标上保持业内领先。针对生僻字和复杂语句,专项优化将读错率从15.2%大幅降至5.3%,长文本朗读也更加流畅稳定。

音质与性能优化

听感层面,通过DiffRO + GRPO和Flow-GRPO技术强化调优,显著提升了韵律表现与音质复刻相似度。性能方面,Tokenizer帧率减半,首包延迟降低35%,确保了实时交互场景下的响应速度与体验流畅度。

场景化声音设计

Fun-AudioGen-VD解决了声音设计难题,支持通过指令生成目标音色、情绪及完整听觉场景。不仅能控制声音的性别、年龄、情绪,还能模拟咖啡馆、战场等环境音以及空间混响效果,实现沉浸式的“人物+场景”一体化生成。

FreeStyle指令与声音设计能力的结合,将语音生成从工具升级为创作手段。未来,声音创作将不再受限于模板,而是成为一种可编排、可塑造的数字表达能力。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章