传统TTS常受限于预设标签,无法精准表达。通义实验室发布的Fun-CosyVoice3.5与Fun-AudioGen-VD模型,引入FreeStyle指令生成能力,支持通过自然语言直接控制语音表达与场景设计,大幅提升了语音生成的自由度与沉浸感。
智能速览
引入FreeStyle范式,通过自然语言指令替代预设标签。
Fun-CosyVoice3.5支持多语种复刻与精细化表达控制。
Fun-AudioGen-VD实现“人物+场景”一体化声音设计。
生僻字读错率降至5.3%,长文本朗读更流畅。
通过强化学习调优,首包延迟降低35%。
精华内容
FreeStyle新范式的出现,标志着语音生成从“选项控制”迈向了“语言描述”的新阶段。
FreeStyle指令控制
Fun-CosyVoice3.5模型突破了传统TTS依赖固定情绪、语气标签的限制,实现了Instruct-TTS的能力升级。支持直接用自然语言描述表达方式,例如“语气坚定一点”、“稍微压低音调”等,模型即可理解并生成相应语音,实现了更细腻的自由表达控制。
多语种与准确度
模型新增了泰语、印尼语、葡萄牙语、越南语四种语言支持,并在13种语言的WER和SpkSim指标上保持业内领先。针对生僻字和复杂语句,专项优化将读错率从15.2%大幅降至5.3%,长文本朗读也更加流畅稳定。
音质与性能优化
听感层面,通过DiffRO + GRPO和Flow-GRPO技术强化调优,显著提升了韵律表现与音质复刻相似度。性能方面,Tokenizer帧率减半,首包延迟降低35%,确保了实时交互场景下的响应速度与体验流畅度。
场景化声音设计
Fun-AudioGen-VD解决了声音设计难题,支持通过指令生成目标音色、情绪及完整听觉场景。不仅能控制声音的性别、年龄、情绪,还能模拟咖啡馆、战场等环境音以及空间混响效果,实现沉浸式的“人物+场景”一体化生成。
FreeStyle指令与声音设计能力的结合,将语音生成从工具升级为创作手段。未来,声音创作将不再受限于模板,而是成为一种可编排、可塑造的数字表达能力。