字节跳动最新发布的两款语音模型,不仅能让AI快速复刻人声,更开始尝试理解上下文以匹配情绪。这项技术的实测效果如何,以及如何找到隐藏的入口,将为对AI语音生成感兴趣的用户提供一份清晰的操作指南和价值判断。
智能速览
声音复刻2.0可快速克隆音色,赠送2万字额度。
语音合成2.0能理解上下文,让声音带有情绪。
可通过添加指令,直接控制AI的语气和风格。
新模型入口较深,需在火山引擎控制台寻找。
精华内容
语音技术正从单纯的文本朗读,向理解情感与语境的更高阶形态演进。字节的这两款新模型,正是这一方向的尝试与实践。
一键复刻音色
声音复刻2.0模型的操作十分便捷。用户只需上传一段约8秒的音频文件,系统便能快速克隆出高度相似的音色,甚至连说话的停顿和语气习惯都能捕捉到。
该模型新用户会获赠10个音色槽位,可同时存储10个不同人的声音,管理起来很方便。此外,官方还赠送了2万字的合成额度,对于日常测试和内容创作来说相当充足。美中不足的是,目前无法对已复刻的声音进行重命名,当数量增多时容易混淆。
理解上下文情绪
更值得关注的是语音合成2.0模型在情绪理解上的突破。它支持在合成文本前引入“上下文”,通过输入前一句话的描述,让模型理解场景氛围。
例如,在合成“你头发长了,十年了你还好吗?”这句话前,输入上一句“是你吗?怎么看着好像没怎么变啊?”来营造“好友久别重逢”的场景。合成后的声音明显多了一份努力克制又激动的复杂情绪,表现力远超传统TTS。
指令式语气操控
除了理解上下文,该模型还能通过“指令”直接控制语气。一种是明确的语气指令,如在中括号内加入“用吵架的语气”或“用ASMR的语气”,模型会据此调整输出效果。
另一种是场景意境描述,例如“旁白,语调惊恐,强调触摸到尸体般触感的恐怖”,模型会尝试演绎出相应的氛围。虽然作者实测认为部分指令效果未达预期,但这种精细化的控制方式,无疑指明了未来TTS技术的发展方向。
隐藏的体验入口
这两款新模型的入口藏得比较深,直接从火山引擎主页点击进入会跳转到旧版本。正确的路径是:先进入火山引擎主页,点击右上角的“控制台”并登录。然后在左侧产品列表中找到“智能语音交互”下的“豆包语音”,这里才能体验到最新的2.0版本模型。
尽管部分新功能的实际效果仍有提升空间,但AI语音模型在情感理解和可控性上的进步已十分显著。这项技术的快速迭代,预示着未来人机交互将更加自然和富有表现力。