十秒音频就能克隆你的声音,ElevenLabs 出新模型了
ElevenLabs 这周正式发了两个新语音模型,一个 v4,一个 v4 Turbo。主打的升级是情绪控制更细、响应延迟更低,还有支持的语言从 70 种拉到 90 多种。
对普通用户最震撼的,还是那句老卖点被加码了。官方说,用 v4 只要 10 秒的音频素材,就能完成一次声音克隆。上一代 v3 就有这能力,现在速度更快、还原更准,朗读长文时能一直稳住说话人的音色,还会记着上下文调语气。

情绪标签也升级了。v3 那会儿引入了内联标签给声音定情绪,到了 v4,你可以叠好几个标签,模型按顺序执行。翻译过来就是,一段台词你能给它标出从平静到激动再到恳求的完整情绪线,AI 照着演。
这门生意现在挺挣钱。ElevenLabs 超过 55% 的收入来自大企业,靠的是企业语音通话和客服场景。v4 专门为语音智能体做了优化,后端大模型刚开始吐答案,v4 就能同步出声,还能处理争执、诉求升级、让用户等待这些真实通话里的麻烦情况。
公司的钱袋子也很鼓。今年早些时候从红杉拿到 5 亿美元(约合 ¥36 亿元)融资,估值冲到 110 亿美元(约合 ¥792 亿元),年化营收从年初约 3.3 亿美元(约合 ¥24 亿元)涨到 6 亿美元(约合 ¥43 亿元)以上,员工破了 800 人。CEO 还放话说未来几年要 IPO。
对普通用户,这轮更新的实际意义是,用语音合成做点内容的门槛又低了。配音、有声书、多语言视频,都能用一段自己的录音快速起底。但也得说,声音克隆越便宜,冒用风险越大,听到的「熟人语音」越来越不能光凭耳朵信了。
作者提示含AI生成内容。
