十秒音频就能克隆你的声音,ElevenLabs 出新模型了

十秒音频就能克隆你的声音,ElevenLabs 出新模型了

2026-09-29 16:31:22 0点赞 1收藏 0评论

ElevenLabs 这周正式发了两个新语音模型,一个 v4,一个 v4 Turbo。主打的升级是情绪控制更细、响应延迟更低,还有支持的语言从 70 种拉到 90 多种。

对普通用户最震撼的,还是那句老卖点被加码了。官方说,用 v4 只要 10 秒的音频素材,就能完成一次声音克隆。上一代 v3 就有这能力,现在速度更快、还原更准,朗读长文时能一直稳住说话人的音色,还会记着上下文调语气。

十秒音频就能克隆你的声音,ElevenLabs 出新模型了

情绪标签也升级了。v3 那会儿引入了内联标签给声音定情绪,到了 v4,你可以叠好几个标签,模型按顺序执行。翻译过来就是,一段台词你能给它标出从平静到激动再到恳求的完整情绪线,AI 照着演。

这门生意现在挺挣钱。ElevenLabs 超过 55% 的收入来自大企业,靠的是企业语音通话和客服场景。v4 专门为语音智能体做了优化,后端大模型刚开始吐答案,v4 就能同步出声,还能处理争执、诉求升级、让用户等待这些真实通话里的麻烦情况。

公司的钱袋子也很鼓。今年早些时候从红杉拿到 5 亿美元(约合 ¥36 亿元)融资,估值冲到 110 亿美元(约合 ¥792 亿元),年化营收从年初约 3.3 亿美元(约合 ¥24 亿元)涨到 6 亿美元(约合 ¥43 亿元)以上,员工破了 800 人。CEO 还放话说未来几年要 IPO。

对普通用户,这轮更新的实际意义是,用语音合成做点内容的门槛又低了。配音、有声书、多语言视频,都能用一段自己的录音快速起底。但也得说,声音克隆越便宜,冒用风险越大,听到的「熟人语音」越来越不能光凭耳朵信了。

作者提示含AI生成内容。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松