当前位置:
AIGC文章详情

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

源自28位全网作者

09-02 05:33

今天(9月1日),"AI声音"这个圈子里同时出了两条大新闻。

第一条是技术党的好消息:BreezeBlue 开源了 Breeze TTS 2,一个 3.47B 参数的语音合成模型,把声音克隆、声音设计、自然语言控制语气三件事打包到一起,还能在文本里直接插入 [笑]、[咳嗽]、[叹气] 这类语气声。小红书更值得注意的是它的成绩单:按社区转发的 Artificial Analysis TTS Arena 榜单,Breeze TTS 2 以 1215 分排在第一位,压过了 Gemini 3.1 Flash TTS 等一众闭源模型。

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

第二条让不少配音人唏嘘:据南方都市报报道,入行6年的配音从业者被 AI 克隆偷走了声音,AI 声音泛滥之后,他本人的真人配音作品反而被平台算法判定成"AI生成"、被挡在流量池外,月收入从平均一万跌到不足五千。南方都市报同一时间,微博上还有用户在吐槽高德地图里自己爱听的导航语音变得"AI合成味很重"。

两条新闻放一起,就是 2026 年声音合成技术的现状:一边门槛塌方——主流开源模型都做到了"零样本克隆",3 秒音频就能复刻一个人的音色;一边边界收紧。2024 年 4 月全国首例"AI声音侵权案"判赔 25 万元。微博今年 4 月中国广播电视社会组织联合会演员委员会发声明,明确未经本人书面授权不得采集、使用、合成任何人的声纹。

对想自己做配音、克隆个声音做内容、或者纯粹想玩玩的朋友来说,现在既是最好的时候,也是最容易挑花眼的时候:CosyVoice、IndexTTS、FishAudio、ZipVoice……开源方案多到数不过来,官方资料一个比一个能打,生态甚至成熟到出现了把 CosyVoice 3、IndexTTS 2.5、GPT-SoVITS 这些引擎塞进同一个本地工作台的开源项目。小红书这周我把全网最近的实测和官方资料翻了一遍,结论很简单:看效果之前,先问自己三个问题。

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

今年都有什么牌?一张表摆清楚

方案

克隆门槛

硬件要求

授权

最适合

CosyVoice 2(阿里开源)

3秒零样本

要求不高,以官方为准

社区版可免费商用

中文主力、流式场景

IndexTTS 2.5(B站开源)

秒级零样本

最低8GB显存

B站模型协议,个人免费

五语种、情感可控配音

Breeze TTS 2(今日发布)

参考音频+自然语言设计

建议12GB显存起,fast path 24GB

权重限研究及非商用

声音设计、实时交互

GPT-SoVITS(开源)

参考音频+微调

N卡,显存以官方为准

WebUI 展示 MIT 声明

高相似度固定角色

FishAudio

零样本

本地部署、数据不出域

以官方为准

13语言、多角色有声书

ZipVoice

3秒参考音频

手机即可运行

开源

端侧小工具

在线平台/云服务

上传音频即用

无需显卡

商业服务

只想快速出配音

第一问:你手里是什么显卡?

开源语音模型先别聊"谁更强",得先聊"跑不跑得动",硬件门槛直接淘汰掉一大半选项:

  • 没有独显、或不想折腾:别硬上开源。在线版按字符计费,一个月几十万字符也就十几块钱,比租 4090 按小时付费(约2.5元/小时)还忘关机要便宜得多。

  • 8~12GB 的 N 卡:IndexTTS 2.5 或 CosyVoice 2。前者 8 月发布,支持中、英、日、西、阿五种语言的零样本克隆,官方评测中文说话人相似度 77.92。知乎它还能用"阴阳怪气""小心翼翼地开口"这种文字直接控制语气;后者流式首包约 1.5 秒,中文多音字处理扎实,社区版可免费商用。知乎

  • 愿意花时间微调的:GPT-SoVITS 走"参考音频+微调"路线,它的 WebUI 把人声分离、音频切分、识别、标注、训练这些步骤打包到了一起,本地部署的门槛比想象中低。

  • 24GB 显卡:可以上 Breeze TTS 2 的 fast path,或者 FishAudio,后者支持多角色对白编排,做多角色有声书、播客更合适。

  • Mac 用户:先泼盆冷水。有人把 IndexTTS 在 Apple M5 上实测了一周,RTF 8.4——生成 1 秒音频要 8.4 秒,比官方标称的 4090 成绩慢了约 40 倍。能跑,但只适合"先写好稿子一次性合成",不适合边调边听。

  • 想在手机上跑:ZipVoice,3 秒参考音频、蒸馏后 4 步推理。按开发者实测,5 年前的中端机都能运行,但旗舰天玑 9500 合成 200 字也要约 30 秒。知乎适合做给自己听的小工具,离量产内容还远。

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

第二问:官方基准,能信几分?

记住一句话:官方基准都是有"条件"的。这个月就有两个现成的例子。

一是速度基准。IndexTTS 官方那个漂亮的 RTF 0.2,是 RTX 4090 上的成绩,换到 Apple M5 上实测是 8.4,差了 40 多倍。知乎Breeze TTS 2 官方资料里"首包延迟低于 40ms、RTF 约 0.32",也老老实实注明这是 H100 环境的数据,“不代表所有显卡都能达到相同表现”。小红书看到官方数字,先把它换算成你自己的硬件档位再说。

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

二是参数建议。有人实测 IndexTTS 一周后发现,官方 README 反复推荐打开情感参数 use_emo_text、把 emo_alpha 设成 0.6,但做旁白、口播这类自然叙述时,关掉反而更自然——那个参数更适合夸张情绪的段子,不适合"好好说话"。知乎2.5 的情感权重也有类似结论:社区实测 0.3~0.5 区间最自然,超过 0.7 容易演过头。知乎这种"官方资料与实测的落差"在开源模型上几乎不可避免,所以下载之前,值得花十分钟搜一篇真人实测。

第三问:授权开不开源?克隆的是谁的声音?

这是最容易翻车、也最贴近今天热搜的一步。

先说授权,“开源"两个字不等于"可自由商用”:CosyVoice 2 社区版可免费商用,是主流方案里最宽松的;IndexTTS 用的是 B 站自己的模型许可协议,并非标准 OSI 开源,个人免费没问题,商用要看条款;Breeze TTS 2 代码是 Apache 2.0,但官方明确写了权重、衍生模型和自托管输出仅限研究及非商业用途,商用需单独授权。小红书GPT-SoVITS 相对友好,它的 WebUI 首屏直接展示 MIT 开源声明;ChatTTS 对话场景很强,但协议同样偏严。

Breeze TTS 2 今天发布即登顶:开源声音克隆进入“选择过多”时代,装之前先看显卡、授权和官方基准

再说边界。技术是中性的,"克隆谁"不是。南都报道里有几个数字值得记住:广东全职专业配音从业者约 1200~1500 人,短视频、短剧、有声读物是侵权高发场景。南方都市报2024 年首例 AI 声音侵权案判赔 25 万元;今年 3 月广州互联网法院又判了一起用 AI 克隆主播声音做直播切片的案子,连带赔偿 2.5 万元。就在前几天,还有 80 多名英国演员联名致信英国政府,要求为个人声音立法确权。知乎翻译成工具用户能执行的建议就一句话:别人的声音别碰,除非拿到本人书面授权。克隆自己的声音做内容、用已获授权的音色,才是走得通的两条路。

四类人,一句话推荐

  1. 只想快速出配音:别部署,在线平台或云服务,十几块钱一个月买省心;

  2. 中文主力、有 8~12G N 卡:CosyVoice 2 或 IndexTTS 2.5,前者免费商用稳妥,后者语种多、情感控制强;

  3. 多语言、多角色、有 24G 卡:FishAudio,或者体验 Breeze TTS 2 的声音设计(注意非商用限制);

  4. 数据不能出域的隐私敏感场景:本地部署不是备选而是首选,按显卡对号入座。

值得继续盯的三件事

一是 Breeze TTS 2 的商业授权动向,官方如果开放商用,这个"开源权重+闭源级效果"的模型价值会翻倍;二是 CosyVoice 3 的进展——社区实测已经把 0.5B 版本跑在 6GB 显存的卡上、速度超 200 字/分钟,集成工作台也开始内置它,中文开源 TTS 的格局可能很快重排。小红书三是平台侧的 AI 内容识别与标注规则——今天南都报道里已经有真人配音被算法误伤的案例,对用 AI 配音做内容的人同样重要。

声音克隆从来没有像今天这么便宜,也因为这样,"用得对"的成本从来没有像今天这么高。先看显卡,再读授权,再决定克隆谁——这个顺序不会错。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章