今天(9月1日),"AI声音"这个圈子里同时出了两条大新闻。
第一条是技术党的好消息:BreezeBlue 开源了 Breeze TTS 2,一个 3.47B 参数的语音合成模型,把声音克隆、声音设计、自然语言控制语气三件事打包到一起,还能在文本里直接插入 [笑]、[咳嗽]、[叹气] 这类语气声。小红书更值得注意的是它的成绩单:按社区转发的 Artificial Analysis TTS Arena 榜单,Breeze TTS 2 以 1215 分排在第一位,压过了 Gemini 3.1 Flash TTS 等一众闭源模型。

第二条让不少配音人唏嘘:据南方都市报报道,入行6年的配音从业者被 AI 克隆偷走了声音,AI 声音泛滥之后,他本人的真人配音作品反而被平台算法判定成"AI生成"、被挡在流量池外,月收入从平均一万跌到不足五千。南方都市报同一时间,微博上还有用户在吐槽高德地图里自己爱听的导航语音变得"AI合成味很重"。
两条新闻放一起,就是 2026 年声音合成技术的现状:一边门槛塌方——主流开源模型都做到了"零样本克隆",3 秒音频就能复刻一个人的音色;一边边界收紧。2024 年 4 月全国首例"AI声音侵权案"判赔 25 万元。微博今年 4 月中国广播电视社会组织联合会演员委员会发声明,明确未经本人书面授权不得采集、使用、合成任何人的声纹。
对想自己做配音、克隆个声音做内容、或者纯粹想玩玩的朋友来说,现在既是最好的时候,也是最容易挑花眼的时候:CosyVoice、IndexTTS、FishAudio、ZipVoice……开源方案多到数不过来,官方资料一个比一个能打,生态甚至成熟到出现了把 CosyVoice 3、IndexTTS 2.5、GPT-SoVITS 这些引擎塞进同一个本地工作台的开源项目。小红书这周我把全网最近的实测和官方资料翻了一遍,结论很简单:看效果之前,先问自己三个问题。

今年都有什么牌?一张表摆清楚
方案 | 克隆门槛 | 硬件要求 | 授权 | 最适合 |
|---|---|---|---|---|
CosyVoice 2(阿里开源) | 3秒零样本 | 要求不高,以官方为准 | 社区版可免费商用 | 中文主力、流式场景 |
IndexTTS 2.5(B站开源) | 秒级零样本 | 最低8GB显存 | B站模型协议,个人免费 | 五语种、情感可控配音 |
Breeze TTS 2(今日发布) | 参考音频+自然语言设计 | 建议12GB显存起,fast path 24GB | 权重限研究及非商用 | 声音设计、实时交互 |
GPT-SoVITS(开源) | 参考音频+微调 | N卡,显存以官方为准 | WebUI 展示 MIT 声明 | 高相似度固定角色 |
FishAudio | 零样本 | 本地部署、数据不出域 | 以官方为准 | 13语言、多角色有声书 |
ZipVoice | 3秒参考音频 | 手机即可运行 | 开源 | 端侧小工具 |
在线平台/云服务 | 上传音频即用 | 无需显卡 | 商业服务 | 只想快速出配音 |
第一问:你手里是什么显卡?
开源语音模型先别聊"谁更强",得先聊"跑不跑得动",硬件门槛直接淘汰掉一大半选项:
没有独显、或不想折腾:别硬上开源。在线版按字符计费,一个月几十万字符也就十几块钱,比租 4090 按小时付费(约2.5元/小时)还忘关机要便宜得多。
8~12GB 的 N 卡:IndexTTS 2.5 或 CosyVoice 2。前者 8 月发布,支持中、英、日、西、阿五种语言的零样本克隆,官方评测中文说话人相似度 77.92。知乎它还能用"阴阳怪气""小心翼翼地开口"这种文字直接控制语气;后者流式首包约 1.5 秒,中文多音字处理扎实,社区版可免费商用。知乎
愿意花时间微调的:GPT-SoVITS 走"参考音频+微调"路线,它的 WebUI 把人声分离、音频切分、识别、标注、训练这些步骤打包到了一起,本地部署的门槛比想象中低。
24GB 显卡:可以上 Breeze TTS 2 的 fast path,或者 FishAudio,后者支持多角色对白编排,做多角色有声书、播客更合适。
Mac 用户:先泼盆冷水。有人把 IndexTTS 在 Apple M5 上实测了一周,RTF 8.4——生成 1 秒音频要 8.4 秒,比官方标称的 4090 成绩慢了约 40 倍。能跑,但只适合"先写好稿子一次性合成",不适合边调边听。
想在手机上跑:ZipVoice,3 秒参考音频、蒸馏后 4 步推理。按开发者实测,5 年前的中端机都能运行,但旗舰天玑 9500 合成 200 字也要约 30 秒。知乎适合做给自己听的小工具,离量产内容还远。

第二问:官方基准,能信几分?
记住一句话:官方基准都是有"条件"的。这个月就有两个现成的例子。
一是速度基准。IndexTTS 官方那个漂亮的 RTF 0.2,是 RTX 4090 上的成绩,换到 Apple M5 上实测是 8.4,差了 40 多倍。知乎Breeze TTS 2 官方资料里"首包延迟低于 40ms、RTF 约 0.32",也老老实实注明这是 H100 环境的数据,“不代表所有显卡都能达到相同表现”。小红书看到官方数字,先把它换算成你自己的硬件档位再说。

二是参数建议。有人实测 IndexTTS 一周后发现,官方 README 反复推荐打开情感参数 use_emo_text、把 emo_alpha 设成 0.6,但做旁白、口播这类自然叙述时,关掉反而更自然——那个参数更适合夸张情绪的段子,不适合"好好说话"。知乎2.5 的情感权重也有类似结论:社区实测 0.3~0.5 区间最自然,超过 0.7 容易演过头。知乎这种"官方资料与实测的落差"在开源模型上几乎不可避免,所以下载之前,值得花十分钟搜一篇真人实测。
第三问:授权开不开源?克隆的是谁的声音?
这是最容易翻车、也最贴近今天热搜的一步。
先说授权,“开源"两个字不等于"可自由商用”:CosyVoice 2 社区版可免费商用,是主流方案里最宽松的;IndexTTS 用的是 B 站自己的模型许可协议,并非标准 OSI 开源,个人免费没问题,商用要看条款;Breeze TTS 2 代码是 Apache 2.0,但官方明确写了权重、衍生模型和自托管输出仅限研究及非商业用途,商用需单独授权。小红书GPT-SoVITS 相对友好,它的 WebUI 首屏直接展示 MIT 开源声明;ChatTTS 对话场景很强,但协议同样偏严。

再说边界。技术是中性的,"克隆谁"不是。南都报道里有几个数字值得记住:广东全职专业配音从业者约 1200~1500 人,短视频、短剧、有声读物是侵权高发场景。南方都市报2024 年首例 AI 声音侵权案判赔 25 万元;今年 3 月广州互联网法院又判了一起用 AI 克隆主播声音做直播切片的案子,连带赔偿 2.5 万元。就在前几天,还有 80 多名英国演员联名致信英国政府,要求为个人声音立法确权。知乎翻译成工具用户能执行的建议就一句话:别人的声音别碰,除非拿到本人书面授权。克隆自己的声音做内容、用已获授权的音色,才是走得通的两条路。
四类人,一句话推荐
只想快速出配音:别部署,在线平台或云服务,十几块钱一个月买省心;
中文主力、有 8~12G N 卡:CosyVoice 2 或 IndexTTS 2.5,前者免费商用稳妥,后者语种多、情感控制强;
多语言、多角色、有 24G 卡:FishAudio,或者体验 Breeze TTS 2 的声音设计(注意非商用限制);
数据不能出域的隐私敏感场景:本地部署不是备选而是首选,按显卡对号入座。
值得继续盯的三件事
一是 Breeze TTS 2 的商业授权动向,官方如果开放商用,这个"开源权重+闭源级效果"的模型价值会翻倍;二是 CosyVoice 3 的进展——社区实测已经把 0.5B 版本跑在 6GB 显存的卡上、速度超 200 字/分钟,集成工作台也开始内置它,中文开源 TTS 的格局可能很快重排。小红书三是平台侧的 AI 内容识别与标注规则——今天南都报道里已经有真人配音被算法误伤的案例,对用 AI 配音做内容的人同样重要。
声音克隆从来没有像今天这么便宜,也因为这样,"用得对"的成本从来没有像今天这么高。先看显卡,再读授权,再决定克隆谁——这个顺序不会错。