小红书的FireRedTTS3开源5天:四项基准登顶,社区却先泼了三盆冷水,下载前先把显存账算清

源自206位全网作者

08:03

8月的开源语音合成圈,有点热闹过头了。

先是8月10日,B站的IndexTTS团队开源了IndexTTS 2.5,补齐了多语种和情感控制的短板。紧接着8月21-22日,小红书FireRed团队又开源了FireRedTTS3——这个更狠,号称一个模型把三件事全干了:声音克隆、声音设计、语音编辑,还支持24种语言、21种中文方言。知乎有个细节挺有意思:按B站博主扒出来的信息,小红书其实养着两支TTS队伍,FireRedTTS3出自FireRed团队,之前的dots.tts也是小红书的,是内部另一个团队。哔哩哔哩大厂在同一赛道摆两个模型,你就知道这赛道现在有多卷。

但先别急着下载。这一轮我把官方基准、B站实测评论、知乎技术评测都翻了一遍,发现"纸面成绩"和"社区体感"之间,隔着不小的距离。下载之前,这三盆冷水值得先看完。

先看FireRedTTS3到底强在哪

官方的卖点确实能打,核心是"一个模型、三种玩法":

声音克隆:给几秒钟参考音频,就能用这个音色说话。它支持24种语言加21种中文方言,而且官方建议参考音频和目标语种保持一致——合成四川话就喂四川话参考音频,因为输出会继承参考音频的说话风格。

声音设计:不给参考音频,直接用一句自然语言描述,凭空生成一个此前不存在的音色。这是它和大多数TTS拉开差距的地方。

语音编辑:在一段已经生成好的语音上,只改指定的词或语速,其余部分和音色保持不变。指令有固定模板:语速是adjust the speed to X(0.5到2.0),音高是shift the pitch by N steps(±6),音量同理。

基准成绩也确实登顶:在Seed-TTS-Eval(中英文零样本克隆)上拿到最低字错率3.04%、最高相似度78.8%;在覆盖24种语言的MiniMax-MLS-Test上,平均字错率3.75%、相似度84.8%,其中22/24种语言的相似度排第一或第二。知乎声音设计的InstructTTSEval和语音编辑的Ming榜单,也基本都领先。

小红书的FireRedTTS3开源5天:四项基准登顶,社区却先泼了三盆冷水,下载前先把显存账算清

第一盆冷水:基准登顶,听感未必拉开

B站有位UP主做了个匿名盲测,把IndexTTS 2.5、FireRedTTS3、dots.tts三个模型放一起,克隆同一段长音频,让大家猜哪个是哪个。哔哩哔哩评论区的打分大致是"B(90分)≈A(85分)>C(50分)",普遍反馈是前两名听着差不多,第三名用力过猛。

关键在于:UP主到现在还没公布A、B、C分别对应哪个模型,要靠下期揭晓。换句话说,连弹幕里的"金耳朵"们,都没法稳定分辨这几个头部开源模型的差距。

这说明一个反常识的点:这一代头部开源TTS之间,盲听差距可能远小于基准表上的差距。奔着"基准第一"去下载,未必能听出第一在哪。

第二盆冷水:最差异化的"语音编辑",官方演示就翻了车

语音编辑是FireRedTTS3最有辨识度的卖点,但演示视频下面有条扎眼的评论,说演示里的语音编辑已经失败了,替换成“最有意思”之后,反而把后面的几个字也弄乱了。哔哩哔哩核心卖点在自家演示里就没跑稳,这个能力到底实不实用,得打个问号。想冲着“像改文档一样改语音”去的人,建议先把预期降下来。

第三盆冷水:技术层面的"稳定性"证据还不够

知乎上有篇技术评测提了个更深的质疑:FireRedTTS3靠一个叫"语义教师"的机制,把语义信息提前注入语音表示,宣称能缓解连续自回归的误差累积。官方给出的RedAE架构图里,这个"语义教师"就是左侧被冻结的Audio Encoder。

小红书的FireRedTTS3开源5天:四项基准登顶,社区却先泼了三盆冷水,下载前先把显存账算清

但问题是,论文既没给出"移除语义蒸馏后、同结构"的消融实验,也没给长文本的漂移曲线。知乎翻译成人话:官方说"我这样设计所以更稳",但证明"更稳"的关键对照实验目前是缺的。短文本可能听不出问题,拿它配长音频、有声书之前,这点要心里有数。

另外评论区也有人质疑跨语种克隆:"不知道跨语种时还像不像。"演示里用的是英语参考音频配法语输出,这俩语言本来就接近;中英这种跨度大的组合,相似度到底掉多少,还没见靠谱的实测。

下载之前,先算这笔显存账

对本地部署党来说,比"效果好不好"更现实的问题是"我显卡带不带得动"。把最近热门的开源TTS显存门槛拉个表(来自社区实测口径):

  • IndexTTS 2.0:6G显存能跑,中文克隆的口碑基本盘

  • IndexTTS 2.5:最低8G,官方推荐4090,多了5语种和情感文本控制。知乎

  • FireRedTTS3:需要12G显存档位,评论区明确反馈“12g显存版可以,6g的不行”。哔哩哔哩有人在演示视频下问“2060卡能用吗”,得到这个回复并不意外——2060有6G和12G两种,没有12G显存,FireRedTTS3大概率跑不顺。

所以决策顺序其实很清楚:先看自己显卡,再谈选哪个模型。

好消息是生态跟得很快。B站已经有人放出了FireRedTTS3的整合包和便携版,网盘链接都备好了,解压即用的路子已经有人在铺。哔哩哔哩要是完全不想折腾显卡,IndexTTS 2.5也已经被indextts.xin、LipVoice这类在线平台接入,注册就能试,按字符计费,个人用量一个月也就几块钱。知乎先用在线版验证需求,再决定要不要本地部署,是更稳的路径。

还有一个本地部署党关心的:许可证。官方GitHub仓库标注FireRedTTS3采用Apache 2.0开源许可证,属于商用友好度较高的一类,代码和权重本身的门槛不高。GitHub但要说清楚:许可证管的是模型本身,克隆的音色仍然得是自己或明确获得授权的,这条红线不因选哪个模型而改变。

按场景选,别问"哪个最强"

与其纠结谁基准第一,不如对号入座:

  • 只做中文短视频、口播、解说:IndexTTS 2.0/2.5就够了。生态最成熟,6-8G显存门槛低,2.5还修掉了强情绪下音色飘的老毛病。

  • 有多语种或方言需求:FireRedTTS3的语言覆盖(24语+21方言)明显比IndexTTS 2.5(5语种)宽,但要做好12G显存的心理准备。知乎

  • 想"凭空造音色"或者"改已有语音的个别词":目前只有FireRedTTS3的Instruct版本能做,但编辑能力的稳定性还没被社区验证,别抱太高预期。

  • 不想折腾部署、或显卡不够:直接上在线平台试,验证完需求再说。

  • 拿不准就再等等:其实不丢人。盲测答案没揭晓、编辑能力没实测、FireRedTTS3刚开源没几天,整合包和优化都还在陆续放出,晚一两周上车不亏。

小红书的FireRedTTS3开源5天:四项基准登顶,社区却先泼了三盆冷水,下载前先把显存账算清

接下来值得盯的信号

一是那个匿名盲测揭晓答案,能验证FireRedTTS3的听感到底压没压过IndexTTS 2.5;二是语音编辑能力能不能过社区实测这一关,这是它最大的卖点也是最大的不确定;三是会不会出现8G/6G显卡能跑的量化版、移植版;四是小红书这两支TTS队伍后续还放不放新版本。

一句话收尾:FireRedTTS3基准确实强、能力确实全,但听感没明显甩开、编辑还不稳、还吃12G显存。显卡到位又想要多语种或语音编辑的,值得一试;只做中文配音的,IndexTTS 2.5够用,不用急着换。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章