这两天刷B站、知乎和小红书,AI声音合成圈几乎被同一个名字刷屏:FireRedTTS3。小红书FireRed团队8月13日开源。GitHub不到两周,B站已经有人发一键整合包,知乎冒出一堆技术解读,小红书出现了"一个造声音一个驯声音,两套开源TTS怎么选"这样的对比帖。
它火的原因不复杂:一个模型把声音克隆、音色设计、语音编辑三件事打包了。小红书给几秒参考音频,它能用这个音色说24种语言、21种中文方言。知乎给一句文字描述(比如"年轻女性的温柔嗓音,语速稍慢,带一点俏皮"),它能凭空造出一个新音色;给一段现成录音,它能只改你指定的词,其余部分音色不动。协议是Apache 2.0,HuggingFace和ModelScope都能下载。GitHub看起来是"开源TTS天花板"的标准剧本。

成绩单:加粗的部分确实能打
先看官方在GitHub README里放的四张评测表。
零样本克隆的标杆测试Seed-TTS-eval上,FireRedTTS3-Base拿下平均字错率3.04%、说话人相似度78.8,两项都是第一。知乎24种语言的MiniMax-MLS-Test上更夸张:平均字错率3.75%、相似度84.8,还是双第一,24种语言里有22种的相似度排进前二。同榜的ElevenLabs,平均字错率10.95%、相似度65.5——被甩开一个身位。GitHub

指令控制的声音设计评测InstructTTSEval上,Instruct版在中英文的声学参数、风格描述、角色扮演三类任务全部最佳,排在它后面的是Qwen3-TTS-VD。GitHub语音编辑榜上,它对现有录音的替换、删除、调速、变调,大部分指标也领先对比对象Ming-UniAudio-Edit。
训练规模也撑得起这个成绩:连续语音表示RedAE用了50万小时音频、32张H800训了55万步。知乎技术路线一句话概括:把语义信息在tokenizer训练阶段就注入连续表示,不额外加语义模块,用简单架构换误差累积的缓解。
到这儿为止,是通稿会讲的部分。
没加粗的部分:三个值得注意的短板
同一张MiniMax-MLS-Test表,逐语言看就不一样了:
粤语字错率40.32,排在Minimax(34.11)和FishAudio S2(30.67)后面。21种方言是它的招牌,但粤语恰好是榜单上的弱项。GitHub
法语字错率5.28,而FishAudio S2是3.05;英语2.12,dots.tts只有1.06。
它赢在"覆盖广、音色还原高",不是"每种语言都第一"。

Seed-TTS-eval榜上还有个细节:排在第二的dots.tts,平均3.14%/78.7,跟FireRedTTS3的差距只有0.1个百分点。GitHub有意思的是,B站评论区有人点破"dots.tts和FireRed都是小红书的团队",盲测视频的UP主回了句"是的,没错。内部的不同团队"——如果属实,这波开源浪潮里小红书是自己跟自己卷。哔哩哔哩
社区实测的声音也比榜单更具体。B站UP主"懂点AI的H先生"把IndexTTS 2.5、FireRedTTS3、dots.tts三个模型匿名成A、B、C做长音频克隆盲测。哔哩哔哩评论区打分相当接近:“B 90分,A 85分,C 50分”“A≈B>C”,有人觉得B"每句话重点都在关键词上,语气自然",也有人嫌A"有点AI味"。答案要等下期视频揭晓——但至少说明,第一梯队的差距没有榜单看起来那么大。
吐槽集中在三个地方:
显存门槛。官方README没写显存要求,发整合包的UP主在评论区答疑:2060的12G显存版可以,6G的不行。哔哩哔哩小显存党心里先有个数。
语音编辑没那么神。有用户在发布视频下反馈,演示里的替换操作"把后面的几个字也弄乱了";官方文档也写明,调速、变调这类声学编辑必须套用固定指令模板,自由表述不生效。GitHub
跨语种克隆的相似度存疑。评论区有人直言"把英语参考换成法语输出,这两种语言太相似了",参考价值有限。知乎的技术分析也泼了冷水:论文缺少移除语义蒸馏的消融实验,长文本的漂移曲线没给。知乎

到底换不换:按场景分四档
把官方数据和社区信号摆在一起,我的判断是这样:
值得第一时间折腾的:做方言内容的人。21种中文方言(四川话、上海话、温州话、闽南语、陕西话……)的零样本克隆,目前是独一份能力。GitHub做本地化内容、给家里长辈做语音内容的,值得为这个功能跑一趟。另外是需要多语言数字人、或者经常要返修录音(改词不重录)的创作者,Instruct版的设计/编辑能力正好对口。前提是显存往12G靠。
可以再等等的:6G左右显存的机器别硬上,IndexTTS 2.5官方推理口径约6GB,按B站评论区的说法是0.8B的小模型。小红书哔哩哔哩角色配音、情绪和读音控制更细,小红书对比帖给它的定位是"驯声音",跟FireRedTTS3"造声音"不是一个赛道。另外,如果你主要做英文内容,dots.tts的英文字错率1.06%更低。GitHub可以等盲测视频揭晓答案再决定。
完全不用动的:现有流程跑CosyVoice、GPT-SoVITS没遇到瓶颈的。这次榜单第一和第三的差距在0.1%量级,换模型省不出你调工作流的时间。
一条红线提醒:官方免责声明写得很清楚,零样本克隆仅限学术研究用途,禁止用于任何非法场景。GitHub克隆真人声音的边界,参考这个兴趣下之前聊过的侵权案例,这里不展开。
接下来值得盯的三个信号
盲测UP主的下期答案揭晓,以及评论区提到的"仙宫云"等云端部署方案是否跟上——12G门槛会把大量需求推向云部署。
长文本稳定性。目前官方没给漂移曲线,社区也还没有大规模长音频实测,这是它离"生产力工具"最近的短板。
整合包生态。v20260824版刚出,部署门槛降得很快,但第三方网盘分发的整合包安全性自己把关。
开源TTS今年的节奏明显变了:上半年还在卷克隆像不像,下半年已经开始卷"能不能编辑、能不能控制"。FireRedTTS3是这条线上的第一个统一模型,成绩单够硬,但值不值得你的显卡,取决于你的场景在不在它的强项区间里。