8月14日,AI语音合成圈出了件值得记一笔的事:上海交大系团队宇生月伴(VUI Labs)自研的Luna-TTS,登上了Hugging Face TTS Arena V2的Rating总榜第一,把此前一直被视为国际标杆的ElevenLabs、Cartesia、Hume都甩在了身后;在另一张权威榜单Artificial Analysis上,它也以1220的Elo分位列全球第三,超过了谷歌。微博知乎

有意思的是这两张榜的规则:TTS Arena会把同一段文字交给两个匿名模型生成,用户盲听之后投票选更好听的那段;Artificial Analysis同样靠真人成对盲听打分。不比论文参数,比的是人耳——等于把全球模型拉进考场,让听众直接阅卷。知乎Luna-TTS的卖点恰好是情绪可控:给台词指定情绪,语调、停顿和呼吸感就跟着情绪走,真人盲听的榜首成绩和这点直接相关。

但反差也在这儿。
模型榜单刷了纪录,可你走进短视频和AI漫剧创作者的圈子子里,吐槽最多的还是同一件事:AI配音一股客服念稿味。小红书上一篇讲AI漫剧"音频有噪音、语调机械感"该怎么优化的经验帖,几天攒了一千五百多个赞;B站上"AI漫剧零基础教程"一天能发几十条,配音全是必修环节;知乎上隔三差五就有人问"为什么我的配音总听着假"。用一位创作者的原话说:AI一开口,那股客服念稿的味儿一出来,视频质感直接砍一半。小红书
模型越来越强,为什么你的配音还是机械?
先说结论:2026年,AI配音的门槛已经从"模型行不行"变成了"选得对不对、用得对不对"。
社区实测下来,机械感的根源主要是三个:
第一,引擎在把字幕当纯文本读。知乎上有个被反复引用的判断:大部分机械感来自同一个问题——TTS引擎把字幕当纯文本读,没有上下文,没有情绪起伏,每句话语速一样。知乎这种时候哪怕音色和真人一模一样,语速没有任何停顿变化,听几秒还是觉得假。
第二,"多余的东西"被删掉了。真人说话的活人感,恰恰藏在那些看似没用的细节里:换气、停顿、句尾力度的收放。很多合成声音字全保住了,却把这些删干净了,于是音质很好、听着塑料。知乎
第三,音色和场景错配。用播音腔配漫剧、用萌音讲财经,字是对的,违和感拉满。

这也解释了为什么追榜单对你的配音问题帮助有限:盲听榜考的是短文本自然度,而你面对的是长文本叙事、多角色对话、方言和情绪,根本不是同一张卷子。
那2026年8月这个时间点,到底该怎么选?
我把知乎实测、小红书工作流、B站创作者在用的方案做了个交叉汇总。先说原则:现在AI配音没有"最好",只有"最适合你的场景"。知乎按场景对号入座:
做出海、多语言内容,看IndexTTS 2.5。B站团队刚开源不久,中英日西阿五种语言,中文字错率约1.1%(官方论文数据),最难得的是外语也能带情绪,不是干念。短板是方言不是它的主场。
做中文情感、长文本有声内容,看MiniMax(海螺)。商业工具里中文情感表达的第一梯队,支持粤语等方言,擅长带呼吸感的长文本,B站不少AI短剧的配音直接点名用它。注意它的声音克隆功能主要在海外版,需要克隆的话要确认入口。
要方言,看阿里开源的CosyVoice系列。9种语言、18种以上方言,免费商用,情绪和语速还能分开控制。
想凭空造一个不存在的声音,看清华面壁开源的VoxCPM。独门能力是"声音设计":不用参考录音,文字描述一句"低沉磁性男中音"就能造出全新音色,做虚拟主播、游戏角色的会很需要。
二次元、AI翻唱,看Fish Audio,能插入笑声、哭声这类非语言声音,动漫翻唱绕不开它。
纯英文内容,ElevenLabs依然是自然度的国际标杆,但收费、对网络有要求,中文多音字和方言偏弱。
这里必须提醒一个坑:知乎和小红书上搜"配音工具推荐",软文浓度非常高。我这周翻下来,相当一部分所谓测评是软文广告——特征很统一:全文只推一个产品、从头到尾不提短板、结尾附一个没听过的域名。上面这份清单里的每一项,我都只保留了有多源交叉印证的工具,单源吹上天的那种直接滤掉了。
成本方面,有句话值得划重点:先在线免费试到满意,再考虑本地部署,顺序别反。
开源模型大多有在线体验入口,浏览器直接试,多数带免费额度。确认适合自己的场景了、量确实大了,再算本地部署的账——像GPT-SoVITS这类项目,8G显存的N卡起步,还得会配Python环境,有知乎用户的原话很扎心:配环境那天,可能比你用它配音的时间还长。知乎也有人把这条路走成了集成方案:GitHub上4.4万星的开源项目Voicebox,把声音克隆、语音生成、音频编辑等功能整合进了同一个桌面应用。小红书整个流程可以在本地运行,想换音色、换引擎不用重装环境。

还有一个容易被忽略的风险:小平台可能说没就没。最近声音克隆工具noiz关停,知乎评论区一堆用户忙着找替代品。知乎所以工具选型时,预付费、把工作流深度绑定之前,优先大平台和开源模型,别把资产押在小众工具上。
最后留几个值得继续盯的信号:
榜单还会变。今天的第一未必是下个月的第一——8月24日又有个0.6B参数的小模型Audio8-TTS发了预览版,支持中英粤等11种语言的零样本克隆。微博这个迭代速度意味着:别为"当前最强"充年费。
盯住头部模型的API开放进度。Luna-TTS这类登顶模型一旦开放调用,值得第一时间用免费额度试试自己的真实文案。
选工具就记三条标准:发音准不准(字错率)、宣传的能力能不能真兑现(比如"外语能带情绪",就真生成一段悲伤的日语听听)、上手成本多少(要不要显卡、有没有免费额度)。知乎
模型能力已经不是瓶颈,你的场景和用法才是。