Fish Audio 配音最难的地方,不是声音不像,而是"像但没灵魂"。社区里最常见的抱怨是这样的:参考音频丢进去,生成出来"技术上是像的",就是没有活人味儿,再试一次换了个味儿,再试几次情绪直接跑偏——大家管这个叫"抽卡"。
我把官方发布、知乎上的技术拆解、B站和小红书的实操帖翻了一遍,发现一个反常识的结论:S2.1 Pro 的"人味儿"其实不是抽出来的,是你自己写出来的——写在括号里。这篇把机制、实操、多角色玩法和场景选型一次讲清楚,最后还有一个和今天有关的时间窗口提醒。
一、人味儿藏在括号里:不是玄学,是机制
先说为什么以前要抽卡。传统 TTS 的情绪控制要么靠固定参数,要么靠随机种子碰运气。S2.1 Pro 换了个思路:把情绪控制直接写进文本里,用方括号标签表达,而且这些括号文字在模型眼里不是特殊指令码,是当普通文本一起参与生成的,官方称支持的标签类型超过 15000 种,而且是自由形式的,不是固定标签集,想到什么写什么。知乎知乎
官方给这代模型的关键指标是:首帧音频延迟约 90 毫秒、5 秒参考音频完成声音克隆、支持 83 种语言、情绪控制做到词级——同一句话前半句平静、后半句激动,可以分别标注。知乎

支撑这套能力的是 Dual-AR 架构:一个 4B 参数的慢速自回归主干负责语义和韵律的大方向,一个 400M 参数的快速自回归模块快速填充声学细节,既管"说什么",也管"怎么说"。哔哩哔哩
但要泼一盆冷水:无论是"训练数据超 1000 万小时",还是 Seed-TTS 评估集上 WER 0.77、低于同口径公布的 Qwen3-TTS 的 1.24,都是官方自报口径,第三方没有独立验证过,而且这是上一代 S2-Pro 的数据。知乎方向上"括号控情绪"这条路是成立的,但具体到你的音色、你的文本,效果要自己测,别直接拿跑分当采购依据。
二、三条实操经验:把"抽卡"变成"调参"
社区里真正做出稳定产出的人,经验基本收敛在这三件事上。
第一,音色定下限,标签定上限。5 秒克隆样本的质量比什么都重要:干净、无混响、且本身就带目标情绪的人声,生成结果的"人味儿"上限明显更高。用一段平铺直叙的干声,配再多情绪标签也救不回来。
第二,标签要写具体动作,不要写抽象形容。官方给的示例就是走"具体"路线的:[whisper in small voice] 小声耳语、[professional broadcast tone] 专业播音腔、[pitch up] 提高音调、[laughing] 笑声。知乎中文场景同理,[悲伤] 不如 [声音发颤、语速放慢地说],[开心] 不如 [忍不住笑出声地接话]。
第三,标签可以让大模型帮你写。LiveKit 等实时语音平台已经上线了基于 Fish Audio S2.1 Pro 的表现力模式,思路就是把对话上下文交给 LLM,由它把情感内联写进台词,再送进 TTS 渲染。微博自己做内容时完全可以复刻这个流程:把分镜台词丢给任意一个大模型,要求"为每句台词补一个括号情绪标签",比手写快得多,一致性也更好。

但也别指望标签包治百病。社区实测的共识是:标签解决的是"情绪方向",节奏和气息仍然吃参考音频;遇到长句情绪断裂,优先考虑断句,而不是加更长的标签。
三、多角色与长文本:别再一句一句拼了
做剧情类内容的人最痛苦的是多角色:以前只能每个角色单独生成、再手动拼接,语气割裂、节奏对不上。S2 系列原生支持多说话人,用 <|speaker:i|> 这类角色标记把对白写进同一段文本,一次生成里就能完成多个角色的交替发言。ttps://zhuanlan.zhihu.com/p/2015108634640688144" data-quote-text="多说话人:上传包含多个说话人的参考音频,模型通过 <|speaker:i|> token 处理。单次生成可以包含多个说话人" data-highlight-text="模型通过 <|speaker:i|> token 处理">知乎

实操层面,B站一个收藏量 2000+ 的做法值得抄:直接把 srt 字幕文件当台词本,配合多角色配音批量生成,再按时间轴回填,把"配音"变成"编辑字幕"。哔哩哔哩这对做解说、短剧、播客分轨的人来说效率提升是量级性的。长文本再记住一条:按语义段落分段生成,比硬塞一万字给模型更稳,断点放在段落之间听感最自然。
四、四类场景适配,以及什么时候该换工具
按社区的实际用法,Fish Audio 最值的是四类场景:短视频口播,5 秒克隆加情绪标签,出片快;出海多语言,同一套卖点要中英日三语各来一版,而且听起来得是同一个人在说,已经有跨境玩家在用它跑通了三语同音色。知乎实时对话,90 毫秒首帧延迟就是冲着语音 Agent 场景去的;角色试音,想探索不同音色、给角色找声音的人,它也常被列入首选梯队。小红书
但要说清楚什么时候它不是最优解:要大批量免费跑量,Qwen3-TTS 有百万字符级免费额度;要超长篇内容,MiniMax 单次最多 20 万字符长文本,ElevenLabs 支持单次约 40 分钟量级的长音频。微博要完全本地私有化,S2 模型的权重、训练代码和推理引擎均以 Apache 2.0 协议开源。知乎4B 版本在社区眼里属于"可用级"的开源选择,模型已上架 ModelScope,可以搭配 IndexTTS-2、VibeVoice 一起评估。微博
这条开源赛道还在加速:8 月 24 日,又一个受 Fish Audio 架构启发的开源模型 Audio8-TTS 发布预览版,0.6B 参数主打轻量实时,小模型也能跑端侧部署。微博不想自己折腾环境的,国内云平台已有一键部署镜像,把这类玩法做成整合包的教程也已经跑通。哔哩哔哩

五、时间窗口提醒,和三条避坑
最后说一个和"现在"有关的事:Fish Audio 在 7 月 28 日公司一周年时发布了 S2.1 Pro,同时宣布向用户免费开放一个月 S2.1 Pro 体验资格——按发布时间算,这两天就到期了,想完整体验的抓紧。错过了也不用慌,官方还有 s2.1-pro-free 模型,与正式版完全相同的质量,在合理使用限制下免费,适合测试、原型开发和小体量产出,日常试用够用。知乎API 正式价格折合约每 12 小时音频 15 美元的量级,按量计费即可,不必预付。
三条避坑收尾。一,克隆他人声音必须拿到授权,发布内容按规定做好 AI 标识,这不是建议是红线。小红书二,别因为"限时"焦虑囤会员,免费档加按量 API 覆盖了绝大多数人的用量。三,所有跑分和"超越闭源"的结论目前都是官方自报,你的音色、你的文案、你的场景,自己跑 10 句对比测试,比看任何榜单都可靠。
一句话总结:Fish Audio 的"人味儿"不在运气里,在你写进括号里的那句话里。体验窗口快关了,去试一次,你就知道自己该不该留下来。