最近 AI 语音圈有条消息值得单独聊一聊:Fish Speech 背后的公司 Fish Audio,宣布完成了 5200 万美元的种子轮融资,由徐新的今日资本和 Coreline Ventures 共同领投,跟投名单里还有个意外的名字——Play Time,梅西参与创办的投资平台。投资界微博
一个做开源语音合成的团队,怎么就拿到了徐新和梅西的钱?这事跟咱们普通用户又有什么关系?今天把这条线捋清楚,顺便解决一个困扰很多人的实际问题:Fish Speech 版本号越出越多,现在想用,到底该选哪个、走哪条路。
先说融资:几个数字有点东西
根据投资界和多家媒体的报道,这轮融资背后有几个关键数据:
Fish Audio 目前团队只有 22 人,年经常性收入(ARR)做到 2100 万美元,约合人民币 1.4 亿元,今年 2 月他们披露的 ARR 还是 1000 万美元左右,5 个月时间翻了一倍,人均创造 ARR 接近 95 万美元。投资界
平台用户超过 800 万,社区里用户上传的声音模型超过 200 万个;
Fish Speech 主仓库 GitHub Star 数约 3.2 万。
更戏剧的是起点。创始人 Shijia Liao 是位 00 后,马里兰大学毕业后进的英伟达,2024 年 7 月离职创业。因为喜欢动漫和虚拟主播,他最早只是想克隆动漫角色的声音,参与过 So-VITS-SVC、GPT-SoVITS 这些开源项目,后来在卧室里用一张 RTX 4090 训练早期模型——这就是后来 S2 系列的技术底子。投资界
从卧室单卡到 5200 万美元融资,这条路走了不到两年。投资人赌的也很直白:语音是 AI 交互里确定性很高的一环,而 Fish Audio 已经用开源社区证明了用户从哪来——游戏开发者、动漫爱好者、内容创作者,先有社区,再有商业化。
但对咱们来说,更实际的问题是:现在用哪个版本?
这可能是 Fish Speech 用户最容易懵的地方。B 站、小红书上教程满天飞,有的教你装 1.5,有的推 S2 Pro,有的直接让你用在线版。版本之间差别很大,选错了要么白折腾显卡,要么拿到的效果根本不是"天花板"水平。
我把主线版本整理了一下:
Fish Speech 1.5(2024 年 12 月开源)
用 100 万小时多语种数据训练,支持 13 种语言,当时在 TTS-Arena 上拿到开源模型第一、英文模型(含商业模型)第二。哔哩哔哩哔哩哔哩优点是轻:推理只要 4GB 左右显存,老显卡也能跑,所以 B 站上流传最广的整合包基本都是它。哔哩哔哩但注意,它是 CC BY-NC-SA 许可,明确不能商用。
S1(2025 年年中)
主打情绪表现力,训练数据超过 200 万小时,可以用自然语言指令控制语气,比如(愤怒)(低语)(同情)这类标签。微博这一代开始在"像真人"上拉开差距。
S2 / S2 Pro(2026 年 3 月开源)
这是目前开源侧的当家版本。4B+ 参数(主网络约 4B,副网络约 400M),用了 80 多种语言、超 1000 万小时音频训练。ModelScope核心是双自回归架构:大网络沿时间轴预测语义、管"说什么、什么情绪",小网络快速补齐声学细节,所以首包延迟能做到 100 毫秒以内,还支持 3-10 秒参考音频克隆、一次推理生成多说话人多轮对话。知乎在 2026 年 6 月一份流传较广的中文开源 TTS 分级横评里,Fish Speech 被放在 T1 梯队,评语是"克隆精度最高+高保真"。知乎

S2.1 Pro(2026 年,API 模型)
这是官方 fish.audio 平台上的闭源旗舰,走 API 调用,没开源。7 月份做过整月限免。哔哩哔哩最近还和 LiveKit 做了集成,LLM 直接把情绪写进文本、模型端渲染,主打实时语音对话场景。微博
一句话总结:想白嫖本地跑,认准 S2 Pro;显卡不行或只想试试,用 fish.audio 在线;要做商业产品,走官方 API。
三条路,各有各的坑
路线一:在线试玩(零门槛)
直接上 fish.audio 官网,注册就能用,社区里有 200 多万个现成音色可以挑。适合先验证"这声音能不能用",再决定要不要投入部署成本。我的建议是:别一上来就折腾本地环境,先拿你自己的真实文案生成三段听听——长句稳不稳、停顿像不像真人、音色有没有辨识度。这三点过不了关,显卡再好也白搭。

路线二:本地部署(免费但有边界)
追求零成本、数据不出门的,本地跑 S2 Pro 是当前最优解。显存不够可以用量化版,B 站已经有 UP 主做了一键整合包,跟着走基本能跑通。哔哩哔哩怕折腾的云 GPU 按小时租也很便宜。
但这里有个大坑必须说清楚:开源权重是非商业许可,1.5 是 CC BY-NC-SA。知乎另一份四款 TTS 横评里,Fish Speech 也被标注为 Research License,商用需要额外授权。知乎自己玩玩、做同人没问题,但拿来做带货视频、接单配音这类营利用途,风险是真实存在的。今年 4 月新华社还发过声音侵权的专题调查,配音圈已经在打"声音保卫战"了,别在这个节骨眼上踩线。小红书

路线三:API 商用(花钱买省心)
要正经商用,直接走 fish.audio 官方 API,S2.1 Pro 是当前的旗舰型号,流式低延迟,情绪标签齐全。成本换确定性:不用养显卡、不用担心许可纠纷,模型迭代也是官方负责。对做内容矩阵、有声书、语音客服这类量大的场景,这笔账其实比自建划算。
顺手提一句:对手也没闲着
Fish Speech 现在并不是"无敌"的状态。8 月 10 日 B 站又发布了 IndexTTS 2.5,精确时长控制和情感-音色解耦是它的招牌。知乎阿里的 CosyVoice、Qwen3-TTS 在自然度和低延迟上各有优势;7 月的 Seed-TTS 榜单上还杀出过 ViiTor Voice 这种把一众主流模型挤下去的黑马。微博
同一份中文横评里的说法比较中肯:T1 梯队里大家各有强项,Fish Speech 的优势位是克隆精度和高保真,尤其适合 AI 角色、多说话人、多轮语音这类场景。所以结论不是"无脑冲 Fish Speech",而是:如果你的需求是克隆一个像样的声音、做多角色内容,它目前仍是开源里最值得试的那个。
接下来值得盯什么
拿了 5200 万美元之后,Fish Audio 大概率会加速,有三件事可以继续观察:一是开源节奏会不会变。过去一年他们发了 5 款模型。投资界开源是获客根基,短期内砍掉的可能性不大,但最好的模型越来越往 API 倾斜是可见趋势;二是 S2 Pro 之后开源旗舰的迭代,能不能守住克隆精度的优势位;三是国内合规和声音版权的政策走向,这会直接影响所有玩家的玩法。
对普通用户,我的建议很简单:趁现在生态还开放,先用在线版把需求验证掉;确认值得长期用了,再决定是本地部署还是买 API。版本可以等,需求验证不用等。