当前位置:
AIGC文章详情

Fish Audio 拿了 5200 万美元融资,徐新和梅西投了同一个团队:Fish Speech 很强,但你别用错版本

源自135位全网作者

17:15

最近 AI 语音圈有条消息值得单独聊一聊:Fish Speech 背后的公司 Fish Audio,宣布完成了 5200 万美元的种子轮融资,由徐新的今日资本和 Coreline Ventures 共同领投,跟投名单里还有个意外的名字——Play Time,梅西参与创办的投资平台。投资界微博

一个做开源语音合成的团队,怎么就拿到了徐新和梅西的钱?这事跟咱们普通用户又有什么关系?今天把这条线捋清楚,顺便解决一个困扰很多人的实际问题:Fish Speech 版本号越出越多,现在想用,到底该选哪个、走哪条路。

先说融资:几个数字有点东西

根据投资界和多家媒体的报道,这轮融资背后有几个关键数据:

  • Fish Audio 目前团队只有 22 人,年经常性收入(ARR)做到 2100 万美元,约合人民币 1.4 亿元,今年 2 月他们披露的 ARR 还是 1000 万美元左右,5 个月时间翻了一倍,人均创造 ARR 接近 95 万美元。投资界

  • 平台用户超过 800 万,社区里用户上传的声音模型超过 200 万个;

  • Fish Speech 主仓库 GitHub Star 数约 3.2 万。

更戏剧的是起点。创始人 Shijia Liao 是位 00 后,马里兰大学毕业后进的英伟达,2024 年 7 月离职创业。因为喜欢动漫和虚拟主播,他最早只是想克隆动漫角色的声音,参与过 So-VITS-SVC、GPT-SoVITS 这些开源项目,后来在卧室里用一张 RTX 4090 训练早期模型——这就是后来 S2 系列的技术底子。投资界

从卧室单卡到 5200 万美元融资,这条路走了不到两年。投资人赌的也很直白:语音是 AI 交互里确定性很高的一环,而 Fish Audio 已经用开源社区证明了用户从哪来——游戏开发者、动漫爱好者、内容创作者,先有社区,再有商业化。

但对咱们来说,更实际的问题是:现在用哪个版本?

这可能是 Fish Speech 用户最容易懵的地方。B 站、小红书上教程满天飞,有的教你装 1.5,有的推 S2 Pro,有的直接让你用在线版。版本之间差别很大,选错了要么白折腾显卡,要么拿到的效果根本不是"天花板"水平。

我把主线版本整理了一下:

Fish Speech 1.5(2024 年 12 月开源)
用 100 万小时多语种数据训练,支持 13 种语言,当时在 TTS-Arena 上拿到开源模型第一、英文模型(含商业模型)第二。哔哩哔哩哔哩哔哩优点是轻:推理只要 4GB 左右显存,老显卡也能跑,所以 B 站上流传最广的整合包基本都是它。哔哩哔哩但注意,它是 CC BY-NC-SA 许可,明确不能商用。

S1(2025 年年中)
主打情绪表现力,训练数据超过 200 万小时,可以用自然语言指令控制语气,比如(愤怒)(低语)(同情)这类标签。微博这一代开始在"像真人"上拉开差距。

S2 / S2 Pro(2026 年 3 月开源)
这是目前开源侧的当家版本。4B+ 参数(主网络约 4B,副网络约 400M),用了 80 多种语言、超 1000 万小时音频训练。ModelScope核心是双自回归架构:大网络沿时间轴预测语义、管"说什么、什么情绪",小网络快速补齐声学细节,所以首包延迟能做到 100 毫秒以内,还支持 3-10 秒参考音频克隆、一次推理生成多说话人多轮对话。知乎在 2026 年 6 月一份流传较广的中文开源 TTS 分级横评里,Fish Speech 被放在 T1 梯队,评语是"克隆精度最高+高保真"。知乎

Fish Audio 拿了 5200 万美元融资,徐新和梅西投了同一个团队:Fish Speech 很强,但你别用错版本

S2.1 Pro(2026 年,API 模型)
这是官方 fish.audio 平台上的闭源旗舰,走 API 调用,没开源。7 月份做过整月限免。哔哩哔哩最近还和 LiveKit 做了集成,LLM 直接把情绪写进文本、模型端渲染,主打实时语音对话场景。微博

一句话总结:想白嫖本地跑,认准 S2 Pro;显卡不行或只想试试,用 fish.audio 在线;要做商业产品,走官方 API。

三条路,各有各的坑

路线一:在线试玩(零门槛)
直接上 fish.audio 官网,注册就能用,社区里有 200 多万个现成音色可以挑。适合先验证"这声音能不能用",再决定要不要投入部署成本。我的建议是:别一上来就折腾本地环境,先拿你自己的真实文案生成三段听听——长句稳不稳、停顿像不像真人、音色有没有辨识度。这三点过不了关,显卡再好也白搭。

Fish Audio 拿了 5200 万美元融资,徐新和梅西投了同一个团队:Fish Speech 很强,但你别用错版本

路线二:本地部署(免费但有边界)
追求零成本、数据不出门的,本地跑 S2 Pro 是当前最优解。显存不够可以用量化版,B 站已经有 UP 主做了一键整合包,跟着走基本能跑通。哔哩哔哩怕折腾的云 GPU 按小时租也很便宜。

但这里有个大坑必须说清楚:开源权重是非商业许可,1.5 是 CC BY-NC-SA。知乎另一份四款 TTS 横评里,Fish Speech 也被标注为 Research License,商用需要额外授权。知乎自己玩玩、做同人没问题,但拿来做带货视频、接单配音这类营利用途,风险是真实存在的。今年 4 月新华社还发过声音侵权的专题调查,配音圈已经在打"声音保卫战"了,别在这个节骨眼上踩线。小红书

Fish Audio 拿了 5200 万美元融资,徐新和梅西投了同一个团队:Fish Speech 很强,但你别用错版本

路线三:API 商用(花钱买省心)
要正经商用,直接走 fish.audio 官方 API,S2.1 Pro 是当前的旗舰型号,流式低延迟,情绪标签齐全。成本换确定性:不用养显卡、不用担心许可纠纷,模型迭代也是官方负责。对做内容矩阵、有声书、语音客服这类量大的场景,这笔账其实比自建划算。

顺手提一句:对手也没闲着

Fish Speech 现在并不是"无敌"的状态。8 月 10 日 B 站又发布了 IndexTTS 2.5,精确时长控制和情感-音色解耦是它的招牌。知乎阿里的 CosyVoice、Qwen3-TTS 在自然度和低延迟上各有优势;7 月的 Seed-TTS 榜单上还杀出过 ViiTor Voice 这种把一众主流模型挤下去的黑马。微博

同一份中文横评里的说法比较中肯:T1 梯队里大家各有强项,Fish Speech 的优势位是克隆精度和高保真,尤其适合 AI 角色、多说话人、多轮语音这类场景。所以结论不是"无脑冲 Fish Speech",而是:如果你的需求是克隆一个像样的声音、做多角色内容,它目前仍是开源里最值得试的那个。

接下来值得盯什么

拿了 5200 万美元之后,Fish Audio 大概率会加速,有三件事可以继续观察:一是开源节奏会不会变。过去一年他们发了 5 款模型。投资界开源是获客根基,短期内砍掉的可能性不大,但最好的模型越来越往 API 倾斜是可见趋势;二是 S2 Pro 之后开源旗舰的迭代,能不能守住克隆精度的优势位;三是国内合规和声音版权的政策走向,这会直接影响所有玩家的玩法。

对普通用户,我的建议很简单:趁现在生态还开放,先用在线版把需求验证掉;确认值得长期用了,再决定是本地部署还是买 API。版本可以等,需求验证不用等。

内容由AI生成

精选参考来源

1. 徐新投一位00后

2. FishAudio从一个开源仓库做到了2100万美元的ARR,还拿到了5200万美元的种子轮融资。

3. AI语音公司FishAudio宣布完成5200万美元种子轮融资,由徐新创办的今日资本与Coreline Ventures共同领投,359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphaist Partners等参与投资。

4. 语音合成开源模型fish-speech s2 pro TTS详细介绍

5. Fish Audio S2 Pro 官方模型页(README/overview)

6. 开源语音大模型中文表现三级分级对比报告

7. FishSpeech1.5开源:世界第一开源TTS模型

8. FishAudio推出FishSpeech1.5:TTS-Arena排名第二的语音合成技术

9. 低显存也能轻松运行!Fish-Speech1.5,本地部署教程,永久免费整合包,AI语音克隆

10. FishAudio发布最新的语音生成模型:S1宣称达到专业配音演员的表现力与自然度

11. 炸裂效果!FishAudioS2.1Pro实测,超越Indextts2的顶级TTS,附专业自制工具和教程

12. 每个严肃的TTS系统都会内置情感标签……Expressive mode解决了这个问题:LLM将情感内联写入,FishAudioS2.1Pro渲染它

13. 【一键整合包】FishSpeechS2Pro本地部署全指南(二):使用模型量化降低显存占用

14. CosyVoice3部署与推理全攻略:六种部署方案+四款TTS横评

15. 你的声音,可能已经被AI复制了

16. B站开源IndexTTS-2.0,该模型都有哪些性能亮点?

17. 中国AI,登顶全球第一!在全球语音权威评测榜单Seed-TTS上,突然杀出了一匹令人胆寒的黑马,它就是ViiTor Voice

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章