当前位置:
AIGC文章详情

Fish Audio融资5200万美元,15美元生成12小时语音:S2.1 Pro值得试吗

源自148位全网作者

14:36

7 月底,语音 AI 圈出了个大新闻:靠开源语音模型起家的 Fish Audio,完成了 5200 万美元种子轮融资,同时发布了新一代语音模型 S2.1 Pro。种子轮就融 5000 万美元以上,这在 AI 行业里都不多见,更关键的是,这家公司成立刚满一年,团队只有 22 个人。比起融资本身,更值得盘一盘的是它的定价——15 美元就能合成约 12 小时语音。今天就把这家公司和这款产品一次说清楚。

5200 万美元种子轮:22 个人的团队想证明什么

Fish Audio 宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 与今日资本领投。知乎这个数字是什么概念?成立一年,团队从 3 人扩到 22 人,发布 4 款 TTS 模型和 1 款 STT 模型,平台用户超过 800 万,ARR 从零做到 2100 万美元,企业及开发者业务已贡献约三分之二收入。

这个融资节奏不是凭空来的。看看同一时间的行业动态:韩国语音 AI 公司 Supertone 宣布,Supertone Play、Supertone API 与 Voice Builder 将于 2026 年 8 月 31 日停止服务。知乎一边收缩停服,一边大额融资加降价,语音合成赛道正在洗牌,「能合成」的门槛已经过去,「又快又便宜又细腻」才是新入场券。

S2.1 Pro 升级了什么

核心升级有四个。第一是延迟:首帧音频播放延迟(TTFA)约 90ms,比上一代 S2-Pro 的 100ms 进一步压缩。知乎人耳对语音延迟的敏感阈值大约在 150-200ms,90ms 意味着实时对话场景里,你基本感觉不到对面在「想」。

第二是克隆门槛:仅需 5 秒参考音频即可完成声音克隆,上一代还需要 15 秒。知乎克隆出的声音可以直接生成 83 种语言的内容,无需额外微调。第三是词级情绪控制:延续 [括号] 语法但不局限于固定标签集,模型把括号里的文字当普通文本处理,自己学会自然语言描述到声学变化的映射,[laugh]、[whisper] 这些不再是预置标签,而是模型「读得懂」的描述。第四是多说话人多轮对话生成,直接面向有声书、广播剧、虚拟主播这类多角色场景。

这些指标背后是工程优化。官方技术报告显示,在单张 NVIDIA H200 GPU 上,S2 的推理引擎实现了 0.195 的 RTF,也就是生成高保真音频的速度远超实时。arXiv而 S2.1 Pro 官方口径更进一步:单卡 H200 吞吐超 8000 tokens/s。知乎

Fish Audio融资5200万美元,15美元生成12小时语音:S2.1 Pro值得试吗

算笔账:15 美元到底多便宜

重点来了,定价。Fish Audio 的标准是每百万 UTF-8 字节约 15 美元(约合 18 万英文单词、约 12 小时语音)。知乎

这个价格怎么理解?Fish Audio 发布会上对标的对象是 ElevenLabs:ElevenLabs 在同等质量下的 API 定价约为每百万字符 165 美元。知乎按这个口径直接相除,单价差距约 11 倍,比社区常引用的「6 倍差距」还要夸张。需要说明的是,这两个数字都来自 Fish Audio 单方口径,尚未经第三方独立验证,参考即可。

官方还给了个激进的承诺:企业采用其语音服务后如果成本降不到至少一半,免费再提供一年服务。翻译成大白话:你来试,不够便宜我免单。

国内场景再粗算一笔:100 万 UTF-8 字节,按中文一字 3 字节约合 33 万字,以有声书常见语速每分钟约 280 字计,约等于 20 小时中文语音——也就是 15 美元能出约 20 小时中文有声书,每小时成本约 0.75 美元(合人民币 5 元出头)。一部网文听完的配音成本,比很多人想象的低得多(这是我基于官方口径的估算,供参考)。

Fish Audio融资5200万美元,15美元生成12小时语音:S2.1 Pro值得试吗

为什么敢降价:纸面上的技术底气

打价格战要有底气。论文数据显示,在 Seed-TTS-Eval 声音克隆测试里,S2 的中英文词错误率(WER)均为当前领先:中文 0.54%、英文 0.99%,对比 CosyVoice 3 的 1.12%/2.21%、Seed-TTS 的 1.12%/2.25%。arXiv「读得准」是语音合成的地基,也是不少模型一上长文本就露怯的地方。

成本下降的第二个关键是架构。Dual-AR 方案用一个大模型(4B 参数的 Qwen3)负责理解语义并预测语音的"高层表示",再用一个小模型(400M 参数)快速填充声学细节。知乎大模型管「懂」,小模型管「快」,这种分工是它能同时压低延迟和成本的核心原因之一。

但要留个心眼:Fish Audio 还自建了指令跟随评测基准,论文称在指令改写的设定下,模型超过此前最优水平 30%,刷新行业基准。arXiv自建基准加自报数据,含金量如何,建议等第三方复现再下结论。

避坑提醒:开源不等于可以免费商用

想白嫖开源权重的开发者,这里有个必须知道的坑。很多人以为「开源发布」等于「随便用」,但 fish-speech 官方仓库的许可证写得很清楚:研究和非商业用途免费。GitHub

商用则是另一回事:任何将 Fish Audio 材料或其衍生作品用于商业目的的行为,都需要与 Fish Audio 另行签订书面许可协议。GitHub而且「商业目的」定义得很宽:做进产品或服务、企业内部使用、哪怕间接产生收入都算。所以如果你打算把 S2 权重做进商业项目,要么走商务授权,要么直接调用官方 API。

这也解释了 Fish Audio 的打法:开源权重赚社区和影响力,商业变现靠 API 和授权。顺带纠个偏:有文章称 S2 以「Apache 2.0 协议开源」,与官方仓库的 FISH AUDIO RESEARCH LICENSE 不符,请以官方 LICENSE 为准。S2 Pro 模型已托管在 Hugging Face(fishaudio/s2-pro),授权条款在模型卡片上可以直接看到。

Fish Audio融资5200万美元,15美元生成12小时语音:S2.1 Pro值得试吗

谁适合用,怎么用

最后落到「跟我有没有关系」,按人群给几条建议。

做实时语音对话或 Agent 产品的开发者:90ms 延迟加激进定价,值得拉上 Cartesia、ElevenLabs 做一次同场对比。客户名单也能参考:HeyGen、LiveKit、Retell、Sanas、OpenArt 等多家公司已在生产环境中使用其模型。知乎重点验证两件事:你自己业务文本上的首帧延迟,以及每小时音频的真实成本。

做配音、有声书、播客的创作者:先用上面的单价算算自己的月产量,成本差异会非常直观。建议先用免费的 s2.1-pro-free 模型试自己的常用文本——官方承诺它与正式版质量和语言覆盖完全相同,在合理使用限制下免费。知乎

只是尝鲜的普通用户:官方为庆祝成立一周年开放了一个月 S2.1 Pro 免费体验,零成本上车。但两件事记牢:一是性能和价格对比目前都是官方单方数据,做决策前建议自己实测;二是声音克隆涉及人格权与版权,克隆任何人的声音都先取得授权。

后续值得盯三个信号:ElevenLabs 和 Cartesia 是否跟进降价,第三方评测能否复现官方数据,以及 S2.1 Pro 何时出现在 Seed-TTS-Eval 等公开榜单上。语音合成正在从「配音工具」变成「交互基础设施」,这场价格战,才刚刚开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章