最近圈子里对 Fish Audio 的讨论密度明显上来了。7 月底,官方发布了新一代语音模型 S2.1 Pro,把声音克隆的门槛再次拉低到 5 秒参考音频的水平。知乎 但很多想上手的人卡住的,其实是个更基础的问题:免费到底怎么个免费法,入口在哪,边界在哪。国内搜一下"Fish Audio",会冒出一堆分不清真假的同名网站;社区里人人都在说免费层真香,却很少有人系统讲清楚具体有哪几条路可走。这篇就一次说清:免费路径有几条、坑在哪、什么时候才值得掏钱。
先说结论:免费层跑的就是付费同款模型
这一点最值得先定下来:Fish Audio 把 S2.1 Pro 开成了免费 API,不是阉割版试用,免费层跑的就是和付费同款的模型,而且没有字符硬上限。小红书
至于为什么撑得起免费,官方的说法是把推理栈重写了一遍:自研 FP8 算子库 fish-scales-ops,在关键解码 shape 上比 cuBLAS 参考快 2.1 到 4.3 倍,单卡每美元能服务的请求数上去了,才敢这么送。小红书
免费层拿到的能力也不打折:只需 5 秒参考音频就能完成声音克隆,比上一代的 15 秒大幅缩短,克隆出的声音可以直接生成 83 种语言的内容,首帧音频播放延迟约 90 毫秒,还支持词级情绪控制和多说话人对话生成。知乎

路径一|网页版:注册领免费额度,门槛最低
如果只是想先试试效果值不值得付费,直接走官网网页版 fish.audio 最省事:打开网页就能用,不用装任何东西,也不用配环境。社区里流传的免费额度口径是每月 8000 字,支持声音克隆,上传 10-30 秒录音即可,中文效果中上,对话场景和短视频旁白用起来顺手。知乎 另一位用户的实测口径是每月 7 分钟高质量语音加 8000 积分,具体数字以站内显示为准,额度规则本身也可能随时间调整。知乎 这条路径适合第一次试水的人:零成本就能摸清这个模型的中文自然度和克隆音色对不对你的场景。
路径二|API 免费层:开发者把请求头里的模型名改掉就行
要做原型、或者想把语音能力接进自己产品里的人,API 这边有免费端点:接入只改一处,请求头里把 model 写成 s2.1-pro-free 即可,其余和付费调用一致,声音克隆同样在免费层可用。小红书
但边界也要说清楚:发布时的口径里,免费窗口覆盖整个 2026 年 7 月,如今已是 8 月下旬,窗口是否延长、额度怎么算,以官网和实际调用返回为准,这也是后面值得盯的信号之一。小红书 另外,免费层没有 SLA、没有延迟保证,定位就是原型与评测,别直接压进生产环境。
路径三|开源自部署:数据不出本地,没有字数上限
第三条路更彻底:S2 系列是开源的,本地部署没有字数限制,数据也不出本地。架构上它采用 Dual-AR 双自回归设计,由一个慢速自回归主干负责时间语义,再由一个轻量的快速自回归解码器填充深度方向的声学细节。知乎 社区对开源版的实测口径也比较客观:生成速度极其快,但情绪和音色还原上,还是不如 Index TTS 2。小红书

不想折腾环境的话,云平台已经备好了一键镜像:Fish Audio S2 项目已在趋动云的社区项目上线,无需自己创建环境、下载模型,点一下运行、等本地 URL 生成后加上端口就能用。知乎 只提醒一句:用完记得及时关闭开发环境,免得持续计费。

避坑清单:四个比模型强不强更实际的问题
一是假网站。国内搜索出来的同名网站很多是假的,一进去就让付钱,页面做得和官网一模一样;认准 fish.audio 和 docs.fish.audio 这两个官方入口,别先付钱再求助。知乎
二是免费不等于无限商用。免费层的条款写得很清楚:年营收超 100 万美元的产品,商用前需要先联系官方。小红书 小体量原型没问题,但准备商业化的生意,别默认没人管。
三是音频数据的边界。免费层的请求可能被用于改进模型,如果你要合成的是敏感内容或客户素材,请选付费版或开源自部署。小红书
四是官方数据别全信。发布会上的性能和价格对比数据均为 Fish Audio 自行发布,尚未经过第三方独立验证,像 ElevenLabs 同等质量每百万字符 165 美元这类对比口径也一样,最好拿自己的业务文本实测后再下结论。知乎
免费不够用时:什么时候付费,拿什么对比
先看价格:Fish Audio 付费 API 约每百万 UTF-8 字节 15 美元,官方折算约 12 小时语音,对比 ElevenLabs 同等质量每百万字符约 165 美元,差了大约一个数量级(再提醒一次,两者都是官方自报数据)。知乎 所以判断标准很简单:免费层把场景跑通,效果过关又需要稳定 SLA 和更高并发时,付费买的是确定性,不是模型本身。
想要大额度免费替代,社区有人整理过一份天花板级音频模型清单可以当对照:阿里通义 Qwen3-TTS 有百万字符级免费额度,适合大批量生成;MiniMax Speech 单次最多支持 20 万字符长文本,对应中长篇小说量级的长音频。微博
同一份清单里,ElevenLabs 依然是自然度和情感的行业标杆,B 站开源的 IndexTTS-2 则是本地想完全掌控时的底座选项。微博
行业面还有两条动态值得放进背景板:声音克隆工具 noiz 已经关停,国内可用工具名单正在重排,Fish Speech 这类开源自部署路线被视为主流方向之一。知乎 生态侧,LiveKit 的 expressive mode 已经接上了 S2.1 Pro 的情绪渲染,LLM 把情感内联写进文本、模型直接渲染,不用再手动管理韵律标签。微博
行动清单和值得继续盯的信号
建议的行动顺序:第一步,用网页版免费额度跑一遍自己最常用的场景,重点听克隆音色和中文自然度;第二步,做原型开发的接上 s2.1-pro-free,用自己的文本实测延迟和并发;第三步,有显卡又在意数据边界的,再尝试开源自部署,云平台一键镜像能省下大量配置时间。

公司基本面可以放进长期观察:成立一年内团队从 3 人扩到 22 人,平台用户超过 800 万,ARR 从零做到 2100 万美元,还拿到了 5200 万美元种子轮融资。知乎 接下来值得盯三个信号:免费 API 窗口和额度规则是否变化、开源 S2 的社区优化进展和它与 IndexTTS 的差距变化、以及 noiz 关停之后竞品的定价动作。这三点有动静,这篇的结论就该跟着更新。
一句话收尾:免费层足够验证能力是否匹配你的场景,先验证、再付费,才是用 Fish Audio 的正确顺序。