想玩声音克隆,又卡在"我的电脑带不带得动、到底装哪个"?这篇就是替你把这个账算完的。
最近两个月,知乎上"有没有好用的声音克隆软件"这类提问一直没断过,但答案的风向彻底变了:十二个月前,想做语音克隆你得调OpenAI或ElevenLabs的API,按分钟计费,现在"开源、本地、零成本"成了默认答案,这是一场和两年前LLM一样的开源化浪潮。知乎8月24日还有一篇《零成本,克隆任何人的声音,本地部署开源TTS教程》上了新帖,卖点就是完全本地跑:因为是开源模型,完全运行在自己电脑上,所以完全免费,不花一分钱。知乎可真正难住人的不是找模型,是搞不清自己的硬件能跑哪一个。今天就把这笔硬件账、成本账一次算清。
开源卷了半年,门槛从"显存12G起"降到"内存8G"
先看三个时间点。
6月底,小米开源了TTS模型OmniVoice,知乎实测帖的结论很直接:小米OmniVoice可能是目前综合门槛最低的选择。4GB显存就能跑,中文WER低到0.84%,推理速度是实时的40倍。知乎

B站的API实测视频里,长文本、跨语言克隆、多音字调节、情感标签也都能走通,基本把有声书、广播剧的常见需求都覆盖了。
7月中旬,B站一条《本地语音AI终于统一了》的视频,用audio.cpp整合包把实时对话、声音克隆、AI翻唱一起跑在8G显存上,收藏量接近两千——实操类内容里,这个收藏量相当少见。
还有千音漫语免费版,作者的说法是"无需GPU,8G内存流畅运行",连没有独显的办公本也够得着了。
什么概念?今年3月的选型表里,入门门槛还普遍写着"至少12G显存";现在无独显、4G、8G、12G+,每一档都有能用的方案。
选型表:先看硬件,再看需求
硬件条件 | 方案 | 这一档的关键特点 | 适合干什么 |
|---|---|---|---|
无独显,内存8G+ | 千音漫语免费版 | 无需GPU、不限次数(作者实测口径) | 新手第一次尝鲜 |
显存4G | 小米OmniVoice | 多语言、长文本、跨语言克隆(社区实测) | 有声书、多语言内容 |
显存6G | IndexTTS-2.5(B站开源) | 低显存、中文向 | 中文播客、漫剧配音 |
显存8G | audio.cpp整合包 | 实时对话+克隆+AI翻唱三合一 | 想一步到位的折腾党 |
显存12G+ | Fish-Speech S2 Pro 4B | 62种语言、zero-shot | 多语言、高质量需求 |
显存12G+ | VoxCPM2 | 声音克隆+声音设计、支持方言、有ComfyUI生态 | 广播剧、二创工作流 |
情感向 | emotinoTTS v2.0 | 社区口碑"情感最丰富" | 漫剧、短剧情绪戏 |
待观察 | 字节SwanTale | 声音克隆+自然语言导演 | 等落地再评估 |

表外有四句话要说清。
第一,OmniVoice"600种语言"的规格更多是宣传口径,普通人真正用到的可能不超过十种;但跨语言克隆和方言支持是真有用——用一段外语样本的音色说中文,这种需求在低显存档就能解决。
第二,VoxCPM2的"声音设计"值得单独说:它不是克隆某个真人的声音,而是从零合成一个新音色。这条路在版权上比克隆真人干净得多,适合要做商用内容的人。
第三,AI翻唱(RVC、so-vits-svc这类)和TTS是两条赛道,别下错:想让声音"唱歌"找变声类模型,想让声音"说话"看上表。
第四,此前写过的FireRedTTS3和IndexTTS-2.5也在候选池里:前者基准成绩登顶但显存要求高,后者6G显存就能跑,对中端机器友好。
三笔成本账:"免费"只是开始
第一笔是时间账。本地部署有三条路:整合包、官方仓库、自己搭ComfyUI工作流,难度从低到高。新手先从整合包上手,摸清模型脾气再进阶。现在的开源工具也在拼命替用户省折腾,比如Voice-Pro,语音翻译、AI克隆、人声分离、YouTube下载全打包。知乎
第二笔是金钱账。开源本地跑零边际成本,但硬件不够别急着买显卡——先租云GPU,几块钱租几个小时,把选型表跑一遍再决定要不要添置硬件。对比之下,在线工具的免费额度是有限的:现在很多市面上的工具要么是声音固定,要么就是需要充值才能使用到声音克隆的功能。知乎之前算过漫剧配音"一分钟0元到300元"的差价,noiz、nicevoice接连打不开的事故也提醒过:声音和数据放在别人服务器上,定价权就不在你手里。

第三笔是风险账。两条:别克隆别人的声音——配音圈今年3月起就有从业人员联合提出了行业自律原则:多名知名配音工作者及机构联合发声,提出了“三禁”原则。严禁未经授权采集声音做AI训练、抵制营利性滥用、要求下架侵权内容并追责。知乎别轻易交出自己的声音——B站那条高热案例里,一段5秒的录音就能让骗子克隆出你的声线,10分钟骗走430万。整合包和小工具尽量找持续更新、口碑明确的作者,来路不明还要录音权限的,慎碰。
这几类人先别装
一年只想玩两三次的,在线工具免费额度就够了,不必装;要做商用的,先把每个开源模型的许可协议看一遍,商用条款一模型一样,不是都允许免费商用;目标是漫剧、短剧配音的,选型只解决"出声",去AI味是另一门功课——小红书上"AI漫剧不火?画质没问题,是配音太拖垮了"这类帖子收藏量已经几百起步,讨论的全是后期怎么把机器味修掉。
接下来值得盯的三个信号
一是字节SwanTale。它的思路是用自然语言当导演指挥生成,同时克隆音色:用自然语言caption当「导演」指挥生成(instructTTS)和用参考音频克隆音色(zero-shotTTS),还能在一条波形里塞下多说话人对话、环境音和音效。知乎它还没正式落地,以什么形态放出来、放多少,值得蹲。

二是IndexTTS、FireRedTTS的迭代速度。这两家保持高频更新的话,中显存档会是受益最大的一批。
三是闭源平台免费额度的变化。免费额度一旦收缩,本地部署的迁移潮只会更快。
收个尾:今年的声音克隆,值得从低显存方案入手试起,值得等SwanTale这类新形态,不值得花大钱——显卡不用恐慌性购买,来路不明的声音类付费App更不用。硬件门槛已经卷到这个份上,先看看自己电脑里是什么配置,再回来对表。