这两天本地部署圈被Qwen3.8-27B刷屏,大家都在为16G还是24G显存算账。但就在差不多同一时间,另一个开源项目悄悄炸了——8月11日晚,B站官方开源了工业级情感TTS模型IndexTTS-2.5。知乎B站测评、小红书教程、知乎部署攻略一夜之间全冒了出来,一条小红书笔记的配文只有一句:不用再给minimax交钱啦,GPU就是用来跑模型的。小红书
一个TTS(文本转语音)模型,凭什么有这么大动静?因为比起大语言模型,它可能是普通人最容易摸到"本地AI"的入门项目。
它能干什么:几秒钟音频克隆声音,还带情感
IndexTTS-2.5出自B站的Index语音团队。这个团队不是新手——去年7月,IndexTTS 2.0就开源了"影视级声音克隆",演示用的是《让子弹飞》和《甄嬛传》;前几天在微博走红的"B站AI原声翻译"——把UP主的视频翻译成英文,还能保留本人声线和口音——背后也是这条技术线。微博

2.5的核心能力一句话:零样本声音克隆。给它一段几秒到几十秒的参考音频,它就能用这个音色读任何文本,还能控制情感——可以在文本里指定"生气地说"“难过地说”,支持中、英、日、西、阿五个语种,多音字、语速调整、音素级修正也能处理。官方给的数据:五语言零样本推理提速约2.28倍(A10环境),平均说话人相似度73.63。知乎应用场景很具体:视频解说、有声书、播客、多角色配音,甚至给游戏做中文配音替换——已经有人用它做出了《命运石之门》的中文配音demo。微博

成本账:显存门槛只有大模型的三分之一
这是ZDM读者最值得算的部分。社区的主流说法是5G显存可用、6G能跑、8G能玩全功能,社区整合包还提供了纯CPU无显卡模式,慢一些但能跑。哔哩哔哩你手头如果是这两年买的游戏本或台式机,绝大多数显卡都是8G显存起步——这意味着零新增硬件成本。
对比一下:本地跑Qwen3.8-27B,至少16G显存加量化,再大一号的DeepSeek V4-Flash(284B)更是16G塞不下。TTS模型体积小、门槛低,是很多人的显卡第一次"真正干活"。
云端路线的成本也可以参考:MiniMax的声音克隆API按字符计费,用多少付多少;本地部署则是交一次电费,无限次使用。如果你是高频配音用户(做有声书、日更视频),本地部署几乎肯定更省;如果一个月就用一两次,说实话云端工具的免费额度就够了,不必折腾。
但先说争议:2.5真的比2.0强吗
这是目前社区分歧最大的问题,两派都有真实用户撑腰。升级派里,有玩家拿《名侦探柯南》跑了几集中配,反馈"效果很不错,比2.0有提升"。哔哩哔哩多语言能力也被认为"跨语种里效果能进前三"。
回滚派的声音也不小。B站官方视频下点赞最高的一条评论直言,自己本地搭建测试后,音色相似度大幅度下降、语速忽快忽慢,情感控制也不稳定,总体感觉不如2.0。哔哩哔哩还有人测了十几条片段,觉得"克隆出来的声音AI味太严重,确实还得是2.0";也有人反馈"很多句子经常会在结尾几秒莫名拖长"。

我的判断:新用户直接装2.5(生态完整、教程新、功能多);2.0已经稳定跑在生产里的,别急着迁移;主要用途是克隆中文人声的,先用你自己的参考音频把两个版本都试听一遍再决定。最可能的情况是:2.5的强项在情感控制和多语言,纯音色还原做了取舍。
怎么装:三条路线,别交信息差税
官方路线(免费):GitHub的index-tts/index-tts项目加模型权重,权重在国内魔搭(ModelScope)上也有,下载更稳。知乎需要敲命令行,但知乎已经有手把手的PowerShell教程,官方WebUI上手就能用。
社区整合包(大多免费):B站官方的本地整合包支持低显存和纯CPU;T8、V32等社区包功能更多,多人对话、长音频拆分和组合、角色库、SRT对话自动时长控制都有。哔哩哔哩但要留个心眼:有的包说明里塞着云算力邀请码和优惠链接,包本身免费,别顺手为云服务掏钱。哔哩哔哩至于直接把整合包打包卖钱的,模型和官方工具本来全免费,这个信息差税就别交了。
云端体验(先试再装):云厂商有现成镜像,不确定效果达不达标,先在云端试,再决定要不要本地部署。

Mac用户注意:目前官方主推NVIDIA显卡,社区已经有Mac版方案在流传,想在Mac上玩的,建议多等一阵子反馈成熟。
最后说最重要的:声音克隆的红线
这个模型技术上能"克隆任何人的声音",但技术可以≠你可以:
克隆自己或家人的声音(家人同意的前提下):没问题,商用也没问题;
克隆他人的声音:民法典第1023条规定,对自然人声音的保护参照肖像权保护的规定——未经对方同意就用他的音色生成内容,无论盈不盈利都构成侵权。教程作者都特意提醒:克隆他人声音,得经过别人同意授权,不然有法律风险。知乎
公众人物/明星千万别碰:7月初"配音演员被AI偷声,收入锐减8成"冲上微博热搜,上海配音演员沈安宇的声音被大量AI配音"借用"后,收入缩水到巅峰期的五分之一,多位配音演员公开发声抵制。微博这个行业现在对此非常敏感;
对外发布要合规:AI生成内容标识办法已经生效,公开发布用克隆声音制作的作品,要按要求标注AI生成。
本地玩图个乐没问题,对外发布时,请克制。
结论:三类人,三个答案
有8G以上显存的显卡+高频配音需求(自媒体、有声书、播客):值得部署,边际成本约等于零,优先走官方路线;
没有独显/只是偶尔玩玩:先用云端免费额度,别为它专门买硬件——现阶段消费级硬件追模型,追的是移动靶;
已经在用2.0的:观望一下社区反馈,或者两个版本并行试用,别直接切换。
接下来值得盯的信号:开源许可证条款(社区已经在追问,商用务必确认仓库LICENSE)、Mac/AMD适配进度,以及后续版本会不会修复"结尾拖长"和音色还原的问题。