最近刷小红书,会反复刷到一类内容:画面可能只有一张立绘、一段短短的切片,一个熟悉的角色声音贴着耳朵说几句话——一句晚安、一段道歉、一句安慰。评论区清一色是"心跳漏了一拍"“先收藏了”。
数据不是一般的大。TF张桂源的一条"AI声音"视频拿到2.7万赞、1.28万收藏,《鬼灭之刃》富冈义勇的梦女向AI语音作品有1.7万赞、近7000收藏,杨博文的AI配音内容动辄几千到8000+赞。B站上还有一批创作者在量产"AI配音:让XX给你唱摇篮曲""让XX向你认错"系列。
这就是梦女圈说的"语音代餐"和"做梦素材":用AI声音合成,让喜欢的角色说出原作里没有的台词。有人在吃代餐,也有人开始自己动手做饭。今天就把这件事讲清楚:你也想给"自己推的角色"配个声音的话,路径有哪几条、各花多少钱、红线在哪里。

先搞清楚,你要做的是哪一种
这类内容背后其实是三种不同的玩法,对工具的要求完全不一样。
第一种是纯音频的"代餐"。不需要画面,声音配一张角色图就能发,标签挂上#梦女向 #做梦素材,这是量最大、门槛最低的一类。
第二种是AI聊天角色音。把调好的角色声音接进Kelivo、星野这类聊天应用,让"他"真的用这副嗓音跟你说话。小红书上已经有人出教程,专门教怎么把ElevenLabs里调好的声音接进Kelivo,一百多赞、近90收藏,评论区蹲着学。还有人宣布调出了韩贝塔的声音——就是规则怪谈沙雕动画里那个角色——“破25赞出教程”。小红书
第三种是二创视频和语音剧。这块的主阵地在B站:GPT-SoVITS教程的评论区挤满求整合包的人,七海千秋、若叶睦这些角色的语音模型已经有人训练好公开分享,连炉石传说都有人出角色语音模型的教学。

三条路径,三种成本
路径一:开源本地训练,GPT-SoVITS这条路。 免费、上限最高、情感表现最好,但要显卡、要时间。流程大致是从原作提取角色干声、切分标注、训练、推理。B站的生态已经比较成熟,"5分钟教会你给自己的二创配音"这类教程收藏接近1000,很多作者直接把整合包和文档链接挂在简介里。成本:软件0元,代价是一张说得过去的独立显卡,加几小时到几天的训练时间。
路径二:零训练参考音频,IndexTTS2这条路。 无需训练模型,上传参考音频即可使用,还能控制开心、愤怒、悲伤这些情绪,开源免费、本地运行。哔哩哔哩代价是强情绪下音色会漂移,情绪越猛越不像本人,实测强情绪声纹降幅约为中性的近两倍。知乎
B站IndexSpeech团队今年8月10日进一步开源的IndexTTS 2.5,官方论文数据五语种字错率为每百字1到6个,发音是地道水准。知乎这条路适合只想快速搞定单个角色的人,门槛比路径一还低一档。
路径三:在线平台,注册即用。 noiz关停后,国内可用工具的分工已经很清楚了:开源项目自部署是一类,Lipvoice、火山引擎豆包TTS、魔音工坊这类在线平台则注册即用。知乎8月的一篇知乎横评把场景分工拆得更细:纯英文选ElevenLabs,中文情感长文本选MiniMax,二次元翻唱选FishAudio,国内短剧和方言选AnyVoice,想凭空造个新声音选VoxCPM。知乎

要注意两点。ElevenLabs的中文克隆一直被用户吐槽是灾难,一股浓浓的老外译制片味,还得绑外币卡按月付美金,很不划算。国内侧有LipVoice这类低门槛方案,注册1分钱给12万字符,差不多能合成300到400分钟音频。知乎
还有一笔经常被忽略的成本:请真人录。一位TF粉丝的记录是,“我知道可以用,但是我觉得AI代替不了他,所以找人专门配了花了50多”。哔哩哔哩这不是钱的问题,是态度问题——下面红线部分会讲为什么。
三条红线,做饭之前先看这里
这是全文最想让你记住的部分。很多人的认知里,"角色的声音"是随便用的公共资源,这个认知是错的。
红线一:角色音的本质,是配音演员的声音。 你训练的每一句角色语音,音色都来自背后的配音演员。今年3月起,配音演员的声明一份接一份:赵成晨方明确从未授权任何主体将其声音用于AI模型训练。微博短视频配音演员沈安宇的声音被全网AI克隆播放过亿次,他本人收入却暴跌80%,如今最大的困局是要一遍遍证明"我不是机器"。微博给太乙真人配音的张珈铭被侵权后维权艰难,已经转换思路去做自己的动画。这波维权没有退潮,只会越来越多,用角色音做二创发布前,至少先想清楚这一点。
红线二:真人(偶像、艺人)的声音,风险更高。 现在大量偶像的AI声音内容,发布时都挂着"请勿上升正主"的声明。小红书但免责声明改变不了法律性质,法律向内容已经梳理过判例:在殷某桢声音侵权案中,法院认定未经许可使用他人声音构成侵权,判赔25万元。小红书也是一些粉丝圈主动抵制自家偶像AI声音的原因——前面那位"AI代替不了他"的粉丝,就是这种态度的缩影。
红线三:传播与商业化会放大风险。 "温馨提示:本视频人物/声音为AI合成,仅供娱乐"这类声明在小红书大量内容里已经成为标配,平台对AI标注的要求正在收紧。合规底线其实就两句话:只克隆本人或已获授权的声音,AI配音对外发布依法标注AI合成。知乎此前noiz、nicevoice等声音克隆平台接连打不开,也说明把"声音资产"押在某个平台上本身有不确定性。圈内自娱自乐是一回事,把AI声音资源打包售卖、做付费群变现,性质就完全变了。
最后,给一份对照表
只想吃代餐的:不用研究工具,吃的时候留意来源,别把内容外传到圈外或真人相关的场合。
想给二次元角色做二创的:先去B站搜现成模型,没有的话从IndexTTS2上手,有余力再研究GPT-SoVITS。顺序建议是先在线免费验证效果,确认合用且量大,再考虑本地部署——反了会白折腾。知乎
想给AI聊天接角色音的:先确认你用的聊天应用支持外接语音,把ElevenLabs里调好的声音接到Kelivo的方法,小红书上已经有人讲透了。小红书
想碰真人声音的:不建议,法律风险之外,很多粉丝社群本身也不接受。
接下来值得持续观察的信号:配音演员维权声明的名单变化、平台AI标注的执行力度,以及IP官方对二创配音的表态。
技术门槛只会越来越低,真正决定你能玩多久的,是知道哪些能碰、哪些不能碰。