前几天刷B站的术力口区,看到两件不大、但挺有意味的事。
8月25日,出现了一支标题叫「5年级小学生第一次尝试用OpenUtau制作术曲」的视频。哔哩哔哩同一天,开源工具ustxPlayer发布了v1.1.0,给OpenUTAU工程加上了视频导出能力——调完歌之后「做成视频」这一步,也能在同一套免费工具链里完成了。GitHub
再加上8月中旬出现的新UTAU重采样器、7月声库方亲自发布的DiffSinger教程,我的感觉是:虚拟歌手开发的工具链正处在一轮密集更新里,而曾经劝退很多人的那道门槛——「要会编程才能碰这个」——正在被悄悄拆掉。
这篇内容写给这样的朋友:你知道VOCALOID、洛天依、初音未来,听说过Synthesizer V和AI翻唱,甚至动过「要不要用自己的声音做一个虚拟歌手」的念头,但一直停在「听起来很难」这一步。如果你已经是深度圈内人,欢迎在评论区补充。
这个行业是不是要凉了?先看诚实的数据
知乎上有个时不时被翻出来的问题:「2025年入坑虚拟歌手调校是否相当于49年入国军?」潜台词是,AI翻唱满天飞,手工歌声合成还有没有意义。那里的回答其实说得挺清楚:歌声转换(SVC)和歌声合成(SVS)是两条不同的技术路线,SVC短期里替代不了SVS。知乎
看8月的数据,确实不用那么悲观。B站的2026虚拟歌手创作赛正在进行,官方主视觉上标注的赛期是7月9日到9月1日,口号里写着「赢取万元奖金」,周推荐视频已更新到第五周,单期播放稳定在4万~6万量级。哔哩哔哩

参赛作品的头部数据相当能打:「超主人公」的英文填词翻调播放超过12万。哔哩哔哩琴葉茜·琴葉葵的原创曲「大金鸡菊们的福音摇滚」接近10万。哔哩哔哩
但冷水也要泼一下:我查了写稿当天B站新发布的Synthesizer V/DiffSinger相关作品,一天40支,绝大多数播放只有几十到几百,流量极度头部化。想靠这个赚播放,这不是个高效的赛道;但如果你想要的是「拥有一个自己的歌手」,现在的环境是历史上最宽松的。
这一个月,工具链在忙什么
整理几个最近值得关注、全部偏开源/免费的动向:
1)ustxPlayer发布v1.1.0。这是OpenUTAU工程的可视化工具,本次更新加入视频导出,还为与原项目区分更换了图标和工程文件后缀。哔哩哔哩以前调完歌要录屏或换别的软件再加工,现在能省一道事。
2)Yuaz DDSP Resampler(8月14日)。作者基于GTSinger、VocalSet等公开数据集,为UTAU训练了一个新的重采样器,让传统拼接声库也能有更现代的音色表现——老声库不必躺进仓库吃灰。更难得的是,这个项目从0到发布只用了7天。哔哩哔哩声库制作、配音、绘图、代码全由一人完成,「个人开发者给个人创作者造工具」就是这个行业的常态。
3)跨引擎迁移越来越方便。8月25日到26日,有两位不同的创作者先后发布了Voicevox→OpenUTAU调校转换工具的试用视频。哔哩哔哩另一边,OpenVPI团队公测中的工程格式转换器OpenSVIP,已经能在Synthesizer V、ACE Studio、X Studio等歌声合成工程格式之间互转。OpenVPI官网在别的引擎里练出来的手艺,不会白费。

4)泠鸢yousa创作组官方号发布了DiffSinger入门教程(7月7日),简介里从工程分享网站、格式转换工具到人声分离教程给了一整套,还配了交流群。哔哩哔哩教程过去靠爱好者之间口口相传,现在声库方亲自下场带。
5)OpenUTAU的手机版已经有实际创作产出,「在手机上调术曲」不再是玩笑。哔哩哔哩
合起来看:这条路线的难度,正在从「会不会配环境」变成「愿不愿意录音、会不会听」。
三条路线,怎么选
如果目标是「拥有自己的虚拟歌手」,现在大致有三条路:
路线一:OpenUTAU + DiffSinger,开源免费,自制声库的主干道。录一段干净的干声(自己的,或者OC角色的),按教程走完整流程就能训出自己的声库模型,编辑器、合成引擎、格式转换全部不要钱,付出的是录音和标注的时间。DiffSinger仓库由openvpi维护,官方还单独开了一个MakeDiffSinger项目,专门负责数据集生产管线。GitHub项目文档里把「MIDI和音素输入→方差模型→声学模型→声码器」的整条链路画得明明白白,入门照着做就行。

路线二:Synthesizer V,商业引擎。开箱即用的天花板仍然在这里:重音テトSV2、GUMI SV2、星尘Infinity、诗岸这些声库每天都有人在调,AI声库的音色已经很接近真人。但它们是「官方歌手」——你可以拿来创作,歌手却不是你的。编辑器有免费基础版,声库也有Lite版可用,更适合目标是「先做出歌」的人。
路线三:传统UTAU录音流。CV/VCV录音加标注是最费人力的路径,但随着DDSP这类新重采样器出现,老声库正在被重新激活。如果你手头已经有声库,或者就是喜欢某款老声库的音色,这条路依然值得走。
最后说AI翻唱(RVC/SVC这类):上手最快,但严格说不算「虚拟歌手开发」,版权风险也最高——今年2月,某公司用洛天依声库制作的歌曲陷入抄袭争议,在微博上闹得沸沸扬扬,声库商用的边界正被越来越严格地审视。微博打算公开发作品的话,这根弦要一直绷着。
真想上手,三步走
别一上来就想训模型,建议拆成三步:
第一步,先用现成声库做完一首歌。装一个OpenUTAU,找一款免费配布的声库,翻调一首自己喜欢的歌。目标不是做好,是搞清楚「调校」到底在调什么。
第二步,发出来。创作赛期间带标签的作品更容易被看见,「周刊虚拟歌手中文曲排行榜」这样的常设榜单也已更新到733期。哔哩哔哩发布才有反馈,你才知道自己是真的喜欢这个过程,还是只喜欢「想拥有」的念头。
第三步,再开始做自己的声库。录几分钟干净干声,跟着DiffSinger教程训一个模型,那时候你会清楚自己卡在哪一环。
接下来值得盯的信号
创作赛周推荐(每周四更新)、周刊中文曲排行榜、OpenUTAU和DiffSinger的GitHub动态。创作赛9月1日截止,哪怕不参赛,周推荐的播单也是目前密度最高的「现在什么作品吃得开」观察窗口。
最后一句:这篇不是劝你入坑。但如果你已经想了一段时间,2026年8月底是个不错的动手时机——工具免费,教程官方出,声库有人配布,连五年级的小学生都做完了他的第一首歌。真正缺的,只是你的第一支作品。