SoulX-Singer是春节新发布的开源音乐翻唱大模型,能将任何歌曲转换为指定人物的声音演唱。它支持多种语言和控制模式,结合ComfyUI实现一键生成,让零基础用户也能轻松制作AI音乐,解决了传统歌声合成门槛高的问题。
智能速览
支持Melody和Score两种控制模式。
兼容普通话、英语和粤语翻唱。
通过ComfyUI节点简化操作流程。
提供详细工作流搭建教程。
演示效果:用良子声音翻唱《生日快乐》歌。
精华内容
SoulX-Singer模型由Soul AI Lab团队开发,旨在实现高保真零样本歌声合成,为用户提供灵活的声音克隆解决方案,开启AI音乐制作新可能。
模型概述
SoulX-Singer是一款开源音乐翻唱大模型,支持零样本歌声合成,无需微调即可生成高质量歌声。它基于42,000多小时对齐数据集训练,覆盖普通话、英语和粤语,确保跨语言声音一致性。
模型在春节期间发布,迅速吸引了AI音乐制作社区的广泛关注,实测生成速度仅需几秒钟。
控制模式
模型提供两种控制模式:Melody模式基于原歌曲旋律生成,更忠实于原曲;Score模式基于乐谱和歌词生成,更贴近目标人物声音。
Melody模式保留原曲音高和节奏细节,适合精确翻唱;Score模式则赋予创作自由度,让模型自主预测声学特征,测试中Score模式在声音相似度上提升20%。
ComfyUI集成
HM Running Hub开发了ComfyUI节点,简化了模型部署。用户只需上传目标声音片段和歌曲文件,即可在工作流中配置语言和控制模式。
工作流包括音频预处理、SVS推理等步骤,全程可视化操作,适合初学者快速上手,节点安装通过ComfyUI Manager一键完成。
实际演示
在演示中,使用良子直播时的音频片段和《生日快乐》歌,模型成功复刻了良子声音进行翻唱,效果自然逼真,音频质量评分达4.5/5。
测试显示,翻唱过程平均耗时3秒,支持语言切换如粤语翻唱,证明了模型的实用性和高效性。
SoulX-Singer为AI音乐制作提供了强大工具,降低了创作门槛,未来可能推动更多个性化音乐应用的发展,但需关注版权和伦理问题。你准备好尝试AI翻唱了吗?