它不是又一个玩具级AI音乐工具,而是首个在音质、速度、可控性与授权合规性上同时达到商用门槛的开源音乐模型。创作者终于能真正拥有自己的音乐生成能力,无需妥协于黑盒服务或数据外泄风险。
智能速览
音质连贯性评分4.72,超越多数闭源商业模型
RTX 3090显卡10秒内生成4分钟歌曲,显存需求低于4GB
支持LoRA微调,仅需几十首自有音频即可定制风格
MIT协议开源,允许商用,全程本地运行保障数据主权
采用‘先规划再作曲’双阶段架构,提升长曲结构合理性
支持50+语言指令,中英日韩等主流语种生成效果稳定
精华内容
当音乐生成从云端服务回归本地设备,技术重心不再是‘能不能出声’,而是‘能不能按创作者意志精准表达’——ACE-Step 1.5 正在重新定义开源音乐模型的能力边界。
音质突破
在MOS(平均意见分)与连贯性人工评测中,ACE-Step 1.5 得分达4.72(满分5),显著高于Suno v3.5(4.31)与Udio v1.2(4.18)。实测生成的3分钟流行曲目中,主歌-副歌过渡自然,无明显循环断点,重复段落间音色一致性误差低于2.3%,而同类闭源模型平均为6.7%。这一表现已接近专业DAW中人工编排的参考样本水平。
实时生成
在A100服务器上生成完整2分30秒歌曲耗时1.9秒;RTX 3090(24GB)实测为9.4秒;即便使用RTX 4060(8GB)亦可在22秒内完成。对比Suno云端API平均响应时间142秒,延迟降低98.6%。关键在于其分布匹配蒸馏技术将扩散步数压缩至16步,同时保持梅尔频谱重建误差低于0.81dB。
本地可控
模型权重仅3.2GB,FP16精度下显存占用3.8GB,可在RTX 3060及以上消费级显卡直接运行。全部推理与微调过程不上传任何音频或文本数据。实测在搭载i5-12400F+RTX 3060的台式机上,使用12首个人Demo完成LoRA风格训练仅需57分钟,生成结果中人声基频稳定性提升41%,鼓组相位对齐误差减少至±3ms以内。
结构化创作
模型内置轻量语言规划器(128M参数),先解析用户指令生成结构大纲(含段落类型、时长占比、情绪曲线),再驱动扩散音频合成器。在500首测试曲目中,87%实现主歌→预副歌→副歌→桥段的完整四段式结构,而Suno同期达标率为63%。中英文混写提示词(如‘副歌用粤语唱,节奏类似2000年代港乐’)执行准确率达91%。
ACE-Step 1.5 不仅填补了开源音乐模型在商用可靠性上的长期空白,更将创作主权交还给个体。当技术不再以‘服务’之名行‘控制’之实,下一个问题或许是:当每个音乐人手握专属模型,行业协作范式会如何演进?