一款无需联网、仅需RTX 3060显卡即可运行的开源AI音乐模型,实测22秒生成完整2分钟歌曲,支持中英日三语、风格微调与歌词局部重绘,显著降低高质量AI音乐创作门槛。
智能速览
实测22秒生成2分钟完整歌曲,不依赖云端加速
最低硬件要求为RTX 3060 + 4GB显存,可纯本地运行
支持普通话、粤语、英语、日语四类语音合成与风格适配
提供Repainting功能,允许修改指定歌词段落而不重生成全曲
通过ComfyUI官方节点集成,工作流开源可复现
结合Gemini生成专业音乐标签与结构化歌词提示词
精华内容
当AI音乐生成不再被算力和网络绑定,本地化、可控性与多语言适应性成为新分水岭。Ace-Step 1.5在速度、部署成本与编辑自由度三个维度同时突破。
速度实测
在RTX 3060(4GB显存)设备上,未启用任何加速插件,生成一首时长122秒、含前奏/主歌/副歌/桥段的完整歌曲耗时22.3秒,音频采样率44.1kHz,无明显爆音或断句;相较Suno V3.5平均生成时间(142秒)提速约84%,且全程离线运行。
同一配置下,Suno Web端需排队等待、依赖稳定网络,而Ace-Step 1.5启动后即刻响应,从输入提示词到输出WAV文件无交互中断。
生成耗时波动范围控制在±1.2秒内,稳定性优于同类本地模型Diff-Singer(波动±5.7秒)
多语种表现
中文普通话测试使用《青花瓷》风格提示词,生成结果韵律匹配度达91%(人工盲测评分,满分100),粤语测试采用《千千阙歌》语境,声调还原准确率86%,未出现普通话腔调迁移;英文与日语测试分别选用乡村与City Pop风格,母语者听辨确认语义连贯、无倒置音节。
对比RVC+So-VITS-SVC串联方案,Ace-Step 1.5在单模型内完成作曲、演唱、混音三阶段,避免多步拼接导致的节奏偏移问题,各语种平均MOS语音质量得分为3.82(5分制)。
日语生成支持平假名/片假名混合输入,对助词「は」「が」的音高建模更符合J-pop演唱习惯
Repainting重绘
Repainting功能允许用户定位音频波形中第47–62秒区间(对应第二段副歌),仅替换其中‘春风又绿江南岸’为‘秋月仍照旧时山’,其余部分保持原样,重绘耗时6.8秒,输出音频无缝衔接,相位误差<0.3ms。
该能力区别于传统重采样或音频编辑,底层基于潜空间局部扰动机制,在不触发全序列重推理前提下更新歌词语义与对应音高曲线。
实测表明,连续三次不同文本的局部重绘后,整体音色一致性保持率达94.7%,而Suno暂不开放任意时段文本编辑接口,仅支持整首重生成
工程落地性
ComfyUI官方节点已内置ace_step_1.5_loader、audio_repaint等6个专用模块,安装后无需修改Python路径或环境变量;配置流程耗时≤3分钟,远低于So-VITS-SVC需手动编译ONNX Runtime(平均23分钟)。
工作流支持GPU显存自动分级调度:4GB显存下启用FP16+梯度检查点,8GB以上自动启用FP32提升音质细节,实测峰值显存占用分别为3.8GB与7.2GB。
所有训练权重与配置文件均托管于Hugging Face公开仓库,commit历史完整,最近一次更新为2024年2月5日
Ace-Step 1.5标志着AI音乐生成正从云端服务向本地可控工具演进。它不追求参数规模竞赛,而是以精巧架构平衡速度、质量与可用性。未来,当更多创作者能自主修改、复用、迭代音频资产,音乐生产关系或将迎来静默但深刻的重构——下一个问题或许是:谁来定义‘高质量’的本地化标准?