8月14日,MiniMax 把自家音乐生成模型 Music 3 开源了,权重直接放上 ModelScope 和 HuggingFace,ComfyUI 当天就给了 Day-0 支持。微博社区里当天被转得最多的一句话是:“开源的大日子,这是真正的 Suno 替代品”。微博
而另一边的开源模型 ACE-Step 1.5,从 1 月发布到现在,已经在各种整合包和教程里默默流通了半年。知乎
于是这两天,音乐制作圈反复出现一个经典问题:Suno 的订阅一个月要 10-50 美元(按档位不同),现在 AI 音乐能免费在本地跑了,这订阅是不是真的能省?微博两个开源模型,到底该装哪个?
先说结论:能省,但取决于你的显卡和用途。
两个模型都是什么,先捋清楚
MiniMax Music 3 是刚开源五天的新选手:
8B 的 Qwen3 做全局 LLM,搭配 Flow Matching 生成音频,一次最长能出 5 分钟完整长曲,前奏、主歌、副歌、桥段的结构不容易崩;
可控性是它的卖点:结构、人声、节奏、歌词都能用提示词编排,可以标段落、定曲风和乐器;
输出 32kHz 立体声;
官方给了低显存方案,8GB 的 N 卡能跑,但速度会慢一些;
官方仓库还配了 Prompt 扩写工具,ComfyUI 0.33.0 以上搜 Music3 就能直接用,也可以走 ComfyCloud 云端。微博

ACE-Step 1.5 是已经打磨了半年的老将:
ACE Studio 和阶跃星辰联合开发,MIT 协议完全开源,可商用;
1 月发布 1.5 版,4 月又推出 XL 系列(DiT 升级到 4B 参数);
快是最大优势:RTX 3090 级别的卡 10 秒内出一首歌,支持批量生成,最长 10 分钟;
显存门槛低:教程资料里写 4GB 就能起步,RTX 4060 Ti 8GB 这类主流卡跑得很流畅;
生成后的编辑功能全:局部重录、改词、翻唱、时长对齐都能做;
能用自己的作品训 LoRA,让生成结果带上"你的味道"。知乎

制作人们最关心的三件事
第一,我的显卡到底能不能跑?
两个模型的门槛都是 8GB N 卡起步,但"能跑"的含义不一样。ACE-Step 的能跑是流畅跑,10 秒一条 demo;Music 3 的 8GB 是官方低显存方案,能跑但明显更慢。知乎微博12GB 以上的卡两者都从容;只有 8GB 又看重效率,眼下 ACE-Step 的体验更好。
没有 N 卡、或者不想折腾的,别硬上本地部署。云端服务仍然最省心,省下的订阅费未必抵得上你的时间成本。
第二,音质到底谁好?
这个真没法给死结论。有社区教程资料称 ACE-Step 1.5 在 SongEval 基准上拿到 8.09 分、高于 Suno v5 的 7.87——但基准分不等于听感,只能当个参考。知乎社区实测也指出了它的短板:提示词遵循能力一般,歌词和段落对齐是弱项,想要完全按提示词出结果,往往要多抽几次卡。CSDN
能确定的是,这一代 AI 音乐的通病还在。8 月中旬首尔艺术大学发布了一张和 Suno 合作的专辑,电子音乐专业的 Slom 教授逐曲点评时提了两个问题:AI 人声容易有雷同感,编曲容易给得太满,需要使用者靠专业能力做取舍。微博这两条对目前所有 AI 音乐模型基本都成立,这两个开源模型也不例外。
而且 AI 的"量产感"已经开始被耳朵认出来了:微博上有人吐槽现在抖音热单"看着都是 Suno 量产的"。微博开源模型解决的是成本和控制权问题,不解决"AI 味"问题。
第三,到底选哪个?
要快速出 demo、批量做短视频 BGM,显卡 8-12GB:选 ACE-Step 1.5。生态成熟,整合包、ComfyUI 工作流、LoRA 教程都是现成的,B站一个部署教程视频被收藏了近 2000 次,社区验证了半年。哔哩哔哩
追求成品质量和结构控制,能接受慢一点,本身就在用 ComfyUI:试 Music 3。5 分钟完整结构加段落级控制,是它目前在开源阵营里最强的维度。
要做商用音乐:先看协议。ACE-Step 是 MIT 可商用;Music 3 是开源权重,具体商用条款以 ModelScope、HuggingFace 页面为准,确认了再用。

部署路线,各两句
ACE-Step 1.5:GitHub 官方仓库直接装,或下 Windows 整合包;ComfyUI 有现成工作流,跟着 B 站教程半小时能出声。
Music 3:ComfyUI 升到 0.33.0 以上搜 Music3,或走 ComfyCloud;权重从 ModelScope 或 HuggingFace 下,配合官方 Prompt 扩写工具写提示词。
最后留两个观察信号
一是 Music 3 的社区生态。开源模型越用越强靠的是社区 LoRA 和工作流,这条路 ACE-Step 已经跑通了,Music 3 刚起步,值得再看一两个月。
二是商业模型的迭代速度。目前很多人还是拿 Suno 的听感当标尺来量开源模型,开源追平是"多快"的问题,不是"能不能"的问题。显卡不给力的话,继续订阅也不丢人,效率优先。
一句话收尾:对音乐制作党来说,开源 AI 音乐模型今年算是跨过了"能用"这道线。有 8GB 以上 N 卡的,今天就可以把 ACE-Step 1.5 玩起来,Music 3 值得蹲一个后续;没有卡的,云端服务仍是首选。订阅不是非省不可,但现在你确实多了一个不花钱的选项。