用4090本地跑AI写歌是什么体验?ACE-Step工作流实测,附5首试听
最近AI音乐挺火的。Suno、Udio这些在线平台确实好用,但要么排队,要么得花钱订阅。我手头有张4090,就想能不能本地跑一个。
试了几个方案之后,锁定了 ACE-Step 1.5 这个开源模型,搭在 ComfyUI 上用。下面把整个过程和实际生成效果记录下来,给想自己折腾的朋友做个参考。
硬件和工作流
先报一下配置:显卡是 RTX 4090 24GB,模型用的 ACE-Step 1.5 XL Base,跑在 ComfyUI 上加一套自定义工作流。(实际跑下来不吃配置,很多中端显卡应该都能跑,就是速度会再稍微慢一点)
ComfyUI 里的工作流长这样:
ComfyUI工作流截图节点不多,说下关键的:
#104 模型加载:ACE-Step 1.5 XL Base,模型文件大概 6GB
#94 提示词编码:这里填两个东西,tags(风格描述,逗号分隔)和歌词(按 [Verse]/[Chorus] 这种格式写)
#98 时长控制:写多少秒就生成多少秒的音频
#78 采样器:CFG Scale 我一般设 2.0~3.0,数值越高越严格按提示词来
#127 输出:直接出 MP3,支持 V0/128k/320k 几种品质
改好 tags 和歌词,点生成,等几十秒就出结果。
速度和显存
这个应该是大家最关心的部分。
生成任务截图从 ComfyUI 的历史记录里截了两首的生成数据:
90 秒的情歌:35.94 秒生成完
120 秒的世界杯歌曲:47.75 秒生成完
折算下来大概是实时速度的 3 倍多(生成 1 秒音频花 0.3~0.4 秒)。我觉着这个速度够用了,去倒杯水回来歌就好了。
显存方面,ACE-Step 1.5 XL Base 模型本身占大约 6GB,推理过程中峰值没超过 10GB。换句话说,一张 3060 12GB 或者 4060 Ti 16GB 的卡就能跑,不用非得上 4090。当然显存大的卡生成会快一些,但门槛真的不高。这也是我觉得这个方案值得分享的原因之一。
五首歌的实际效果
一共生了 5 首不同风格的,下面逐首说说听感。每首都配了专辑封面图,用的是 SenseNova 生成的。
①《燃动世界》世界杯风格的主题曲(120 秒完整版)
《燃动世界》
提示词写的是 stadium anthem、epic orchestral、male/female duet 这类关键词。
这首是 120 秒完整版,也是几首里编曲铺得最开的一张。体育场风格的大编制,男女对唱加合唱段落,鼓点和铜管给得很足。"Go 为世界欢呼"那句副歌出来的时候确实有点燃。完整版比之前试的精简版好不少,前奏有铺垫,中间有过门,不是一上来就炸到底。
发朋友圈或者做视频背景乐应该合适,特别是体育相关的内容。
缺点也有:中文咬字在快节奏段落会糊,合唱部分的层次感和真人录的没法比。但考虑到这是 AI 从零生成的,我已经觉得超出预期了。
②《风走了八千里》情歌(90 秒)
风走了八千里
提示词走的是 singer-songwriter、acoustic ballad、breathy female vocals 路线,70 BPM。
钢琴配原声吉他,慢板。实话实说,歌词和提示词都是 AI 写的,我一个不懂音乐也不懂文学的理科男,就往里填了几个风格关键词。但"喜欢你像风走了八千里"这句唱出来的时候,还是有点意外的好听。整体是温暖叙事的感觉,从 Pre-Chorus 到 Chorus 的推进比较自然。
但有个问题得直说:人声带电音感,或者说合成味比较重。这是 ACE-Step 基模的通病,我换了三版提示词(从 mandopop ballad 改到 singer-songwriter acoustic 再到加 breathy/natural 关键词)都没完全解决。如果你对音色要求很高,现阶段可能还得等模型迭代,或者找带 vocal 微调的工作流来用。做背景音乐或 demo 的话,目前够用了。
插一句:从第三首开始,为了跑得快,我写提示词都只写了很短的一行风格词,生成的歌也比较短(55 秒左右),就留了最抓耳的副歌和核心段落。要是哪首你觉得好听,跟我说一声,后面可以加长歌词、补齐全曲,出个完整版。
③《暧昧频率》当代 R&B(55 秒)
暧昧频率
808 贝斯打底,男声走的慵懒路线。R&B 的 groove 出乎意料的稳,鼓点的 swing 感做得像回事。深夜开车或者当背景音乐放挺合适的。
55 秒确实短了点,副歌刚抓到耳朵就没了。人声转音和尾音的处理也比较生硬,没有真人歌手那种丝滑感。
④《自带底气》嘻哈 Hip-Hop(55 秒)
自带底气
trap 鼓点的质感在这几首里算最好的,beat 很顶。rap flow 的节奏框架立住了,停顿和重音的位置基本合理。
但中文 rap 的咬字一听就有机器味,不像真人在说唱。而且 flow 变化太少,整首听下来略显单调。嘻哈这种风格对人声自然度要求最高,目前 AI 在这个方向差距最大。我打算后续换个专门针对 rap 的提示词模板再试试。
⑤《Neon Heart》英文 Synth-Pop(55 秒)
Neon Heart
明亮洗脑的路线,"Shine like a star"那几句副歌听了两遍就在脑子里转。合成器音色做得不错,复古未来感的氛围到位了。
英文发音比中文自然很多,我猜是因为训练数据里英文歌占比大。这几首里面完成度最高的一首,风格匹配度和整体听感都在线。
优点和局限

说几点实际的:
做得好的地方:
完全免费,不依赖任何订阅服务,模型开源
生成速度快,4090 上 30~50 秒出一首
显存需求低,中端显卡就能跑
风格覆盖面广,抒情、电子、嘻哈都试了,各有各的味道
歌词完全可控,想写什么写什么
目前还不行的地方:
人声合成感明显,尤其是中文和快节奏段落
超过 2 分钟的长曲目,结构把控能力下降
细节打磨不够,没法直接商用
需要一点技术门槛(装 ComfyUI、导工作流、调参数)
生成质量偶尔不稳定,换个 seed 会不一样
怎么上手?
感兴趣的可以按这个顺序来:
下载模型:ACE-Step 1.5 XL Base,HuggingFace 上有
装 ComfyUI:官网提供一键包,Windows/macOS/Linux 都支持
导入工作流:把我用的这个 JSON 导进去
改提示词:填 tags 和歌词,设时长,点生成
不想碰 ComfyUI 界面的话,也可以用 WorkBuddy 的技能封装,对话里直接说"帮我生成一首 XX 风格的歌",底层自动调这套流程。
最后说两句
AI 写歌现在肯定替代不了人类创作。但作为一个创意辅助工具,它已经能干不少事了。有个旋律灵感但不会编曲?丢给它。需要一段 BGM 但版权麻烦?自己生。想做视频配乐但预算有限?这就是个路子。
而且全部本地运行,数据不经过任何第三方服务器,这点对在意隐私的人来说很重要。
以上就是我这阵子折腾 ACE-Step 1.5 的真实记录。有问题评论区见。
本文所有歌曲均为 AI 生成,仅供技术交流和学习使用。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
