MiniMax Music 3 开源,8G 显存也能写歌自由
MiniMax 把 Music 3 的权重放出来了。你给它一句想法或者一段歌词,它就把作曲、编曲、演唱、混音一口气干完,吐出一首最长 5 分钟的歌,32kHz、16-bit 立体声 WAV。
我更在意的不是"又多了个写歌 AI",是它这次真能下载到自己机器上跑。时间点也有意思:同一天,闭源的 Suno 说要从 9 月 3 日起收下载额度,免费版一辈子只能下 7 首,Pro 每月 20 首。MiniMax 转头把权重甩上 Hugging Face。一个收,一个放,这种事在开源圈见得多了。

开源到底意味着什么
说白了,权重能下,就不只能在线用。Hugging Face、GitHub、ModelScope 都能拉。拉到自己机器上,没有次数上限,不收订阅,也不用担心哪天服务商改政策把工具收走。对天天要背景音乐的内容创作者来说,这种"东西在我自己硬盘上"的感觉,跟云端按月扣费完全两码事。
还能改。社区已经在上面微调各种风格的分支版本了,这种事在闭源平台根本不可能发生。
不过许可证有个坑,打算商用的先看清楚。它用的是 MiniMax-Music3 Community License,不是 Apache / MIT 那种真开源。自己下载、本地跑随便。做产品商用默认允许,但界面上必须明显标出 "MiniMax-Music3" 这几个字。年营收过了 2000 万美元,得单独找 MiniMax 拿书面授权。好的一面是这次没有地域排除,不像前阵子 H3 视频许可把美、欧、英、韩剔了出去。坏的一面是训练数据来源没公开,本地跑等于把版权风险也接到了自己手里,这事暂时没解。
几个硬参数:语言模型 8.6B(8B 全局加 0.6B 局部),整条链路算上合成模块约 11B,从 Qwen3 那一支 8B 文本模型初始化来的;中、英、日人声都支持;歌词里写 [Verse]、[Chorus]、[Bridge] 这种标签就能控结构。
什么配置能跑
这块网上说法特别乱,我替你捋一下。官方模型卡写的是"推理需要两块 CUDA 显卡",那是 SGLang-Omni 的推荐用法,一张跑语言模型、一张跑声音解码,快,但不是必须。社区实测单卡也能跑,就是慢。
按显存分三档。
24GB 最舒服。RTX 3090、4090 这类卡,全精度单卡塞得下,普通人闭眼选。实测生成 3 分钟歌大概 219 秒。
12GB 能用但憋屈。RTX 3060 12G,开 layer streaming 一层层往显存里搬,跑得起来,就是慢。
8GB 也能尝鲜。RTX 3070、4060 Ti 8G,开 CPU 卸载能跑通。社区还做了 INT8 量化版,权重文件才 2.5GB 左右。有人拿 RTX 3060 Ti 8GB 实测,INT8 模型加轻量化文本编码器加解码器凑一起约 12GB 占用,就能本地出歌,一首 118 秒的歌花了大概 15 分半。能跑,但得等。
两个提醒。第一,目前只认 NVIDIA 的 CUDA,Apple Silicon 跑不了本地推理,Mac 用户暂时没戏,除非等社区移植。第二,内存建议 32GB 起,开卸载更吃内存;fp16 权重约 22GB,算上依赖留 30GB 以上硬盘空间。
部署有三种路子。最省事的是 ComfyUI:升到 0.33.0 以上,模板库加载 MiniMax Music 3 工作流,权重丢进 models/minimax_music/ 目录,填歌词和描述点运行。也有第三方整合包,双击 run_nvidia_gpu.bat 就起,不用自己折腾 Python。会写 Python 的可以走官方 diffusers 管线,全精度能压到 24GB 以内,适合接自己项目。不想碰显卡的,RunningHub 云端直接跑,或者 Hugging Face ZeroGPU 有免费额度(有限),官方 API 模型名 music-3.0,约 0.15 美元一首。
这东西给谁用
独立音乐人拿它出 demo 最快,灵感来了几分钟听到成品,把时间留给真正要人判断的旋律和词。
内容创作者应该是最开心的。短视频、播客、视频号,天天要背景音乐,本地无限生成就没有订阅焦虑和额度焦虑。Suno 一收紧,这批人第一个转头。
开发者能拿开源权重接进自己的产品,或者微调特定曲风。爱好者更简单,一张 24G 卡,今晚就能在家产出自己的第一首 AI 歌,离线、私有、随便改。
老实说,论音质和编曲的完整度,它还不如 Suno V5,多轨层次差一截。但人声清晰度和中文咬字,不少人觉得比 Suno 还清楚。它赢的不是"最强",是"在我自己电脑上、不要钱、不限次、还能改"。对上面这几类人,这几点够了。
写到最后
我这两天看下来,最大的感受是 AI 创作工具一个接一个走到本地了。图像最早,Stable Diffusion 那波;然后是视频;现在轮到音乐。
Music 3 本身不算惊艳。但 8B 级的模型就能在家生成一首结构完整的歌,8G 显卡都够尝鲜,这事放在两年前很难想象。那时候想跑像样的生成模型,四张 A100 起步,跟普通人没关系。
门槛是真的在往下掉。今晚手里有张 3090 的,去 Hugging Face 拉个权重、架个 ComfyUI,就能在家跑起一个写歌引擎。至于实时生成、风格微调那些,是以后的事。现在
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
