YuE2开源这两周,本地写歌圈的热闹程度,像极了去年Stable Diffusion刚刷屏的那几天。
时间线先摆清楚:9月12日前后,港科大M·A·P团队(联合斯坦福、NYU等机构)开源了音乐模型YuE2,项目发布后热度很高,所在 GitHub 仓库近七天新增约 2.9k Star。紧接着B站、小红书的解说标题就开始升级——“8G显存ComfyUI本地跑,完爆Sunov6”。而几乎同一时间,Suno在9月9日发布v6,头一回用华纳、BMG、Believe三家授权的音乐做训练,协议里写了分钱,提示词还不许再写真人歌手名字。知乎哔哩哔哩知乎
一头是云端开始按授权收费、审核收紧,另一头是本地模型宣称摸到天花板——这两件事叠在一起,才是"要不要入坑本地写歌"突然变成真问题的原因。我把官方模型卡、知乎解读、B站实测、小红书部署笔记翻了个遍,发现刷屏标题和原始数据之间,至少差着三笔账。
第一笔账:「完爆Suno」这句话,官方自己是怎么标注的
B站那个高收藏工作流视频的标题是"完爆Suno v6",但你去翻官方模型卡,原文口径完全是另一回事。
官方基准叫WildSongBench,只有192组中英文提示词,YuE2的成绩确实进了头部区间,但模型卡里跟着三条限定,被几乎所有解说视频省略了:官方提醒头部均值差距很小,不能证明具有统计显著性;best-of-8筛选后音素错误率反而上升;不同模型使用的候选协议也不完全一致。知乎
拆开说:跑分用的是"每条提示词生成八个候选再挑最好"的best-of-8协议,标准模式也是两选一,都不是单次直出;被选中的版本可能整体更像一首好歌,但吐字更差——YuE2 的音素错误率从标准设置的 8.44% 上升到 9.79%。

再看真实体感。知乎上有开发者用同一个Boogie Woogie风格、同一份歌词做A/B对比,结论是器乐更丰富、演唱表现力稍强的还是Suno,但YuE-2版本也绝不算差;他把Q8量化的GGUF版本用audio.cpp在本机跑通后,主观判断是"至少达到了去年 Suno 4.5 的水准,抽几次卡就有相当好听的版本"。小红书也有人写本地跑完"生成质量有点惊人"。知乎小红书
所以第一笔账的结论:"完爆Suno v6"是UP主标题,"进入头部区间但单次直出有差距"才是官方口径。想要一键就得到Suno那种副歌抓耳的成品,你会失望;想要能改、可控、不限次数,往下看。
第二笔账:你的显卡到底行不行,别看整合包标题
YuE2本体约36亿参数、28层,流程是"提示词→ABC文本乐谱→语义Token→声学潜变量→48kHz立体声"。官方环境门槛写得清楚:Linux、支持 BF16 的 NVIDIA GPU 为主,建议准备 24GB 显存和 24GB 主机内存;但同一条模型卡里还藏着一个关键数字:常规测试峰值显存约 11GB,在 RTX 4090 上生成约 3.6 分钟歌曲需要 71 秒。知乎
这两个数字一比,就能看懂社区那些标题了——官方"建议24G"是留出余量的舒适区,"峰值11G"才是日常水位。按这个拆,分三档:
你的情况 | 现实路径 | 坑在哪 |
|---|---|---|
N卡16G以上+Linux | 官方路径,今天就装 | 几乎没坑,就是环境维护 |
N卡11–16G或Windows | 量化版+社区ComfyUI工作流 | 评论区高频问题是"缺失节点包",出问题官方不管 |
8G显存/AMD/无卡 | 8G量化整合包、9070XT开源移植、租云、GGUF+audio.cpp | 全是社区方案,音质再打折;AMD移植者自己是把四项能力逐个测通的 |

社区路线也不是空话:RX 9070XT 16G的B站UP主把N卡专属的工作流完整搬到A卡上,四项能力全部实测跑通后还把移植代码开了源。Windows方向则有人借ComfyUI便携整合包的嵌入式Python环境跑通了官方只给Linux指引的部署。哔哩哔哩哔哩哔哩
没有显卡也别急着升级硬件:小红书有人实测零代码部署教程里"2块钱一小时跑出30首带人声完整歌曲"(单一博主口径,仅供参考)。想先试耳朵的,官方合作平台NOIZ的页面有免费生成3首的额度。小红书知乎
第三笔账:免费是权利的起点,不是终点
本地党最容易忽略的是授权结构。YuE2的许可分三层,混着看必翻车:代码、文档和 Agent Skill 使用 Apache 2.0;模型权重使用 CC BY-NC 4.0,并附带个人创作者许可,个人创作者可以销售、授权和变现生成结果,公司商业使用模型权重则要联系项目方。翻唱他人歌曲仍可能涉及词曲、录音和表演者权利,模型许可不能代替歌曲授权。知乎
训练数据侧,官方称 YuE2 使用了约 34.6 万小时音乐训练,主要来自 CC0 音乐和获得授权的合成数据,但技术报告还没发布,完整数据构成要等后续材料——这一点和上月H3开源时的节奏一模一样,先跑起来的人等于在替后来的人趟雷。
对照Suno那笔账才看得清:9月9日之后,你在Suno上点一次"生成",就有人开始收钱,不是平台收,是版权方收,分成从超过200万付费订阅用户的收入池子里切,比例没公开,没被唱片公司或发行商代表的独立创作者根本不在分配链路上。云端审核还越来越紧,同一份歌词在Suno可能被立即拒绝,本地模型没有这层拦截。本地生成给你的不是"版权自由",是"责任自担"——这两件事差别很大。知乎知乎

真正买到手的不是音质,是那份「中间稿」
如果只把YuE2当"免费版Suno",其实低估它了。它和Suno最大的架构差异,是在提示词和音频之间插了一份可读、可改的ABC符号乐谱:生成一首歌,同时拿到音频+乐谱+参数;想保留旋律只把和弦换成爵士,改谱子重新渲染就行;做翻唱,配套的SheetSage2先把原曲转成旋律谱,换词换风格再唱一遍。仓库还带了yue2-music Skill,让Agent直接在乐谱层干活。官方 Demo 中的《The Last Train》经过 9 个编辑步骤、14 个版本,从中文流行改成英文爵士,又加入了萨克斯独奏。知乎

但别高兴太早:这是作曲层控制,不是DAW的局部无损编辑——改一个和弦,其他部分的人声、音色和演奏细节也可能跟着变。官方翻唱实验里也验证了乐谱的价值:YuE2 使用完整乐谱时,衡量歌曲身份保持程度的 CLEWS mAP 为 0.647;只保留旋律时为 0.598;完全不提供乐谱时降到 0.006——约束越少,模型越容易自由生成一首新歌,要保留原作的旋律身份,乐谱才是关键。知乎
谁该装,谁再等等
结合这三笔账,切片给结论:
你是 | 建议 |
|---|---|
Linux+N卡16G、要做BGM的自媒体/视频作者 | 装,71秒一首歌+零授权费,量大管饱 |
想学编曲、需要"改副歌不改主歌"的爱好者 | 装,乐谱编辑是它独一份的能力 |
8G显存Windows笔记本、刚看完整合包视频 | 等,等官方Windows支持或量化方案收敛,现在装=给博主贡献收藏量 |
公司想把AI歌曲投广告、进商单 | 先别装,CC BY-NC商用需联系项目方,上游权利链条也没闭合 |
就想要一键好听的成品歌 | 别折腾,NOIZ免费3首或继续订阅Suno更省心 |
值得继续盯的信号:技术报告什么时候发、官方会不会补Windows和低显存支持、社区量化版音质会不会再收窄差距、以及"个人创作者许可"的边界会不会随版本变。
上月MiniMax H3把开源推到视频,这月YuE2把它推到音乐,下一个被敲门的生成领域只是时间问题。而每一波都一样:刷屏标题和模型卡之间,永远差着一笔账。装之前先把那笔账算完,这个原则适用于任何一个新开的本地模型。