2026 年 9 月上旬,开源社区 M-A-P 发布了歌曲生成模型 YuE2-3B,权重与代码同步上线 Hugging Face 与 GitHub。它最特别的地方不在音质,而在流程:先写一份可以打开的乐谱,再把这份乐谱唱成一首完整的歌。
先写谱,再演唱
主流音乐生成模型的路径是文本或歌词直接进、音频直接出,改一个和弦只能换个种子重新”抽卡”。YuE2 把中间那一步显式地拿了出来。
模型采用自回归与非自回归混合的 Transformer 主干,官方接口正好对应四个步骤:首先由歌词与风格提示生成一份 ABC 记谱格式的乐谱,包含旋律与和弦;接着把乐谱转成 25Hz 的语义 token;再由 flow matching 生成声学潜变量;最后解码为 48kHz 立体声音频。
由于乐谱是纯文本,改旋律、换和弦、调速度、动段落都可以在”音符”这一层完成,改完再重新渲染整首歌。官方把这套流程称为白盒音乐生成。仓库里还附带了一个技能包,支持 Codex、Claude Code 这类兼容技能文件的智能体直接加载,用来做生成、翻唱和改谱;文档明确说明,并不需要额外的专用智能体模型,智能体只是在既有接口之间做调度。

生成时有三种模式可选:默认模式同时规划旋律与和弦;旋律模式只规划旋律,官方推荐用于翻唱;关闭模式则不写谱直接生成,也就拿不到可编辑的乐谱。
改得准不准,有数据
官方给了一组小规模配对实验:10 首原创作品、2 个种子、380 段完整录音。改动音符的旋律达成率从 0.0083 提升到 0.9375,改动和弦的和声达成率从 0 提升到 0.8313。
需要说明的是,样本只有 10 首,而且是在这批作品上开发的方法。官方自己也写明,这证明的是”能通过乐谱做选择性控制”,并不代表未改动部分的波形会一模一样——重新渲染后,歌声和音色仍会变化。
超过 Suno 了吗?要连着前提一起读
模型卡的原话是:YuE2 在自建评测集 WildSongBench 上,采用从 8 首里挑 1 首的做法,SongBench 均分 6.9632,Suno v5 为 6.8721。这句话是真的,但有四个前提必须同时看。
第一,基准是团队自建的。WildSongBench 共 192 条提示,其中 94 条中文、98 条英文。第二,挑出来的那首是按 Musicality 维度、提示词遵循、音素错误率的顺序筛选的,官方文档承认这并不等于单次调用的水平。第三,不挑选的标准版 YuE2 得分是 6.7316,低于 Suno v5 的 6.8721 与 Mureka 9 的 6.9377,只是略高于 Suno v5.5 的 6.7150 与 Suno v4.5 的 6.6995。第四,官方声明这一差距不构成统计显著性,也不代表所有指标领先或人类更偏好。
同一张表里,文本与音频的对齐指标由 Suno v5 更高;歌词发音错误率方面,Suno v4.5 的 5.80% 最好,YuE2 标准版为 8.44%。横向对比另一款本地方案 ACE-Step 1.5,其均分 6.0118,但歌词错误率 7.46% 更低。倒是纵向对比更有说服力:一代 YuE 只有 4.9165,一年半时间里同一团队把分数拉到了 6.73。
更准确的说法或许是:开源权重模型第一次进入了闭源头部产品的分数区间,而不是全面超过。
翻唱表现:差距几乎全部来自乐谱
在 SHS100K 上,官方测试了 948 首作品、2 种风格、2 个种子,每种方法生成 3792 首且不做挑选。衡量歌曲身份保留的 CLEWS mAP 指标中,ACE-Step 1.5 为 0.024,YuE2 完整乐谱为 0.647,去掉和弦为 0.598,完全不给乐谱则跌到 0.006。
这张表最有信息量的地方不是谁赢,而是同一个模型不给乐谱时身份保留几乎归零。也就是说,翻唱”像原曲”这件事几乎完全来自乐谱条件,而不是模型记得原曲。反过来,乐谱给得越死,目标风格的贴合度就越低——这是一组真实的取舍。
硬件门槛与成本
官方要求为 Linux 系统、Python 3.10 以上、24GB 显存的 NVIDIA 显卡(需支持 BF16)以及 24GB 可用主机内存,一次处理一首歌,Mac 不在官方支持列表中。
在 RTX 4090 上的实测数据(32 次热启动取平均,未量化)显示:默认模式生成耗时 71.04 秒,产出 214.85 秒音频,峰值显存 11.18 GiB;旋律模式为 68.68 秒、214.67 秒、11.02 GiB;关闭写谱模式为 57.91 秒、196.88 秒、11.09 GiB。虽然峰值只有约 11GB,但官方称最长上下文测试时峰值达到 14.08 GiB,因此把 24GB 定为支持基线。
按云端 RTX 4090 每小时 0.34 美元的价格估算,71 秒约为 0.0067 美元,折合人民币 5 分钱左右;若按基准那样生成 8 首选 1 首,成本约 0.054 美元。这一估算不含下载约 7.3GB 权重、配置环境和挑选试听的时间成本。服务端方面,用 vLLM 在 H800 上并发 32 路时,吞吐为每小时 373.53 首,峰值显存 76.61 GiB。
协议是最大的限制
授权分三层:代码与技能包为 Apache 2.0,可自由使用;模型权重与两个 VAE 为 CC BY-NC 4.0,禁止商业用途;配套的 SheetSage2 与 MERT-v2 同样为非商用协议。训练数据方面,官方称使用了 34.6 万小时音乐,主要为 CC0 音乐与合成数据,其中合成数据大部分由 Tokenwave.AI 授权提供。
对做配乐、做改编、做音乐教学的人来说,能够明确说出”第 12 小节换成 Dm7″,远比”再抽 20 次”有用得多。这也是 YuE2 与一众端到端音乐模型最实质的区别。







