M-A-P团队在Hugging Face上开源了歌曲生成模型YuE2-3B,参数约36亿,模型权重约7.26GB。它与多数音乐生成模型最大的不同在于流程:先根据歌词与风格提示生成一份可编辑的ABC乐谱,把旋律与和弦明确写出来,再由这份乐谱渲染成48kHz立体声的完整歌曲,最长可达5分钟,包含人声与伴奏。团队同时开源了配套的音乐表征模型MERT2与音频转乐谱模型SheetSage2,三个组件串起来构成一条从听懂音乐到写出音乐的完整链路。官方称在自建的WildSongBench上,挑选最好一首的YuE2取得SongBench均分6.9632,高于Suno v5的6.8721。
直接出音频的模型有一个共同的痛点:改一个和弦只能重新抽卡。换个种子、调整提示词,然后祈祷下一首更接近想要的效果。YuE2把作曲意图显式地落在ABC乐谱里,让旋律、和弦、速度与段落结构都成为可读可改的文本。创作者可以说第12小节换成Dm7,或者只保留旋律不动、把整段和声换掉,然后重新渲染。这种把中间产物暴露出来的做法,官方称之为白盒音乐生成。
白盒带来的另一个变化是智能体可以介入。由于中间产物是文本格式的乐谱,支持技能文件的大模型编程工具可以直接加载配套技能包来完成生成、翻唱与改谱。官方文档描述的流程是:先生成原版并冻结乐谱与音频,明确哪些部分不许改动,再把乐谱、歌词、风格与修改要求交给智能体产出新乐谱,用工具比对音符事件校验不变量,最后重新渲染整首歌与原版并排试听。在小规模配对实验中,改动音符时的旋律达成率从0.0083提升到0.9375,改动和弦时的和声达成率从0提升到0.8313。
第一个前提是基准自建。WildSongBench由YuE2团队发布,包含192条提示,其中94条中文、98条英文,技术报告尚未公开。用自家基准与自家配置去对比竞品,结论需要谨慎对待。第二个前提是分数取自best-of-8,也就是每条提示生成8首,按音乐性、提示遵循度与音素错误率的顺序挑出最好的一首。官方文档自己也承认,用评测指标的某一个维度来做挑选,并不等于单次调用的水平。
第三个前提是标准版并不领先。不做挑选的YuE2在同一基准上SongBench均分为6.7316,低于Suno v5的6.8721,也低于Mureka 9的6.9377,仅略高于Suno v5.5与v4.5。第四个前提是分维度各有胜负:在衡量文本与音频对齐的MuLan指标上Suno v5更高,在歌词发音准确度上Suno v4.5表现最好。因此更准确的说法是,开源权重模型第一次进入了闭源头部产品的分数区间,而不是全面超过。真正实在的进步是纵向的,同一团队上一代YuE的分数是4.9165,一年半时间拉到6.73。
硬件要求与实测数据是这个模型能否落地的关键。官方基线要求Linux系统、24GB显存的NVIDIA显卡与24GB主机内存,一次处理一首歌。在RTX 4090上的实测显示,完整模式生成一首3分35秒的歌耗时71.04秒,峰值显存11.18GiB;只规划旋律的翻唱模式为68.68秒,不写谱的直接生成模式为57.91秒。峰值显存只有约11GB,官方把24GB定为支持基线是为了覆盖最长上下文的情况,最长测试峰值达到14.08GiB。
按租用云端4090的价格估算,单首歌的边际算力成本约0.0067美元,折合人民币约5分钱;若按best-of-8挑选,成本约为8倍。真正需要计入的是权重下载、环境搭建、模型加载与试听挑选的人工时间,这些固定成本在短会话里往往比生成本身更贵。换个角度看,一张4090连续运行一小时大约能产出50首3.6分钟的歌曲,算力早已不是瓶颈。这也意味着音乐AI的门槛正在从硬件转向协议、流程与人的判断力。
YuE2的授权分三层:代码与技能包采用Apache 2.0可自由使用,模型权重与两个VAE采用CC BY-NC 4.0禁止商用,配套的SheetSage2与MERT2同样是非商用协议。对独立音乐人、教学场景与研究者,这套组合足够用;对想做商业配乐、广告音乐或平台服务的团队,权重不可商用意味着这套方案只能用于验证与原型,无法直接进入交付环节。这一限制在社区里引发了明显讨论。
非商用协议背后是训练数据与商业利益的现实约束。官方称YuE2使用了约34.6万小时音乐,主要来自CC0音乐与合成数据,合成数据大部分由合作方授权提供。这种数据构成让开源成为可能,却也限制了授权范围。同一周,主流唱片公司与AI音乐公司签下多年期授权合作,走的是另一条路:用授权曲库换取商业可用性。两条路径的对比很清楚,开源路线解决的是可复现与可研究,商业路线解决的是可交付与可分成,短期内很难合并成一条。