开源音乐生成一直有个尴尬:文本和图像模型早已进入「生成—修改—再生成」的工作流,音乐却还是按下按钮、整首抽卡。9 月 10 日,音乐生成模型 YuE2-3B 上架 Hugging Face(模型卡),据开源模型追踪站 The Open Weights 报道,它出自 OpenMOSS,思路正是冲着这个痛点:先写乐谱,再生成歌曲。
乐谱变成一等公民
主干是一套 AR–NAR Mixture-of-Transformers:模型先输出 ABC 记谱法写成的乐谱与语义 token,再经 flow matching 生成声学隐向量,最后由 VAE 解码成 48 kHz 立体声。规划与合成在接口层也是分开的——pipe.plan() 先出乐谱,你可以手动改旋律、改和弦,再交给后续管线渲染音频。三档控制粒度:旋律加和弦、只锁旋律、完全放开。翻唱走同一条路:先用 SheetSage2 把原曲转成 ABC 乐谱,再用 Qwen3-ASR 等工具对齐歌词,换风格重新渲染。
模型卡还展示了一个 9 步 14 版本的 agentic editing 案例:把「换成爵士、加段萨克斯 solo」这类反馈交给 agent,由它改乐谱、改风格、改歌词,YuE2 渲染下一版——音乐生成从一次性抽卡变成可对话的协作。
71 秒一首,家用显卡跑得动
参数量 3B 级,部署门槛随之下降:官方实测 RTX 4090 上一首 3.6 分钟的歌 71 秒生成,峰值显存约 11.2 GiB,无需量化;一张 24GB 显卡加 24GB 内存即可跑通创作、翻唱、编辑全流程。服务器侧配 vLLM 0.19,32 路并发时吞吐 3231 tokens/秒、每小时约 373 首。
官方基准上的成绩单
在团队自建的 WildSongBench(192 条 prompt)上,YuE2 best-of-8 的 SongBench 平均分 6.9632,高于表内全部开源与闭源对手——Suno v5 为 6.8721,开源阵营的 LeVo 2(6.3247)、MiniMax Music 3(6.2830)被明显拉开;零样本翻唱任务 SHS100K 上 CLEWS Hit@1 达 71.3%。需要说明:这是官方基准、官方口径,技术报告标注 coming soon,数字宜等独立复测再下结论(追踪站报道)。
权重以 CC BY-NC 4.0 许可放出——可研究、可个人使用,商用不行;模型卡显示近 30 天下载 19 次,它才刚进入社区视野。
对做音乐的人,这次发布真正值得记的不是跑分,而是它把「乐谱」——音乐行业的源代码——还给了用户:不满意改两小节重新渲染,比整首重抽划算得多。3B 级参数就把完整歌曲生成塞进家用显卡,也再次说明垂直模态未必需要通用大模型的体量。接下来看正式技术报告与社区翻玩。