音乐生成这条赛道最近很安静,但 Hugging Face 的 trending 榜单上,MiniMax 的 Music 3 仍在持续霸榜——月下载 1.97 万次、1280 个点赞,社区围绕它产出了 22 个量化版本、18 个 finetune 和 34 个 Spaces 应用。在所有人盯着语言模型内卷的时候,完整歌曲生成的开源水位,正在被这种低调发布的模型悄悄抬高。

一首五分钟的歌,交给两个 LLM 分工

Music 3 的核心设计是分层自回归:一个 8B 的 Global LLM 负责逐帧预测 RVQ 第一层码本,建模整首歌的长程语义和结构推进——音乐主题、节奏、人声一致性、编曲演进都归它管;一个 0.6B 的 Local LLM 在每帧内补齐剩余声学码本,恢复颗粒度的声音细节。Global LLM 从 Qwen3-8B 初始化,训练时先把 embedding 和输出层适配到语义音乐 token,再与 Local LLM 联合训练。歌曲结构靠歌词里的段落标签控制:[Intro]、[Verse]、[Chorus]、[Bridge]、[Outro],配上音乐描述里的 BPM、调式、乐器编排——模型能跟随的不仅是全局风格,还有歌曲随时间展开的音乐发展。

最有意思的一步:不靠离散 token 合成音频

很多音乐生成模型止步于离散 RVQ token 解码,Music 3 在这里多走了一步:合成模块直接融合两个 LLM 的最终隐状态,这些连续表示保留了更丰富的声学信息——人声咬字、乐器质感、时间连续性。合成路径是隐状态融合 → Flow Matching(2.4B)→ Flow-VAE latent → 123M 参数的 Flow-VAE 解码器,最终输出 32kHz、16-bit 立体声 WAV。训练用的 tokenizer 是八层 RVQ:第一层语义码本 16384 项,其余七层声学码本各 1024 项;推理时波形合成只用融合隐状态,不再需要离散 tokenizer 解码器。这套 Flow-VAE 架构改编自 MiniMax 的语音技术线,针对音乐的动态范围和频谱特性重新训练过。

显存门槛:官方两卡,社区 8GB

部署有两条路径。SGLang-Omni 官方路径需要两张 CUDA GPU:GPU 0 跑 Qwen3 和八码本自回归生成,GPU 1 跑 Flow Matching 和波形解码。diffusers 路径对个人开发者更友好:全精度 24GB 显存以内能装下,开自动 CPU offload 后约 22GB;再把语言模型逐层流式加载,8GB 显卡也能容纳——代价是更慢。限制也要说清楚:推理必须 CUDA、只支持非流式生成、文本提示上限 5000 token、音频上限 9000 帧(25 帧/秒)。

它在生态里的位置

GitHub 仓库 753 star、61 fork,官方还随仓库发布了 music-caption-rewriter 技能,把简短的自然语言描述扩写成三段式结构化 caption(全局元数据/人声细节/编排),无需外部 API。模型卡也明确提醒:段落标签和音乐描述提供的是生成式控制而非严格符号保证,生成出的速度、调性、乐器未必每次精确命中。

所以呢——当语言模型的开源竞争卷到极致,音乐生成这个「小赛道」反而给出了一个更完整的工程样本:分层建模、连续隐状态合成、消费级显卡部署,每一层都是可拆解的技术决策。对做创作工具的开发者,这是一个能直接上手魔改的开放底座(模型卡:huggingface.co/MiniMaxAI/MiniMax-Music3)。