8 月 13 日,MiniMax 开源新一代音乐生成模型 Music 3.0。给定一个创意概念与可选的歌词,模型在单次生成中即可完成作曲、编曲、演奏与制作,输出一首最长 5 分钟的完整歌曲。官方强调三大升级:更准确地理解创作意图、更完整多变的编曲、更干净自然的听感——将音乐生成从「产出可听的声音」推进到「实现完整连贯的创作构想」。
三件套的生成架构
Music 3.0 的端到端管线由三部分构成:多级 RVQ 分词器、全局–局部混合大模型(Hybrid-LM)与隐藏状态融合合成栈。
- 多级 RVQ 分词器:用八层残差向量量化把音乐信息分层表示——第 1 层(16,384 词条的码本)捕捉核心语义与结构,第 2–8 层(每层 1,024 词条)逐层编码声学残差;训练分两阶段,先单独训第 1 层,再八层联合训练。
- Hybrid-LM:
- 8B 全局 LLM(基于 Qwen3.5-8B 初始化)逐帧预测语义 token,建模全局上下文;
- 0.6B 局部 LLM沿深度轴预测帧内声学 token;
- 训练同样两阶段:先做全局对齐,再做全参数联合训练。
- 隐藏状态融合与合成栈:推理时融合两个 LLM 的连续隐藏状态(而非离散 token),由 2.4B 的流匹配(flow matching)模块把 LLM 特征映射进 VAE 潜空间,再由 123M 的 Flow-VAE(继承 MiniMax Speech 架构、针对音乐重训)解码成最终音频。
整体管线可概括为:融合的 LLM 特征 → 流匹配 → VAE 隐藏状态 → Flow-VAE 解码器 → 最终音频。
更准确地理解创作意图
结构化描述(Structured Captions)以精细的时间粒度描述音乐——涵盖流派、速度、节拍、调性、用途场景、制作质感、情感走向、乐器进出、律动发展、人声唱法变化等维度。配套的模板式提示增强系统让非专业用户也能借助精选的音乐术语,获得精确的控制力。
更完整多变的编曲
- 歌词中的分节标签(如
[intro]、[verse]、[chorus]、[bridge])定义歌曲的宏观结构; - 结构化描述可进一步指定每个分节的情绪、配器与人声变化;
- 全局与局部模型协作,在保证 5 分钟长歌整体稳定的同时,保留分节层面的起伏与差异。
更干净自然的听感
- 混音更开阔、清晰、均衡,较旧版更少「拥挤感」;
- 连续特征比离散 token 保留更丰富的声学信息;
- 人声咬字更准、乐器更连贯,颤音/滑音(glissando、legato)、低频清晰度与密集编曲中的声源分离均有改善;
- 结构化描述可刻画人声音色、唱法、气声、假声、和声布局与效果,减少高频数字伪影,并把人声呼吸融入表演,使其对情绪与节奏变化做出连贯响应。
获取方式
模型权重以开源方式发布。MiniMax 全家族还包括大语言模型 M3、M2.7、M2.5,视频模型 H3 与语音模型 Speech 2.8。
核心总结
- 单次生成完成「作曲—编曲—演奏—制作」,最长 5 分钟完整歌曲;
- 八层 RVQ 分词 + 「8B 全局 / 0.6B 局部」Hybrid-LM,两阶段训练;
- 推理时融合连续隐藏状态,经 2.4B 流匹配与 123M Flow-VAE 合成音频;
- 结构化描述实现精细意图控制,分节标签驱动宏观编曲,听感更自然均衡。
原文:MiniMax Music 3.0: Next-Generation Open-Weights, Production-Ready & Versatile Music Model(MiniMax Research,2026-08-13)



