官方事实 · 2026-08-13
MiniMax Music 3.0 是什么
MiniMax Music 3.0 是音乐生成模型。提供一个创意想法和可选歌词,一次生成即可完成作曲、编曲、演唱与制作,得到一首完整的歌。这个定义来自 MiniMax 2026 年 8 月 13 日的官方发布。
来源: 中文研究博文 · English post · Hugging Face 权重
MiniMax Music 3.0 是什么?
Music 3.0 是 MiniMax 新一代开源权重音乐模型。它针对简单提示词很难概括的部分:在完整歌曲里持续贯彻创作意图,以真实质感呈现乐器,并让人声更像演唱而不是合成。官方写明一次生成可完成作曲、编曲、演唱与制作,完整歌曲最长约五分钟。
模型怎么做出来的
MiniMax 写了三个衔接模块。八层 RVQ 把核心结构与声学残差分开。Hybrid-LM 负责建模:8B 全局语言模型由 Qwen3.5-8B 初始化,逐帧预测语义 token;0.6B 局部模型预测帧内声学 token。合成阶段融合两边的连续 Hidden States,送入 2.4B Flow-Matching 与 123M Flow-VAE。公开链路是:融合特征 → Flow-Matching → VAE → 立体声音频。
今天能怎么跑
- 官方网页创作(Music-3.0,限免 Beta)
- 官方 API:
music-3.0与music-3.0-free - 开源权重 MiniMaxAI/MiniMax-Music3
- 本地:ComfyUI、Diffusers、SGLang-Omni(需要 CUDA)