# MiniMax-Music3 音乐模型发布：AI 生成最长 5 分钟歌曲

- 来源：IT之家（RSS）
- 发布时间：2026-08-14 15:15
- AIHOT 分数：58
- AIHOT 链接：https://aihot.virxact.com/items/cmssmceyr0988roffouv1cyj8
- 原文链接：https://www.ithome.com/0/989/722.htm

## AI 摘要

MiniMax 今日推出音乐生成模型 MiniMax-Music3，可根据歌词和音乐描述生成最长 5 分钟的完整歌曲。该模型采用分层自回归架构，Global LLM 参数规模为 8B（基于 Qwen3-8B 初始化），Local LLM 参数规模为 0.6B，输出格式为 32kHz、16-bit 立体声 WAV 文件。官方称其能在长音频中保持音乐主题、节奏、歌声身份和编曲推进。

## 正文

IT之家 8 月 14 日消息，AI 公司 MiniMax 今天（8 月 14 日）推出音乐生成模型 MiniMax-Music3，可根据歌词和音乐描述生成最长 5 分钟的完整歌曲。

架构方面，MiniMax-Music3 模型采用分层自回归架构：

Global LLM（全局语言模型）参数规模为 8B，逐帧预测第 1 个 RVQ 码本，负责建模歌曲的长程语义与结构变化；Global LLM 基于 Qwen3-8B 初始化，训练时先适配音乐语义词元的嵌入层和输出层，随后与 Local LLM 联合建模全部 RVQ 码本。

Local LLM（局部语言模型）参数规模为 0.6B，预测每一帧中其余声学码本，恢复细粒度声学信息。

在输出方面，该模型生成的单首歌曲时长最长为 5 分钟，输出格式为 32kHz、16-bit 立体声 WAV 文件。

官方称，模型能够在长音频中保持音乐主题、节奏、歌声身份和编曲推进，覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等结构。

MiniMax Music3 模型生成的歌曲示例

MiniMax Music3 模型的 GitHub 页面
