MiniMax发布Music3音乐模型可生成5分钟歌曲
「MiniMax推出音乐生成模型MiniMax-Music3,支持输入歌词和描述生成最长5分钟的完整歌曲,输出32kHz立体声WAV。模型采用分层自回归架构,8B全局语言模型负责长程语义结构,0.6B局部模型补充声学细节,官方已开放模型页面和试听示例。」
MiniMax今日正式推出音乐生成模型MiniMax-Music3,这一新工具允许用户通过输入歌词和音乐描述,直接生成最长可达5分钟的完整歌曲,输出格式为32kHz、16-bit立体声WAV文件。相比此前多数音乐生成模型只能产出短片段,Music3在长音频生成能力上实现了显著突破。
支撑这一能力的是精心设计的分层自回归架构。系统由两个模型协同工作:全局语言模型(Global LLM)参数规模为8B,其任务是对歌曲的长程语义与结构变化进行建模,逐帧预测第一个RVQ码本;局部语言模型(Local LLM)参数仅0.6B,负责预测每一帧中其余的声学码本,将细粒度的声学信息逐层补齐。这种“大模型管骨架,小模型填血肉”的分工方式,使得模型能够在长时间尺度内保持音乐主题的一致性。
官方技术细节显示,全局语言模型基于Qwen3-8B初始化,训练过程中先让嵌入层和输出层适配音乐语义词元,随后再与局部模型联合建模全部码本。这种两阶段训练策略有效提升了模型对音乐语义结构的理解能力。在生成效果上,Music3能够在长音频中稳定守住音乐主题、节奏、歌声身份以及编曲的推进,前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏等常见歌曲结构一应俱全。
目前,MiniMax已在GitHub和Hugging Face平台放出模型页面,并提供多种风格的生成歌曲示例供用户体验试听。这一开源举措意味着开发者可以自主部署和测试模型,进一步推动音乐生成技术在创作辅助、音频内容制作等场景中的应用落地。随着长音频生成能力的提升,AI音乐创作正从简单的旋律片段走向完整的歌曲结构,未来或将为音乐产业带来更多可能性。
来源:Heooo AI工具导航