技术进展

MiniMax发布Music3音乐生成模型

Heooo 08月14日17时33分 26 阅读

「AI公司MiniMax推出音乐生成模型MiniMax-Music3,采用分层自回归架构,包含8B全局语言模型和0.6B局部语言模型,可根据歌词和音乐描述生成最长5分钟、32kHz立体声WAV格式的完整歌曲,覆盖前奏到尾声等丰富结构。」

AI公司MiniMax于今日正式推出音乐生成模型MiniMax-Music3,该模型能够根据用户提供的歌词和音乐描述,生成最长5分钟的完整歌曲。这一能力在同类AI音乐工具中处于领先水平,尤其适用于需要长篇幅叙事结构的音乐创作场景。

从架构设计上看,MiniMax-Music3采用了分层自回归模型方案。其中全局语言模型(Global LLM)参数量为8B,负责逐帧预测第一个RVQ码本,从而建模歌曲的长程语义与结构变化。该模块基于Qwen3-8B进行初始化,训练过程中先适配音乐语义词元的嵌入层和输出层,再与局部语言模型联合建模全部RVQ码本。这种设计让模型能够更好地把握歌曲的整体走向,包括主题发展、节奏变化以及情绪递进。

局部语言模型(Local LLM)参数量为0.6B,专门负责预测每一帧中的其余声学码本,用以恢复细粒度声学信息。通过与全局模型配合,模型能够在保持长音频一致性的同时,输出高保真的声音细节。最终生成的音频为32kHz采样率、16-bit位深的立体声WAV文件,满足专业制作的基本需求。

官方表示,MiniMax-Music3可以在长音频中稳定维持音乐主题、节奏、歌声身份以及编曲推进,并完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等常见歌曲结构。这意味着模型不仅能够生成旋律,还能理解并创作具有完整叙事逻辑的音乐作品,为词曲创作者提供了高效的辅助工具。

此次发布标志着AI音乐生成从短片段走向完整歌曲的又一次技术跃迁。随着模型对长序列结构的建模能力增强,未来AI在音乐创作中的角色将更加接近“协作创作者”,而非简单的片段生成器。

# MiniMax # 音乐生成 # AI模型

来源:Heooo AI工具导航