MiniMax-Music3 是 MiniMax 的第三代音乐生成模型,于 2026 年 8 月发布,权重在 Hugging Face 开源,API 模型名为 music-3.0。它可以根据文本提示词和可选歌词生成完整歌曲,音质大幅跃升,对创作意图的理解更准,全新人声引擎消除了 AI 人声常见的"数码杂音"。模型发布后直接冲上 r/LocalLLaMA 首页,收获数百个赞;官方 ComfyUI 支持让它成为许多本地用户真正能跑起来的第一个前沿级开源音乐模型。
核心功能
- 全控制的文生音乐:在提示词中描述风格、情绪和场景,可选填入带结构标签(
[Verse]、[Chorus]、[Bridge])的歌词,生成一首编曲完整的歌曲。 - 录音棚级音质:不再有局促浑浊的混音;支持指定乐器,以及滑音、连奏等真实演奏技法。
- 自然人声合成:全新人声引擎去除了高频数码杂音,并可控制旋律、发音、气息和层次感和声。
- 纯音乐与翻唱模式:
is_instrumental生成纯器乐曲目;music-cover用不同风格重新演绎已有歌曲,两步工作流可先提取歌词再编辑。 - 歌词优化器:未提供歌词时,可根据提示词自动生成歌词。
模型规格
| 规格 | MiniMax-Music3 |
|---|---|
| API 模型 | music-3.0(免费档:music-3.0-free) |
| 权重 | Hugging Face:MiniMaxAI/MiniMax-Music3(开源) |
| 提示词长度 | 最长 2,000 字符 |
| 歌词长度 | 最长 3,500 字符 |
| ComfyUI | 官方支持,通过 Comfy-Org/MiniMax-Music-3 |
| 输出 | mp3、wav、flac;支持 hex 输出流式传输 |
定价
MiniMax-Music3 通过 MiniMax API 提供,面向 Token 套餐与付费用户(RPM 120)。所有 API 用户都可以使用免费档(music-3.0-free),速率限制为每分钟 3 次请求。
适用场景
- 视频与游戏主题曲:用一段简短的创意说明,生成独特的商业录音级配乐。
- 音乐制作灵感探索:在投入录音棚时间之前,先探索风格、情绪与编曲。
- 本地 ComfyUI 流水线:用官方 ComfyUI 包在本地运行开源权重,包括低显存工作流。
- 翻唱与再创作:在保留或修改原歌词的同时,为已有歌曲换上新风格。
优势
- 开源权重:最强的开源音乐模型之一,许可证与格式适合本地和商用。
- 人声质量跃升:新人声引擎是相对前几代最突出的改进,去掉了标志性的 AI 杂音。
- 生态就绪:官方 ComfyUI 支持加上干净的 API,本地音乐人和产品团队都能直接使用。
使用技巧
- 给歌词加结构:用段落标签控制歌曲结构,模型会围绕标签来编曲。
- 先用免费档:
music-3.0-free足以验证音质,再决定是否购买付费 Token 套餐。 - 及时下载音频:API 返回的音频 URL 24 小时后过期,记得尽快保存文件。
总结
MiniMax-Music3 把前沿级音乐生成带进了开源权重世界:录音棚级音频、自然人声、官方 ComfyUI 支持。对于想在本地或通过 API 生成完整歌曲的开发者和创作者来说,它是目前最强的开源选择。
替代方案
- MiniMax M2.1:MiniMax 的开源权重 MoE 模型,面向编程与智能体任务。
- Suno:面向消费场景的闭源音乐生成服务。
相关:Claude 3.5 Sonnet、Claude 3 Haiku,分类见 models。
评论
还没有评论。成为第一个评论的人!
相关工具
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80