想给短视频配首原创 BGM,闭源平台开始限制下载次数,开源竞品又只能吐几十秒片段?MiniMax Music 3 就是冲这个来的。约 11B 参数的开源权重,一次生成最长 5 分钟的完整歌曲,歌词、编曲、演唱全包,本地显卡就能跑,还没有生成次数上限。它到底能不能打,上手试一遍才知道。
产品概述
MiniMax Music 3 是稀宇科技推出的开源音乐生成模型,2026 年 7 月 16 日先通过 API 上线,8 月 13 日放出完整权重。它把 AI 音乐生成从”几秒片段”直接拉到”5 分钟完整成品歌”,输入歌词和音乐描述,一次就能出作曲、编曲、演唱、混音全包的一首歌。
官方把它定位成”生产级”模型,而不是又一个技术 demo。全模型约 11.1B 参数,拆成 8B 全局模型、0.6B 局部模型、2.4B 流匹配模块和 123M 声码器四部分。权重同时上架 HuggingFace、GitHub、ModelScope,ComfyUI 当天就跟进支持。
最关键的差异在开源:闭源平台 Suno、Udio 开始收紧下载和商用条款,而它的社区许可证允许显示模型名即可商用,年营收超 2000 万美元才需要书面授权。对想掌握音乐生产主权的创作者和开发者来说,这是一条绕开平台抽成的路。
官网:https://www.minimaxi.com | 项目地址:https://github.com/MiniMax-AI/MiniMax-Music3

核心功能
聊完定位,直接看它到底硬在哪儿。这模型最狠的一点,是把”长歌后半段崩坏”这个行业老问题给治了。
完整 5 分钟长歌。 原生覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏完整结构,主题、节奏、人声身份、编曲推进在长序列里保持一致。开源竞品 Stable Audio Open 只能出约 47 秒短元素,这一下把差距拉到了数量级。
双输入控制。 歌词决定”唱什么、段落怎么分”,支持 [Verse]、[Chorus]、[Bridge]、[Hook]、[Intro]、[Outro] 结构标签;音乐描述决定”怎么唱、什么风格”,分全局元数据、人声细节、编曲三部分,能精确到音色、气声、假声、和声、延迟和 Auto-Tune 效果。
表达力人声。 人声表演可控到音色、和声与效果器层面,隐藏状态合成路径保证长段落里发音清晰连贯。第三方实测里,歌词、咬字、可用质量都被认为是开源模型里的第一梯队。
本地可跑、无次数上限。 全精度约需 24GB 显存,开启分层 offload 后 8GB 显卡也能跑,只是慢一些。一张游戏显卡就能通宵批量出歌,对比 Suno 自 9 月 3 日起限制 Pro 用户每月 20 首下载,本地模型没有任何天花板。
纯音乐与自动写词。 is_instrumental 标记一键跳过人声,适合背景配乐;没有歌词时开启歌词优化器,模型能从一句概念直接写词成歌。

这套能力的底层,是”双语言模型连续合成”的分层架构。音频先经八层残差向量量化器压缩,第一层承载语义结构、用 16384 词条大码本,下方七层声学层各用 1024 词条;生成时由 8B 全局模型逐帧预测第一码本、负责整首歌的长程推进,0.6B 局部模型负责帧内七层声学细节。两者分工,让 5 分钟歌曲每帧只需一次 8B 前向计算,兼顾连贯与算力。
上手体验
聊完功能,最想知道的肯定是实际用起来什么感觉。它给了三条路径,门槛从零到高都有。
路径一:托管 API,一句话出歌。 注册开放平台拿到 key,调用音乐生成接口,提供歌词和一句描述,约 0.15 美元生成一首最长 5 分钟的完整歌曲,返回 MP3 链接。

路径二:ComfyUI,免费无上限。 更新 ComfyUI 到 0.33.0,导入官方工作流模板,把权重放到模型目录,填歌词和描述就能跑。这是目前最省心的本地方案,全精度要 24GB 显存,开 offload 后 8GB 也能跑。
路径三:diffusers 或 SGLang-Omni 编程接入。 适合开发者,SGLang-Omni 支持把语言模型生成和波形解码拆到多张 GPU 上,适合做服务化部署。
第一印象是:门槛比想象中低,但也没低到”装完就能玩”。最大的拦路虎是 CUDA 依赖,Mac 用户和没有 NVIDIA 显卡的人基本被挡在本地部署门外,只能走 API 或在线 demo。
使用技巧
摸清门道后,有几招能让出歌质量明显上一个台阶。很多人不知道,这套模型真正的控制力藏在下面几个细节里。
-
先定方向再写歌词。 用官方 demo 页的多风格样例先确认听感,再动手,能少返工。 -
结构标签是你的最大杠杆。 写歌词时按 [Verse]、[Chorus]、[Bridge] 分段,模型才会按你想要的段落推进情绪,而不是自由发挥。 -
Caption 三段都要填。 全局元数据、人声细节、编曲分别指定 BPM、调式、音色、乐器进出点,控制力会比只写一句”流行歌”强得多。 -
配乐直接开纯音乐。 只做 BGM 时把 is_instrumental设为 true,跳过人声,出片更快更干净。 -
分轨靠外部工具。 官方不输出分轨,需要单独调鼓、贝斯、主唱时,用专业分轨软件或 DAW 二次处理。
竞品对比
把它放进 2026 年的 AI 音乐市场,位置其实很清晰:开源阵营里它独占”完整长曲”,闭源阵营里它拼不过成品精致度,但赢在主权。
| 产品 | 开放程度 | 单次最长 | 核心特点 | 价格(截至 2026 年 8 月) |
|---|---|---|---|---|
| MiniMax Music 3 | 开源权重 | 5 分钟 | 完整长曲、结构可控、本地可跑 | 本地免费,API 约 $0.15/首 |
| Suno V5 | 闭源托管 | 8 分钟 | 成品质量高、生态成熟 | Pro $10/月,9 月起下载限 20 首/月 |
| Udio | 闭源托管 | 15 分钟 | 人声情感最深、分段编辑 | Pro $10/月 |
| Stable Audio Open | 开源权重 | 约 47 秒 | 短元素、音效 | 免费,非商用研究许可 |
| 天工 SkyMusic | 闭源托管 | 数分钟 | 中文人声最强 | 约 ¥30/月 |

这张定位图的逻辑是:闭源平台擅长精致但开始设限,开源竞品停在短片段,MiniMax Music 3 是第一个把”开源、5 分钟长曲、可商用”三者同时给到的模型。它不做 Suno 杀手,而是补上”本地音乐生产主权”这块空白。真要挑刺,中文歌词表现缺公开盲测数据,是它相对天工最没底气的一环。
用户反馈
社区的声音两极分明,但正面的都集中在同一个点上:开源且能用。
正面评价里,36 氪的普通用户连用半个月后说,旋律流畅温柔、没有机械感,乐器搭配不突兀,新手不用研究复杂参数。海外创作者实测后称它是”测过最好的开源音乐模型”,歌词、咬字、可用质量都强,甚至能跑在 8GB 显卡上。
负面反馈更具体:提细致要求时领会不到位,想让鼓点轻一点,反复生成还是偏重;长一点的音乐中间会出现旋律衔接不自然的突兀;还有人指出它不输出分轨,需要单独调音轨时得再配工具。最普遍的不满,是中文歌词表现和生成速度都缺公开数据,难以做采购决策。
多维评分
评分基于官方文档、第三方实测和社区反馈,未做独立盲测的部分已在解读里标注。
| 维度 | 星级 | 权重 | 解读 |
|---|---|---|---|
| 功能完整性 | ★★★★☆ | 20% | 长曲、结构控制、纯音乐、自动写词齐全,缺分轨导出 |
| 易用性 | ★★★★☆ | 15% | ComfyUI 门槛低,但本地部署强依赖 CUDA,Mac 被挡门外 |
| 性能表现 | ★★★☆☆ | 15% | 长歌连贯是亮点,生成速度缺公开基准,8GB offload 偏慢 |
| AI 能力 | ★★★★☆ | 15% | Hybrid-LM 双模型分工是实打实的架构创新,人声表达力强 |
| 价格合理性 | ★★★★★ | 10% | 权重免费,API $0.15/首,商用门槛低 |
| 生态集成 | ★★★★☆ | 10% | ComfyUI、diffusers、SGLang-Omni 三框架当日或快速支持 |
| 文档与支持 | ★★★☆☆ | 10% | README 和模型卡完整,中文歌词表现缺数据 |
| 更新频率 | ★★★★☆ | 5% | 7 月 API 上线、8 月开源,迭代节奏快 |
加权总分约 4.15 / 5。扣分主要在性能表现和文档支持两处,都是”缺数据”而不是”做错了”,随着独立评测补上,分数还有上浮空间。
优缺点
优点
-
开源权重 + 完整 5 分钟长曲 + 可商用,三者第一次同时到位 -
Hybrid-LM 分层架构治住了长歌后半段崩坏的行业痛点 -
双输入控制精细,歌词结构标签和 Caption 三分部都是真能落地的控制手段 -
本地部署无生成次数上限,一张显卡就能批量出歌
缺点
-
不输出分轨,需要单独调音轨时要外接专业工具 -
本地部署强依赖 NVIDIA CUDA,Mac 和 AMD 用户基本被挡门外 -
中文歌词表现、生成速度都缺公开盲测数据 -
细致指令领会不到位,长曲中段偶有旋律衔接不自然
适用人群
不是所有人都该上本地部署,先对号入座再决定。
短视频与播客创作者。 需要批量产出有版权自主权的背景音乐和片头,本地闭环不依赖平台曲库,是最直接的受益者。
独立音乐人与制作人。 用它做 demo 打样、风格探索,一句描述快速试出多版本编曲,比硬着头皮写省时间。
游戏与开发团队。 为小游戏、独立项目本地生成主题曲和环境音乐,无订阅成本,数据还能留在自有环境。
AI 应用开发者。 开源权重可微调、可嵌入,SGLang-Omni、diffusers、ComfyUI 多框架接入,适合做音乐产品的技术基座。
只想尝鲜的普通用户。 没有 NVIDIA 显卡就别折腾本地部署了,走在线 demo 或 API 更快,省下的时间比省下的钱值钱。
定价方案
价格这块,它走的是”本地免费、API 按量”的双轨,比纯订阅制灵活。
| 方案 | 费用 | 限制 | 适合 |
|---|---|---|---|
| 开源权重 | 免费 | 需自备 CUDA 显卡,商用年营收超 $2000 万需书面授权 | 本地批量、深度定制 |
| 托管 API | $0.15/首(≤5 分钟) | 付费 120 RPM、20 并发,免费档 3 RPM | 快速出片、服务化集成 |
| 在线 Demo | 免费 | 免费额度有限 | 尝鲜、试听 |
截至 2026 年 8 月,这个定价放在同类里相当能打:API 单首成本只有 Suno Pro 订阅摊薄后的零头,开源更是直接把边际成本压到电费。唯一要留意的,是商用前得看清社区许可证里对年营收和防滥用的具体条款。
常见问题
把最容易被问到的十个问题一次讲清,省得你去翻文档。
Q1:MiniMax Music 3 能免费商用吗?
A1:可以,但有条件。 显示 MiniMax-Music3 模型名即可商用,相关产品年营收超 2000 万美元时才需书面授权,对外提供服务还需建立合理的防滥用和防侵权措施。
Q2:只有 8GB 显存能本地跑吗?
A2:能,但慢。 官方 diffusers 示例提供低内存方案,把语言模型逐层搬进 GPU,可把显存需求降到 8GB,只是速度比满血部署慢,适合测试而非高流量服务。
Q3:Mac 能本地运行吗?
A3:目前不能。 官方把 CUDA 列为必要条件,主要支持 NVIDIA GPU,没有提供 Apple Silicon 的正式部署方式,Mac 用户只能走 API 或在线 demo。
Q4:能生成纯音乐吗?
A4:能。 歌词留空,或把 is_instrumental 设为 true,就能生成无人声的纯音乐版本,适合背景配乐和音效。
Q5:它和 Suno、Udio 比,谁音质更好?
A5:没有权威盲测结论。 第三方实测普遍认为 Suno V5 在清晰度、乐器质感和风格控制上仍领先,Music 3 是开源模型里的第一梯队,谁更好要看你更看重主权还是成品精致度。
Q6:生成一首歌要多久?
A6:缺公开基准数据。 官方未给出统一的生成耗时,本地速度取决于显卡和 offload 策略,8GB 模式明显更慢,采购前建议用自己的硬件实测。
Q7:支持中文歌词吗?
A7:支持,但表现缺数据。 官方 demo 覆盖多语言,中文歌词的具体咬字和声调表现尚未有公开盲测,建议用中文歌词试生成后再下结论。
Q8:能导出分轨吗?
A8:不能。 官方输出是合成人声与伴奏混合后的整轨,模型卡未把逐轨分离列为核心输出,需要单独调音轨时得外接分轨工具或 DAW。
Q9:API 和开源权重版本有什么区别?
A9:同模型不同交付。 API 是托管服务,返回 MP3、按首计费;开源权重是完整 checkpoint,本地跑、输出 WAV、免费无上限,两者底层是同一套模型。
Q10:怎么开始用最快?
A10:先试在线 demo,再决定部署。 官方 demo 页可直接试听多风格样例,确认听感后,有显卡走 ComfyUI,没有就走 API,别一上来就折腾本地部署。
结论
MiniMax Music 3 的价值不在”音质吊打谁”,而在它把”本地出完整歌曲”从不可能变成了标配。当闭源平台开始限制下载、开源竞品停在几十秒时,它用约 11B 参数一次性给全了开源、长曲、可控、可商用四件事。
对创作者,这是把音乐生产主权拿回手里的起点;对开发者,这是可微调、可嵌入、可闭环的音乐基座。它的短板同样明确:无分轨、依赖 CUDA、中文表现缺数据。
建议从官方 demo 试听开始,再拿一首带结构标签的短歌本地跑一遍。你会第一次发现,”生成一首歌”和”写完一首歌”之间,只剩你的歌词和描述。

