MiniMax Music 3 评测:开源权重,把”5 分钟完整长歌”做成了标配

想给短视频配首原创 BGM,闭源平台开始限制下载次数,开源竞品又只能吐几十秒片段?MiniMax Music 3 就是冲这个来的。约 11B 参数的开源权重,一次生成最长 5 分钟的完整歌曲,歌词、编曲、演唱全包,本地显卡就能跑,还没有生成次数上限。它到底能不能打,上手试一遍才知道。

产品概述

MiniMax Music 3 是稀宇科技推出的开源音乐生成模型,2026 年 7 月 16 日先通过 API 上线,8 月 13 日放出完整权重。它把 AI 音乐生成从”几秒片段”直接拉到”5 分钟完整成品歌”,输入歌词和音乐描述,一次就能出作曲、编曲、演唱、混音全包的一首歌。

官方把它定位成”生产级”模型,而不是又一个技术 demo。全模型约 11.1B 参数,拆成 8B 全局模型、0.6B 局部模型、2.4B 流匹配模块和 123M 声码器四部分。权重同时上架 HuggingFace、GitHub、ModelScope,ComfyUI 当天就跟进支持。

最关键的差异在开源:闭源平台 Suno、Udio 开始收紧下载和商用条款,而它的社区许可证允许显示模型名即可商用,年营收超 2000 万美元才需要书面授权。对想掌握音乐生产主权的创作者和开发者来说,这是一条绕开平台抽成的路。

官网:https://www.minimaxi.com | 项目地址:https://github.com/MiniMax-AI/MiniMax-Music3

MiniMax Music 3 评测:开源权重,把"5 分钟完整长歌"做成了标配

核心功能

聊完定位,直接看它到底硬在哪儿。这模型最狠的一点,是把”长歌后半段崩坏”这个行业老问题给治了。

完整 5 分钟长歌。 原生覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏完整结构,主题、节奏、人声身份、编曲推进在长序列里保持一致。开源竞品 Stable Audio Open 只能出约 47 秒短元素,这一下把差距拉到了数量级。

双输入控制。 歌词决定”唱什么、段落怎么分”,支持 [Verse]、[Chorus]、[Bridge]、[Hook]、[Intro]、[Outro] 结构标签;音乐描述决定”怎么唱、什么风格”,分全局元数据、人声细节、编曲三部分,能精确到音色、气声、假声、和声、延迟和 Auto-Tune 效果。

表达力人声。 人声表演可控到音色、和声与效果器层面,隐藏状态合成路径保证长段落里发音清晰连贯。第三方实测里,歌词、咬字、可用质量都被认为是开源模型里的第一梯队。

本地可跑、无次数上限。 全精度约需 24GB 显存,开启分层 offload 后 8GB 显卡也能跑,只是慢一些。一张游戏显卡就能通宵批量出歌,对比 Suno 自 9 月 3 日起限制 Pro 用户每月 20 首下载,本地模型没有任何天花板。

纯音乐与自动写词。 is_instrumental 标记一键跳过人声,适合背景配乐;没有歌词时开启歌词优化器,模型能从一句概念直接写词成歌。

MiniMax Music 3 评测:开源权重,把"5 分钟完整长歌"做成了标配

这套能力的底层,是”双语言模型连续合成”的分层架构。音频先经八层残差向量量化器压缩,第一层承载语义结构、用 16384 词条大码本,下方七层声学层各用 1024 词条;生成时由 8B 全局模型逐帧预测第一码本、负责整首歌的长程推进,0.6B 局部模型负责帧内七层声学细节。两者分工,让 5 分钟歌曲每帧只需一次 8B 前向计算,兼顾连贯与算力。

上手体验

聊完功能,最想知道的肯定是实际用起来什么感觉。它给了三条路径,门槛从零到高都有。

路径一:托管 API,一句话出歌。 注册开放平台拿到 key,调用音乐生成接口,提供歌词和一句描述,约 0.15 美元生成一首最长 5 分钟的完整歌曲,返回 MP3 链接。

MiniMax Music 3 评测:开源权重,把"5 分钟完整长歌"做成了标配

路径二:ComfyUI,免费无上限。 更新 ComfyUI 到 0.33.0,导入官方工作流模板,把权重放到模型目录,填歌词和描述就能跑。这是目前最省心的本地方案,全精度要 24GB 显存,开 offload 后 8GB 也能跑。

路径三:diffusers 或 SGLang-Omni 编程接入。 适合开发者,SGLang-Omni 支持把语言模型生成和波形解码拆到多张 GPU 上,适合做服务化部署。

第一印象是:门槛比想象中低,但也没低到”装完就能玩”。最大的拦路虎是 CUDA 依赖,Mac 用户和没有 NVIDIA 显卡的人基本被挡在本地部署门外,只能走 API 或在线 demo。

使用技巧

摸清门道后,有几招能让出歌质量明显上一个台阶。很多人不知道,这套模型真正的控制力藏在下面几个细节里。

  • 先定方向再写歌词。 用官方 demo 页的多风格样例先确认听感,再动手,能少返工。
  • 结构标签是你的最大杠杆。 写歌词时按 [Verse]、[Chorus]、[Bridge] 分段,模型才会按你想要的段落推进情绪,而不是自由发挥。
  • Caption 三段都要填。 全局元数据、人声细节、编曲分别指定 BPM、调式、音色、乐器进出点,控制力会比只写一句”流行歌”强得多。
  • 配乐直接开纯音乐。 只做 BGM 时把 is_instrumental 设为 true,跳过人声,出片更快更干净。
  • 分轨靠外部工具。 官方不输出分轨,需要单独调鼓、贝斯、主唱时,用专业分轨软件或 DAW 二次处理。

竞品对比

把它放进 2026 年的 AI 音乐市场,位置其实很清晰:开源阵营里它独占”完整长曲”,闭源阵营里它拼不过成品精致度,但赢在主权。

产品 开放程度 单次最长 核心特点 价格(截至 2026 年 8 月)
MiniMax Music 3 开源权重 5 分钟 完整长曲、结构可控、本地可跑 本地免费,API 约 $0.15/首
Suno V5 闭源托管 8 分钟 成品质量高、生态成熟 Pro $10/月,9 月起下载限 20 首/月
Udio 闭源托管 15 分钟 人声情感最深、分段编辑 Pro $10/月
Stable Audio Open 开源权重 约 47 秒 短元素、音效 免费,非商用研究许可
天工 SkyMusic 闭源托管 数分钟 中文人声最强 约 ¥30/月

MiniMax Music 3 评测:开源权重,把"5 分钟完整长歌"做成了标配

这张定位图的逻辑是:闭源平台擅长精致但开始设限,开源竞品停在短片段,MiniMax Music 3 是第一个把”开源、5 分钟长曲、可商用”三者同时给到的模型。它不做 Suno 杀手,而是补上”本地音乐生产主权”这块空白。真要挑刺,中文歌词表现缺公开盲测数据,是它相对天工最没底气的一环。

用户反馈

社区的声音两极分明,但正面的都集中在同一个点上:开源且能用。

正面评价里,36 氪的普通用户连用半个月后说,旋律流畅温柔、没有机械感,乐器搭配不突兀,新手不用研究复杂参数。海外创作者实测后称它是”测过最好的开源音乐模型”,歌词、咬字、可用质量都强,甚至能跑在 8GB 显卡上。

负面反馈更具体:提细致要求时领会不到位,想让鼓点轻一点,反复生成还是偏重;长一点的音乐中间会出现旋律衔接不自然的突兀;还有人指出它不输出分轨,需要单独调音轨时得再配工具。最普遍的不满,是中文歌词表现和生成速度都缺公开数据,难以做采购决策。

多维评分

评分基于官方文档、第三方实测和社区反馈,未做独立盲测的部分已在解读里标注。

维度 星级 权重 解读
功能完整性 ★★★★☆ 20% 长曲、结构控制、纯音乐、自动写词齐全,缺分轨导出
易用性 ★★★★☆ 15% ComfyUI 门槛低,但本地部署强依赖 CUDA,Mac 被挡门外
性能表现 ★★★☆☆ 15% 长歌连贯是亮点,生成速度缺公开基准,8GB offload 偏慢
AI 能力 ★★★★☆ 15% Hybrid-LM 双模型分工是实打实的架构创新,人声表达力强
价格合理性 ★★★★★ 10% 权重免费,API $0.15/首,商用门槛低
生态集成 ★★★★☆ 10% ComfyUI、diffusers、SGLang-Omni 三框架当日或快速支持
文档与支持 ★★★☆☆ 10% README 和模型卡完整,中文歌词表现缺数据
更新频率 ★★★★☆ 5% 7 月 API 上线、8 月开源,迭代节奏快

加权总分约 4.15 / 5。扣分主要在性能表现和文档支持两处,都是”缺数据”而不是”做错了”,随着独立评测补上,分数还有上浮空间。

优缺点

优点

  • 开源权重 + 完整 5 分钟长曲 + 可商用,三者第一次同时到位
  • Hybrid-LM 分层架构治住了长歌后半段崩坏的行业痛点
  • 双输入控制精细,歌词结构标签和 Caption 三分部都是真能落地的控制手段
  • 本地部署无生成次数上限,一张显卡就能批量出歌

缺点

  • 不输出分轨,需要单独调音轨时要外接专业工具
  • 本地部署强依赖 NVIDIA CUDA,Mac 和 AMD 用户基本被挡门外
  • 中文歌词表现、生成速度都缺公开盲测数据
  • 细致指令领会不到位,长曲中段偶有旋律衔接不自然

适用人群

不是所有人都该上本地部署,先对号入座再决定。

短视频与播客创作者。 需要批量产出有版权自主权的背景音乐和片头,本地闭环不依赖平台曲库,是最直接的受益者。

独立音乐人与制作人。 用它做 demo 打样、风格探索,一句描述快速试出多版本编曲,比硬着头皮写省时间。

游戏与开发团队。 为小游戏、独立项目本地生成主题曲和环境音乐,无订阅成本,数据还能留在自有环境。

AI 应用开发者。 开源权重可微调、可嵌入,SGLang-Omni、diffusers、ComfyUI 多框架接入,适合做音乐产品的技术基座。

只想尝鲜的普通用户。 没有 NVIDIA 显卡就别折腾本地部署了,走在线 demo 或 API 更快,省下的时间比省下的钱值钱。

定价方案

价格这块,它走的是”本地免费、API 按量”的双轨,比纯订阅制灵活。

方案 费用 限制 适合
开源权重 免费 需自备 CUDA 显卡,商用年营收超 $2000 万需书面授权 本地批量、深度定制
托管 API $0.15/首(≤5 分钟) 付费 120 RPM、20 并发,免费档 3 RPM 快速出片、服务化集成
在线 Demo 免费 免费额度有限 尝鲜、试听

截至 2026 年 8 月,这个定价放在同类里相当能打:API 单首成本只有 Suno Pro 订阅摊薄后的零头,开源更是直接把边际成本压到电费。唯一要留意的,是商用前得看清社区许可证里对年营收和防滥用的具体条款。

常见问题

把最容易被问到的十个问题一次讲清,省得你去翻文档。

Q1:MiniMax Music 3 能免费商用吗?

A1:可以,但有条件。 显示 MiniMax-Music3 模型名即可商用,相关产品年营收超 2000 万美元时才需书面授权,对外提供服务还需建立合理的防滥用和防侵权措施。

Q2:只有 8GB 显存能本地跑吗?

A2:能,但慢。 官方 diffusers 示例提供低内存方案,把语言模型逐层搬进 GPU,可把显存需求降到 8GB,只是速度比满血部署慢,适合测试而非高流量服务。

Q3:Mac 能本地运行吗?

A3:目前不能。 官方把 CUDA 列为必要条件,主要支持 NVIDIA GPU,没有提供 Apple Silicon 的正式部署方式,Mac 用户只能走 API 或在线 demo。

Q4:能生成纯音乐吗?

A4:能。 歌词留空,或把 is_instrumental 设为 true,就能生成无人声的纯音乐版本,适合背景配乐和音效。

Q5:它和 Suno、Udio 比,谁音质更好?

A5:没有权威盲测结论。 第三方实测普遍认为 Suno V5 在清晰度、乐器质感和风格控制上仍领先,Music 3 是开源模型里的第一梯队,谁更好要看你更看重主权还是成品精致度。

Q6:生成一首歌要多久?

A6:缺公开基准数据。 官方未给出统一的生成耗时,本地速度取决于显卡和 offload 策略,8GB 模式明显更慢,采购前建议用自己的硬件实测。

Q7:支持中文歌词吗?

A7:支持,但表现缺数据。 官方 demo 覆盖多语言,中文歌词的具体咬字和声调表现尚未有公开盲测,建议用中文歌词试生成后再下结论。

Q8:能导出分轨吗?

A8:不能。 官方输出是合成人声与伴奏混合后的整轨,模型卡未把逐轨分离列为核心输出,需要单独调音轨时得外接分轨工具或 DAW。

Q9:API 和开源权重版本有什么区别?

A9:同模型不同交付。 API 是托管服务,返回 MP3、按首计费;开源权重是完整 checkpoint,本地跑、输出 WAV、免费无上限,两者底层是同一套模型。

Q10:怎么开始用最快?

A10:先试在线 demo,再决定部署。 官方 demo 页可直接试听多风格样例,确认听感后,有显卡走 ComfyUI,没有就走 API,别一上来就折腾本地部署。

结论

MiniMax Music 3 的价值不在”音质吊打谁”,而在它把”本地出完整歌曲”从不可能变成了标配。当闭源平台开始限制下载、开源竞品停在几十秒时,它用约 11B 参数一次性给全了开源、长曲、可控、可商用四件事。

对创作者,这是把音乐生产主权拿回手里的起点;对开发者,这是可微调、可嵌入、可闭环的音乐基座。它的短板同样明确:无分轨、依赖 CUDA、中文表现缺数据。

建议从官方 demo 试听开始,再拿一首带结构标签的短歌本地跑一遍。你会第一次发现,”生成一首歌”和”写完一首歌”之间,只剩你的歌词和描述。

AI工具

Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

2026-8-16 10:58:20

行业动态

Nano Banana有点ChatGPT时刻的味儿了

2025-9-8 14:03:21

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧