news 2026/8/16 6:19:56

Minimax Music开源,配套神器已开源,继AI视频自由后,AI音乐也自由了!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Minimax Music开源,配套神器已开源,继AI视频自由后,AI音乐也自由了!

Minimax Music开源,配套神器T8已开源,继AI视频自由后,AI音乐也自由了!新版comfyui整合包V18更新,写一个教程

MiniMax Music 3 开源 + ComfyUI V18 整合包教程

就在昨天,继开源视频模型 H3 之后,MiniMax 又把音乐模型MiniMax-Music3给开源了。配合 T8 大佬刚更新的ComfyUI V18 整合包,AI 音乐本地自由,现在真的实现了。


一、MiniMax-Music3 是什么?

一句话:一个能在你本地电脑上生成最长5分钟完整歌曲的AI模型,带人声,还支持中文/日文等多种语言

它和 Suno、Udio 这类在线工具最大的不同是——模型权重完全免费开放,你可以下载到本地,没有任何次数限制,想生成多少首就生成多少首。

效果到底怎么样?

目前开源TTS/SVS领域,MiniMax-Music3绝对是顶级的(SOTA级别)。虽然和顶级的闭源商业产品(比如 Suno)比还有一点差距,但在开源模型里,它已经是天花板了。

硬件门槛:官方推荐24GB显存(如RTX 4090),实测生成3分钟歌曲约需219秒。整合包也支持通过配置在更低显存下运行。


二、下载与安装(V18整合包)

T8 大佬已经把所有依赖和环境都打包好了,不需要自己配 Python 环境。

MiniMax Music 3 模型 夸克网盘分享

T8 CF 整合包 V18 夸克网盘分享

T8 配套节点仓库https://github.com/T8mars/comfyui-minimax-h3-prompt-enhancer-T8

官方模型 Hugging Facehttps://huggingface.co/MiniMaxAI/MiniMax-Music3

官方提示词技能 (Skills) https://github.com/MiniMax-AI/MiniMax-Music3/tree/main/skills

安装步骤

  1. 下载整合包和模型文件
  2. 解压整合包,路径不要有中文
  3. 把模型文件放到ComfyUI/models/minimax_music/目录下
  4. 双击run_nvidia_gpu.bat启动 ComfyUI


三、核心玩法:如何写提示词

MiniMax-Music3 不是随便写一句“来首悲伤的歌”就能出好效果的。它需要结构化的描述,就像给音乐人写一份制作需求单。

官方推荐的三段式结构:

1. 全局信息

  • 流派/子流派、BPM(速度)、调性
  • 情绪走向(从哪到哪)
  • 收听场景、制作风格

2. 人声细节

  • 性别、音色特质、演唱风格
  • 和声、背景人声、效果

3. 编曲与段落

  • 主奏/辅奏乐器
  • 每个段落(主歌、副歌、桥段)的乐器变化
  • 律动、低音、打击乐、空间感

示例(直接可复制修改):

Warm Mandarin pop / traditional Chinese ballad, 74 BPM, A-flat major. Tender nostalgia opens into a celebratory chorus, with a mature male baritone-tenor, delicate guzheng, soft strings, gentle acoustic textures, expressive vibrato, and a natural live-room sound.

歌词格式

歌词需要用段落标签来标记结构,这样模型才知道哪里是主歌、哪里是副歌:

[Verse 1] 歌词第一段内容... [Pre-Chorus] 过渡段内容... [Chorus] 副歌内容... [Bridge] 桥段内容... [Outro] 尾奏内容...

如果不想自己写,可以用 MiniMax 官方提供的Skill(提示词生成器),输入主题就能自动生成结构化的描述和歌词。Skill 在官方 GitHub 的skills目录下。


四、ComfyUI 工作流使用

工作流节点说明

V18 整合包中,核心节点是MiniMax Music 3 Generator

输入

说明

Caption

上面的三段式结构化描述

Lyrics

带段落标签的歌词

Duration

生成时长(最长300秒)

模型选择

  • minimax_music3_dit_fp16.safetensors推荐,显存够用就选这个
  • minimax_music3_dit_int8_convrot.safetensors:显存较低时使用

生成后通过SaveAudioAdvanced节点导出 WAV 文件。

常用参数建议

  • 采样步数:官方建议 2-4 步即可,因为是 Flow Matching 架构
  • 目标时长:建议从 60 秒开始测试,确认效果后再拉长


五、常见问题

Q1:报错 "block cache" 相关?

T8 的整合包已经修复了这个问题,更新到 V18 即可。如果自己装的节点,更新ComfyUI-MiniMax-H3-BlockCache-T8到最新。

Q2:生成的歌声音不稳定/走调?

检查提示词是否写了足够的结构信息。只写一句话的描述效果通常不好,尽量按三段式把 BPM、调性、乐器、段落变化都写清楚。

Q3:为什么只有 32kHz?

目前开源版本输出是 32kHz 16-bit 立体声 WAV,比 CD 音质(44.1kHz)稍低,但做 Demo、视频 BGM、播客配乐完全够用。

Q4:能生成纯音乐吗?

可以。歌词留空,或者把is_instrumental设为 true,就会生成无人声的纯音乐版本。


六、相关资源汇总

资源

链接

官方 GitHub

GitHub - MiniMax-AI/MiniMax-Music3 · GitHub

Hugging Face 模型页

https://huggingface.co/MiniMaxAI/MiniMax-Music3

官方 Demo(在线试听)

MiniMax Music 3

官方 Skill(提示词生成)

MiniMax-Music3/skills at main · MiniMax-AI/MiniMax-Music3 · GitHub

ComfyUI 官方工作流

MiniMax Music 3:テキストから音楽 - ComfyUI Workflow


祝玩得开心!记得给 大佬和官方点个 Star~🎵

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/16 6:16:54

从PID到模型预测:管道小球摆杆控制的核心难点与工程实现

你有没有遇到过这样的场景:一个看似简单的物理控制问题,比如让小球在管道里滚动,用摆杆去接住它,听起来像是高中物理实验。但当你真正动手,把电机、传感器、控制器和代码都连起来,却发现小球要么滚过头&…

作者头像 李华
网站建设 2026/8/16 6:00:12

RAG 召回率 95% 仍答错:Anthropic 重排机制差点让我交差一份科幻小说

RAG 召回率 95% 仍答错:Anthropic 重排机制差点让我交差一份科幻小说 企业知识库系统的API版本混乱危机:从召回率陷阱到解决方案 事件背景:一个周五下午的技术噩梦 那天下午4点23分,我正在整理本周的技术周报,突然企业Slack频道亮起红色警报--来自某重要客户的紧急投诉。他们…

作者头像 李华
网站建设 2026/8/16 5:56:32

Python包发布全流程指南:从项目打包到PyPI上架

1. 项目概述:为什么要把自己的代码“上架”到PyPI? 如果你写过一些自认为不错的Python工具或库,可能遇到过这样的场景:同事或朋友想用你的代码,你得把整个项目文件夹打个压缩包发过去,对方还得手动安装依赖…

作者头像 李华
网站建设 2026/8/16 5:56:24

实测了 JDK 25 的紧凑对象头:堆省 19%,GC 暂停降 33%

测试环境:OpenCloudOS 8.10, x86_64, 4 core, JDK 25.0.4, G1 GC, 堆 1G / 512M 压测项目:RuoYi-Vue(Spring Boot 4.0.6) 数据仅供参考,不同硬件/负载/配置下结果会不同 一、先说结果 先给结论:稳定态堆占用 204MB → 165MB(-19.1%),最大 GC 暂停 36ms → 24ms(-33%…

作者头像 李华
网站建设 2026/8/16 5:54:31

ESP32智能小车实战:从零搭建循迹避障跟随机器人

这次我们来看一个基于 ESP32 的智能小车项目,它集成了循迹、避障和跟随三大核心功能。这个项目不是停留在概念阶段,而是可以直接动手搭建、烧录代码并跑起来的完整方案。对于想学习嵌入式开发、机器人控制或物联网应用的朋友来说,这是一个非常…

作者头像 李华