news 2026/9/14 4:02:39

Ultimate Vocal Remover v5.6 指南:如何用 AI 人声移除从歌曲中提取人声与伴奏

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ultimate Vocal Remover v5.6 指南:如何用 AI 人声移除从歌曲中提取人声与伴奏

Ultimate Vocal Remover v5.6 指南:如何用 AI 人声移除从歌曲中提取人声与伴奏

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

Ultimate Vocal Remover(简称 UVR)是一款带图形界面的开源 AI 音频分离工具,它调用 MDX-Net、VR Architecture、Demucs 三类深度学习模型,把一首歌拆成人声、伴奏、鼓、贝斯等独立轨道,不需要写代码,适合想提取伴奏做人声消除、或做多轨拆分但不会用专业音频软件的用户。

典型使用场景

从翻唱录音里提取干净伴奏。选 MDX-Net 架构的人声模型,可以得到相对干净的人声轨和伴奏轨,能用于练声、伴奏跟唱。边界在于:混音复杂、人声混响重的曲目,伴奏里仍会有少量人声残留。

给播客或录音清掉背景噪声。选 VR Architecture 架构的降噪模型,专门处理底噪、环境音这类问题,效果比通用分离模型更定向。它解决不了失真或削波问题。

把歌曲拆成多轨。用 Demucs 模型一次拆出 Vocals、Drums、Bass、Other 四轨(部分模型支持 Guitar、Piano 六轨),适合做采样、翻编。鼓和贝斯的分离质量整体最好,人声轨通常不如专用人声模型纯净。

安装与环境准备

硬件方面:软件只支持 64 位系统;用 NVIDIA 显卡跑 GPU 加速最低要求 RTX 1060 6GB,推荐 8GB 以上显存,没有独显时 CPU 也能跑,只是更慢。

Windows 安装

从项目 Release 页下载 v5.6 Windows 安装程序(UVR_v5.6.0_setup.exe),按向导安装即可,包内已带 Python 和 PyTorch,无需额外装依赖。注意:必须装到 C 盘主目录,装到其他盘会导致不稳定;AMD 显卡或 Intel Arc 用户选 OpenCL 版本安装包。

macOS 安装

从 Release 页下载对应芯片的 dmg:M 系列芯片选 arm64 版本,Intel 芯片选 x86_64 版本。要求 macOS Big Sur 及以上;M1 芯片的 MPS 加速已支持 Demucs v4 和所有 MDX-Net 模型。首次启动初始化可能需要 5–10 分钟。

Linux 安装

Debian/Ubuntu 系最短路径(install_packages.sh 脚本会顺带装好系统依赖):

sudo apt update && sudo apt upgrade sudo apt install ffmpeg python3-pip python3-tk chmod +x install_packages.sh ./install_packages.sh python3 UVR.py

Arch 系则用sudo pacman -S python-pip tk ffmpeg装好依赖后执行pip3 install -r requirements.txt && python3 UVR.py。注意处理非 WAV 文件依赖系统里的 FFmpeg。

提取伴奏的完整操作流程

第一步:导入音频并指定输出目录

在 "Select Input" 区域点按钮选择音频文件,或直接拖文件进窗口;在输入列表上右键可以整文件夹批量导入。然后用 "Select Output" 指定导出目录,批量处理时输出会按文件名自动归档。上方的 WAV / FLAC / MP3 单选框决定导出格式,默认 WAV(16-bit PCM),除非要压缩体积,否则保持 WAV。

第二步:选择 AI 模型架构

"Choose Process Method" 下拉框有五个选项,按需求选:

  • MDX-Net:人声/伴奏分离的首选,模型列表里的 MDX23C 系列是当前分离精度最高的一档。只要人声和伴奏两轨,选它。
  • VR Architecture:主打降噪、去混响,适合处理有噪声的素材;人声分离纯度不如 MDX-Net。
  • Demucs:多轨拆分,一次分出 Vocals、Drums、Bass、Other。要拆鼓或贝斯选它。
  • Ensemble Mode:把 2 个及以上模型结果合并,精度更高但耗时更长,新手第一轮不用开。
  • Audio Tools:对齐、混音等后处理工具,不是分离模型。

首次使用时模型列表为空:点左下角扳手图标进设置,在 Download Center 下载所需模型,文件会存到 models/ 目录(MDX 模型进 models/MDX_Net_Models/,VR 进 models/VR_Models/)。

第三步:设置处理参数

参数区随架构变化,常见的是:

  • Segment Size(MDX-Net):喂给模型的音频块长度,默认 256。显存紧张就调小,追求质量且显存足够就调大。
  • Overlap(MDX23C):重叠量,默认 8,管边界平滑度,一般不动。
  • Window Size(VR Architecture):默认 512。320 质量略好但更慢,1024 更快但质量下降。
  • Aggression(VR Architecture):提取强度,默认 5,人声/伴奏都建议保持 5。
  • GPU Conversion:有 NVIDIA 显卡务必勾选,速度差距明显;AMD 用 OpenCL 版本对应开关。
  • Sample Mode (30s):只处理前 30 秒,用来快速试听效果,正式跑之前先勾它测一次。

第四步:运行分离

确认输入、输出、模型、参数无误后点 "Start Processing"。底部进度条和状态文本会实时显示当前文件和处理进度,批量任务按队列顺序自动跑完,中途可点停止按钮(会弹确认框)。软件关闭时会自动记住本次设置,下次打开不用重设。

第五步:查看输出结果

结果在输出目录里,文件名格式为"原文件名_模型名_轨道名.wav",例如test_MDX23C-InstVoc_HQ_vocals.wav是人声轨,..._instrumentals.wav是伴奏轨。用系统播放器对比原曲听一遍:伴奏轨重点听主歌/副歌段落有没有明显人声残留,人声轨听有没有破音或空洞感。不满意就换模型或调参数重跑。

关键参数速查

参数作用默认值建议值
Segment Size(MDX-Net)模型处理音频的块大小,影响内存占用与质量256显存 8GB+ 可试 512,内存紧张降到 128
Overlap(MDX23C)分块重叠量,影响拼接边界平滑度8保持 8,边界有接缝时试 12–16
Window Size(VR Arch)频谱分析窗口,平衡速度与质量512常规 512,慢机 1024
Aggression(VR Arch)主轨道提取强度5保持 5,超过 5 容易糊
Demucs Stem 选择决定输出哪些轨道All Stems只要人声/伴奏就选 Vocals,省时

表内参数都从默认值起步即可,一次只改一个参数对比结果,更容易判断是哪个起了作用。

常见问题处理

现象:处理 MP3/FLAC 等文件时报错。原因:系统缺少 FFmpeg,UVR 依赖它转换非 WAV 格式。 处理:Linux 执行sudo apt install ffmpeg;Windows 把 ffmpeg.exe 放到 UVR 安装目录。

现象:内存分配错误,进程崩溃。原因:Segment 或 Window 尺寸太大,显存/内存装不下。 处理:把 Segment Size 减半重跑,显存 6GB 以下建议不超过 256。

现象:处理速度明显偏慢。原因:没走 GPU,或块尺寸过大。 处理:勾选 GPU Conversion 并确认 NVIDIA 驱动正常;仍慢则降低 Segment Size,并关掉占显卡的后台程序。

现象:伴奏里人声残留较多。原因:模型与音频风格不匹配,或分离强度不够。 处理:换 MDX23C 系列里另一个模型对比;或用 Ensemble Mode 合并两个模型结果;Demucs 的 Vocals 轨也可以做交叉验证。

现象:macOS 上点击无反应或打不开应用。原因:系统安全策略拦截未公证应用(Sonoma 的左键问题已在 v5.6 修复)。 处理:终端执行sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app后重试。

延伸资源

  • README.md:完整安装说明、硬件要求与故障排查
  • install_packages.sh 与 requirements.txt:Linux 一键安装脚本和 Python 依赖清单
  • models/:三类模型(VR、MDX-Net、Demucs)的本地存放目录
  • separate.py:分离推理的核心实现,想看模型如何被调用可以读这里

结语

先用默认参数勾上 Sample Mode (30s),对一首目标曲目跑 30 秒试听,确认伴奏残留是否在可接受范围,再取消采样模式跑完整版。找到一组可用设置后,在 "Select Saved Settings" 里存成预设,后续同类文件直接套用即可。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/14 4:02:11

Rufus 完整教程:用 unattend.xml 定制你的 Windows 11 安装盘

Rufus 完整教程:用 unattend.xml 定制你的 Windows 11 安装盘 【免费下载链接】rufus The Reliable USB Formatting Utility 项目地址: https://gitcode.com/GitHub_Trending/ru/rufus 装 Windows 11 到 OOBE(开箱体验,也就是首次开机…

作者头像 李华
网站建设 2026/9/14 4:01:28

WinForms现代化改造:MWGA框架迁移实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/14 3:59:56

GCC 9.1.0源码编译实战:精准控制ABI与跨平台工具链构建

简介:本资源为GNU编译器集合(GCC)9.1.0版本的官方源码压缩包,面向Linux系统开发者、嵌入式工程师、编译器学习者及高校计算机专业师生,用于自主编译、定制化构建C/C等多语言编译工具链。压缩包为gz格式,大小…

作者头像 李华
网站建设 2026/9/14 3:58:56

turbostat实战:从MSR寄存器到功耗墙,轻松定位CPU频率与状态

简介:这是面向Linux/Unix系统管理员与开发者的CPU性能监控源码资源,聚焦Intel处理器Turbo Boost频率变化与C-state驻留分析,适合对系统底层机制感兴趣的编程人员学习。压缩包共1个文件,为13KB的turbostat.c源代码,代码…

作者头像 李华
网站建设 2026/9/14 3:58:03

A2UI Issue Triage Criteria 实战指南:分类、优先级与自动化值守流程

A2UI Issue Triage Criteria 实战指南:分类、优先级与自动化值守流程 【免费下载链接】a2ui 项目地址: https://gitcode.com/GitHub_Trending/a2/a2ui 本篇技术指南以 A2UI 仓库中 a2ui-issue-triage 技能的分类判定文档 为核心骨架,系统讲解 A2…

作者头像 李华