
RVC 人声分离怎么做UVR5 从环境搭建到批量输出的完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC内置了一套基于 UVR5 的人声分离模块能把混音里的人声和伴奏拆成两份独立音频为翻唱训练、去混响修复、素材提取等场景提供干净的声音素材。本文按先跑通、再理解、后调优的顺序带你从零完成第一次分离。1. 快速上手从克隆仓库到第一次分离结论整个上手链路只有四步——装依赖、放权重、启动 WebUI、在界面上点一次分离。以下按最小必要步骤展开。1.1 获取代码与安装依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI进入目录后根据显卡选择对应的依赖清单安装Python 需 3.8 以上pip install -r requirements.txt # NVIDIA 显卡 pip install -r requirements-amd.txt # AMD 显卡Linux/ROCm pip install -r requirements-dml.txt # AMD/Intel 显卡DirectML pip install -r requirements-ipex.txt # Intel 显卡Linux/IPEX另外确认系统已安装ffmpeg与ffprobemacOS 可用brew install ffmpegUbuntu/Debian 用apt install ffmpeg。分离流程在输入格式不标准时会依赖 ffmpeg 做自动转码。1.2 准备 UVR5 权重文件模型文件统一放在 assets/uvr5_weights/ 目录文件名即界面里可选择的模型名。仓库自带了一份下载脚本 tools/dlmodels.sh其中列出的 UVR5 权重清单为模型文件定位HP2_all_vocals.pth通用人声提取HP3_all_vocals.pth带高频端处理的人声提取HP3 系列HP5_only_main_vocal.pth只提取主唱人声适合多声部歌曲VR-DeEchoNormal.pth/VR-DeEchoAggressive.pth常规 / 激进去回声去混响VR-DeEchoDeReverb.pth混响压制偏重的版本onnx_dereverb_By_FoxJoy/vocals.onnxONNX 格式去混响模型先下载一两个常用的例如HP2_all_vocalsVR-DeEchoNormal即可跑通其余按需补齐。1.3 启动 WebUI 并执行首次分离在项目根目录执行python infer-web.py启动后浏览器会自动打开界面设备CUDA / Metal / CPU由 configs/config.py 自动探测无需手动配置。进入 UVR5 分离选项卡完成四件事选择模型名对应权重文件名指定输入目录放歌曲或人声混音分别指定人声输出目录与伴奏输出目录设置聚合度agg与输出格式点击开始。处理完成后两个输出目录里会按原文件名得到分离后的人声与伴奏文件。2. 核心能力拆解分离功能的全部入口在 infer/modules/uvr5/共三个文件统一调度、频谱分离、去混响专用网络。理解以下三个能力点就覆盖了日常使用场景。2.1 多模型人声/伴奏分离调度逻辑见 infer/modules/uvr5/modules.py按模型名路由到不同的分离网络人声/伴奏两个结果分别写入你指定的目录。选型的判断依据很简单——多声部歌曲选only_main_vocal类模型普通二合一歌曲选通用 vocals 模型。2.2 去回声与去混响DeEcho 系列VR-DeEcho*系列模型名中含 DeEcho 字样时会走 infer/modules/uvr5/vr.py 中专门的去回声预处理分支比普通分离多一层混响压制。录制环境不好的 demo、翻唱原曲想拿干净人声时这类模型比普通 vocals 模型更合适。另有一个 ONNX 去混响模型由 infer/modules/uvr5/mdxnet.py 中的MDXNetDereverb网络承载。2.3 输入自动转码与整目录批处理modules.py会先用 ffprobe 检查输入若不是 44100Hz 立体声自动经 ffmpeg 转码为 44.1kHz 立体声 WAV 再进模型单声道输入会被自动复制成双声道。输入目录里可以放多个文件程序逐个处理并打印文件名-Success的进度天然支持批量。3. 实战工作流从一首歌到可用的翻唱训练数据这是 RVC 里 UVR5 最常见的用途用 UVR5 从原曲中提取人声再把这些人声作为训练数据去训练自己的音色模型。完整链路如下准备素材挑 35 首目标歌手底噪低、混响少的歌放入一个目录如my_songs/。批量分离WebUI 的 UVR5 分离选项卡中输入目录选my_songs/模型先用HP2_all_vocals跑一遍若人声带明显水声残留换VR-DeEchoNormal重跑输出到vocals/。人工筛选听一遍输出保留分离干净的片段。多声部歌曲建议改用HP5_only_main_vocal再提取一次只留主唱。喂给训练流程把筛选后的干净人声集中到一个目录在训练选项卡中作为训练数据输入官方建议至少 10 分钟低底噪语音进入预处理 → 训练 → 推理的常规流程。第二个轻量场景是去混响修复录制的 demo 房间回声重时用VR-DeEchoAggressive跑一遍输出目录得到压过混响的人声可直接用于后期处理。激进版压制更强但会损失部分自然度建议 Normal 与 Aggressive 各跑一份对比再定稿。4. 排错与调优4.1 常见问题排查现象可能原因处理办法界面模型下拉列表为空assets/uvr5_weights/下没有.pth文件按 1.2 清单补齐权重文件名需与清单一致某文件处理失败或无输出输入格式异常自动转码依赖 ffmpeg确认ffmpeg/ffprobe已安装且在 PATH 中处理明显偏慢跑在 CPU 上或聚合度设得过高确认已装好 CUDA 依赖调小 agg分离边缘有水声、残留感模型与素材不匹配换 DeEcho 系列或 HP3/HP5 对比试听显存吃紧、批处理中断单次处理音频过长把长音频切成数分钟一段再分目录处理4.2 性能与质量优化要点设备与精度config.py的device_config()会自动处理大部分情况——老款显卡如 GTX 10 系会被强制降级为 fp32 并覆写configs/inuse/下配置这是正常行为不用手动改。聚合度agg控制分块之间的重叠平滑程度。值越大边缘越干净但耗时越长先用中等值起步对拼接痕迹明显的文件再单独调大重跑。输入规格44100Hz 立体声文件会跳过转码直接进模型是效率最高的输入形式手头的 MP3 直接丢进去也可以代价是多一步转码时间。输出格式界面上可选输出格式翻唱训练、二次处理选无损格式如 flac/wav试听对比选压缩格式即可不影响分离质量。批处理习惯把同批文件放同一个目录一次跑完程序处理结束后会自动执行torch.cuda.empty_cache()释放显存连续跑多批无需手动干预。5. 延伸探索docs/cn/faq.md中文常见问题分离、训练相关报错先来这里查。docs/cn/Changelog_CN.md更新日志了解各版本新增的分离能力与修复项。infer/lib/uvr5_pack/lib_v5/modelparams/UVR5 的分频段参数配置4band_v2.json等想理解为什么分离要分 4 个频段可以看这里。tools/模型下载、批量推理等辅助脚本infer_cli.py适合不想开界面时走命令行。可以立即执行的三步按 1.2 清单下载HP2_all_vocals与VR-DeEchoNormal两个权重到 assets/uvr5_weights/跑通第一次分离用同一首歌对比这两个模型的输出建立对分离强度的听觉判断挑出一段 30 秒左右的干净人声接入训练选项卡走一遍完整流程把 UVR5 和 RVC 训练串成自己的固定工作流。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考