Retrieval-based-Voice-Conversion-WebUI 快速上手:从 10 分钟语音到可用变声模型的完整教程

发布时间:2026/9/1 14:12:29
Retrieval-based-Voice-Conversion-WebUI 快速上手:从 10 分钟语音到可用变声模型的完整教程 Retrieval-based-Voice-Conversion-WebUI 快速上手从 10 分钟语音到可用变声模型的完整教程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是一个基于 VITS 的开源语音转换框架给它 10 分钟左右的干声它就能训练出一个模仿目标音色的转换模型供唱歌、配音、实时变声使用。全文按装环境 → 跑通训练 → 调参数 → 排错 → 进阶的顺序展开你照着做就能得到自己可用的模型。RVC 是什么先确认它适不适合你读完本节你能判断 RVC 是否匹配你的需求并知道它和纯 TTS的区别。RVC 属于语音转换Voice Conversion, VC而非文本朗读它不做文字转语音而是把你唱/说的音频换掉音色转成另一个人听起来的声音语调、咬字、气息都保留原样。它的几个事实性特点用 top1 检索把输入源特征替换为训练集特征从机制上抑制音色泄漏即输出被原唱或底模音色带偏在入门级 N 卡上也能较快完成训练4G 显存可用4G 以下基本放弃推荐收集至少 10 分钟低底噪语音10–50 分钟是官方建议区间自带网页界面训练、推理、UVR5 人声伴奏分离、模型融合ckpt-merge都在浏览器里点按钮完成支持 AMD/Intel 显卡DirectML、ROCm、IPEX 路径适合的人想用自己或某个歌手的少量语音做变声模型、不想写代码的用户。不适合的人需要输入文字直接出声音的场景RVC 不解决这个问题。RVC 安装教程环境与预训练模型准备读完本节你完成仓库拉取、依赖安装、预训练模型与 ffmpeg 的放置具备启动条件。第一步拉取代码并安装 Python 依赖要求 Python 大于 3.8。以 N 卡为例git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt不同显卡对应不同依赖文件按需替换最后一行A 卡 / I 卡DirectML 路线pip install -r requirements-dml.txtA 卡 ROCMLinuxpip install -r requirements-amd.txtI 卡 IPEXLinuxpip install -r requirements-ipex.txt第二步补齐 RVC 运行所需的预训练模型文件。清单如下官方提供了批量下载脚本见tools目录assets/hubert/hubert_base.ptassets/pretrained用 v2 底模则再加assets/pretrained_v2assets/uvr5_weightsUVR5 分离人声用第三步装 ffmpeg 并放置音高提取模型sudo apt install ffmpeg # Ubuntu/DebianmacOS 用 brewWindows 需手动下载放根目录再把rmvpe.ptRMVPE 音高提取算法的模型参数放到 RVC 根目录DML 用户可选下rmvpe.onnx。RVC 模型训练步骤从音频到第一次推理读完本节你走一遍放数据 → 一键训练 → 建索引 → 推理试听的完整流程。准备数据把目标音色的干声UVR5 分离出的人声即可界面内可直接调用放进一个文件夹建议 10–50 分钟底噪越低越好。路径避免空格、括号和中文这是 ffmpeg 报错的高发原因。启动界面Windows 双击go-web.bat其他系统执行python infer-web.py浏览器自动打开默认端口 7865。训练在训练选项卡填实验名、指定音频文件夹点一键训练。它会自动完成数据切割按静音切分再按 4 秒切片、HuBERT 特征提取、模型训练和索引训练产物存放在logs/实验名/下。推理在推理区加载weights下 60MB 的 pth 模型和训练生成的added_xxx.index索引上传源音频选择音高提取方式默认 RMVPE与 index rate点转换即可试听。没看到新音色时先点刷新音色。训练完成后可随时回训练选项卡点训练索引补建索引完整流程细节可参考 官方训练说明。RVC 关键参数配置epoch、index rate 与显存档位读完本节你能根据自己显卡和训练集质量选对 epoch 数、index rate 和推理显存参数。total_epoch训练轮数训练集底噪大、音质一般20–30 轮足够调太高底模也拉不动你的低音质数据训练集干净、时长多可以放到 200 轮。index rate检索比例取值 0–1。调高接近 1能最大限度消除音色泄漏但音质更贴近训练集水平调 0 则完全不启用检索保护。训练集本身优质且轮数足时这个参数影响不大。推理显存参数configs/config.py 末尾的x_pad / x_query / x_center / x_max控制批量推理的切片长度官方按显存分了三档# 6G 显存fp16 x_pad, x_query, x_center, x_max 3, 10, 60, 65 # 5G 显存fp32 老卡 x_pad, x_query, x_center, x_max 1, 6, 38, 41 # 4G 及以下 x_pad, x_query, x_center, x_max 1, 5, 30, 32显存不足报 CUDA out of memory 时训练降 batch size推理降上面四个值。多卡用户在此文件的device里选cuda:0/1卡号对应关系可在训练选项卡的显卡信息栏看到。RVC 常见报错排查训练与推理阶段的高频问题读完本节遇到报错时你能对号入座多数情况不用求助也能解决。更多问题见 官方 FAQ。ffmpeg error / utf8 error大概率不是 ffmpeg 本身而是音频路径含空格、括号等特殊符号或中文路径导致 filelist 写入失败。把路径改纯英文、无空格后重跑。一键训练结束没有索引文件训练集太大卡在加索引步骤重新点一次训练索引即可。Connection Error检查控制台黑窗口是否被误关。Expecting value: line 1 column 1关闭系统局域网/全局代理包括远程服务器上的 http_proxy 设置。中断后继续训练关掉程序重新go-web.bat启动用相同参数点训练模型会从上次 checkpoint 接着训。模型怎么分享分享weights文件夹下 60MB 的 pth后续会合并 index 成 zip不要分享logs下几百 MB 的实验 pth——强行拿它推理会报 f0、tgt_sr 等 key 缺失。wavs16k 张量尺寸不匹配报错找到该文件夹里体积异常小的坏音频删掉重新点训练模型。llvmlite.dll 报错Windows安装微软 VC 运行库后重启 WebUI。RVC 进阶玩法模型融合、批量转换与实时变声读完本节你掌握三种超出单次训练推理的用法。模型融合ckpt 选项卡里的 ckpt-merge 支持按权重混合多个训练好的模型用来微调音色同选项卡底部还能从实验 pth 提取可分享的小模型、修改是否携带音高/采样率信息。批量转换手头一堆音频时不用逐个点界面用 tools/infer_batch_rvc.py 指定输入目录、模型和索引路径一次跑完索引也可以脱离界面用 tools/infer/train-index.py 单独训练另有tools/export_onnx.py用于导出 ONNX 模型给轻量部署。实时变声双击go-realtime-gui.bat启动独立 GUI对应tools/rvc_for_realtime.py。官方实现端到端约 170ms 延迟搭配 ASIO 输入输出设备可降到约 90ms但高度依赖声卡驱动支持。适合直播、K 歌等场景。小结与行动指引RVC 的适用场景很明确少量语音10 分钟以上干声训练专属音色模型用于唱歌、配音与实时变声。按本文顺序操作——装依赖、下预训练模型、放数据一键训练、按显存档位调参——第一次就能得到可听效果的模型遇到报错先查参数路径与代理这两类高频原因再对照 FAQ 处理。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考