RVC WebUI完整指南:用10分钟音频训练语音克隆模型

发布时间:2026/9/20 11:32:13
RVC WebUI完整指南:用10分钟音频训练语音克隆模型 RVC WebUI完整指南用10分钟音频训练语音克隆模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手里有一段喜欢的声音录音想拿它做游戏直播配音、给视频换人声、做一首自己的AI翻唱——RVC WebUIRetrieval-based-Voice-Conversion-WebUI就是为此设计的一个把 10 分钟低底噪音频变成可用语音克隆模型的音色转换框架附带端到端 90–170ms 延迟的实时变声器。RVC WebUI与传统变声器的差别传统变声器本质是变调频谱扭曲效果千篇一律RVC 是训练一个这个人的声音的模型输出的是具体某个人的音色。RVC WebUI传统变声器原理训练专属音色模型做检索式特征替换调整音高和频谱数据要求约10分钟干净音频无输出效果可还原特定人声音色机械感、卡通感实时延迟170msASIO 设备约 90ms更低但音色不自然硬件门槛建议 4GB 以上显存CPU 即可三个值得先知道的功能 ✨一键训练流程数据切分、F0基频即音高提取、HuBERT 声纹特征提取、模型训练、索引构建在网页界面点完即可不需要记任何命令行。检索防音色泄漏推理时从训练集特征库检索最接近的特征去替换源音频特征让输出音色钉在目标声音上不会被你喂进去的音频带偏强度由 index_rate 旋钮控制。实时变声可用端到端 170ms配 ASIO低延迟音频设备协议输入输出可压到约 90ms够直播对线。从克隆到启动让 RVC WebUI 跑起来 环境要求Python 3.12 x64先克隆仓库进入根目录git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI再按硬件装依赖文件在仓库根目录名字别拼错作者原文就是 requirments你的硬件安装方式CPU / AMD / Intel直接装requirments_cpu_py312.txtNVIDIA RTX 50 系以前先装 CUDA 11.8 版 Torch再装requirments_cu118_py312.txtNVIDIA RTX 50 系先装 CUDA 12.8 版 Torch再装requirments_cu128_py312.txtpython -m pip install -r requirments_cpu_py312.txtN 卡用户把文件名换成上表对应项即可。装完需要下载底模HuBERT 特征模型、RMVPE 音高模型、预训练权重放到 README 规定的目录结构下python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include pretrained/* pretrained_v2/* --local-dir assets最后启动python webui.py浏览器会自动打开默认端口 7865。Windows 用户也可以跳过手动建环境直接双击go-webui.bat启动 WebUI、go-realtime_gui.bat启动实时变声界面。一键训练与单次推理选项卡怎么用训练侧把 10 分钟以上、低底噪的 WAV 音频放进一个独立文件夹在一键训练选项卡填一个实验名采样率选 40kv1 模型或 48kv2音高提取算法选rmvpe点开始。流程会依次跑数据切分 → F0 提取 → HuBERT 特征提取 → 模型训练 → 索引训练。完成后能用于推理和分享的60MB 小模型生成在assets/weights/对应的.index特征库在assets/indices/logs/实验名/里的大文件是断点续训用的别拿去分享。推理侧在单次推理选项卡选择模型、上传音频、设变调单位半音12 为升八度点转换。要批量处理用批量推理想从歌曲里只留伴奏做 AI 歌手场景用 UVR5 人声分离选项卡对应实现在 tools/uvr5/。index_rate与protect参数怎么调 ️这两个是调效果时最先要动的旋钮都在单次推理选项卡index_rate检索特征占比0–1默认 0.75当底模或源音频音质高于你的训练集时输出音质会被带高但音色会往底模/源音频方向飘这叫音色泄漏。调高它压制泄漏代价是音质倾向训练集调到 0 则关闭检索保护。如果你的训练集本身就高质量且时长足把训练轮数total_epoch调高模型自身就能站稳音色index_rate 反而不重要。protect默认 0.33上限 0.5保护清辅音和呼吸声防止电音、撕裂这类伪影。往上拉保护更强但会削弱索引效果一般 0.33 起步按需微调。音高算法推理可选 pm / rmvpe / fcpe训练只支持 pm / rmvpe。默认推荐的rmvpe是 InterSpeech 2023 的 vocal 音高算法速度快、占用小、哑音少新手不用换。避坑找不到模型、显存爆、ffmpeg 报错 ⚠️现象启动后提示 hubert 或 rmvpe 文件缺失。原因底模没下载或没放进assets/下的规定子目录hubert_base/、rmvpe/、pretrained/等。解法按上一步的hf download命令重新放置Windows 还需把 ffmpeg.exe、ffprobe.exe 放到项目根目录Ubuntu 用 apt 装 ffmpeg 即可。现象训练或推理时 CUDA out of memory。原因显存不足4GB 以下基本无解。解法训练就调小 batch size推理就缩小 configs/config.py 末尾的 x_pad、x_query 等分段参数。现象数据切分阶段报 ffmpeg error 或 utf8 error。原因训练集路径带空格、括号或中文ffmpeg 读不动写 filelist 时编码出错。解法把训练集挪到纯英文、无空格的路径再跑。现象训练完推理听不到训练集的音色。原因没点刷新音色或者误用了logs/里的断点文件。解法先点刷新音色仍没有就去 ckpt 选项卡做小模型提取确认用的是 weights 下的 60MB 模型。更多帮助FAQ与更新日志在哪查 两份文档值得先翻一遍docs/cn/faq.md中文 18 问覆盖中断/续训、中途加数据、模型分享、llvmlite.dll 报错等细节docs/cn/Changelog_CN.md版本变更升级前看一眼下一步很具体打开 FAQ 过一遍准备 10 分钟干净音频放进一个文件夹跑一次一键训练——转换完第一首测试音频你就能听出自己的第一个克隆音色了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考