RVC语音转换:用10分钟音频数据训练语音克隆模型的实操记录

发布时间:2026/9/2 10:36:17
RVC语音转换:用10分钟音频数据训练语音克隆模型的实操记录 RVC语音转换用10分钟音频数据训练语音克隆模型的实操记录【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是一个基于 VITS 的开源语音转换框架解决少量语音数据如何训练出可用音色模型的问题。它的核心做法是用 top1 检索替换输入源特征从机制上杜绝音色泄漏官方口径是 10 分钟以内的语音数据即可训练出效果不错的变声模型实测在 6GB 显存的消费级显卡上也能跑完整训练流程。RVC 语音克隆项目概述与技术架构RVC 的底模使用接近 50 小时的开源 VCTK 数据集训练推理链路为 Hubert 特征提取 RMVPE 音高提取 NSF 声码器音高提取采用 Interspeech 2023 的 RMVPE 算法比 crepe_full 更快且资源占用更小。与同类工具相比它的差异主要在三点对比项RVC常规 VITS 类工具训练数据量推荐 ≥10 分钟低底噪语音通常需 30 分钟以上音色泄漏控制top1 faiss 检索替换源特征无专门机制需人工调参额外能力内置 UVR5 人声/伴奏分离、ckpt 模型融合需另接第三方工具RVC 语音克隆环境搭建与安装步骤最低系统要求Python 3.8 以上poetry 方式建议 3.7–3.10其他版本装 llvmlite 会冲突FFmpegUbuntu/Debiansudo apt install ffmpegmacOSbrew install ffmpegWindows 需下载 ffmpeg.exe 和 ffprobe.exe 放到项目根目录支持 CUDA 的 N 卡可选A 卡/I 卡有对应依赖包CPU 也可运行预训练模型文件assets/hubert/hubert_base.pt、assets/pretrained、assets/uvr5_weights用 v2 底模需额外下载assets/pretrained_v2tools/download_models.py可批量拉取安装命令git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt # N卡A卡/I卡改用 requirements-dml.txtmacOS 用户可跳过上述步骤直接执行sh ./run.sh装依赖。验证方法运行python infer-web.py浏览器能打开默认 7865 端口的 WebUI 界面即安装成功端口冲突时用--port参数指定。RVC 核心工作流数据准备、模型训练与推理测试数据准备与切片规格推荐规格对应 WebUI一键训练的处理管线采样率32k / 40k / 48k 三档新手用 40k 即可音质优先选 48k总量10–30 分钟纯人声底噪越低越好单条长度交给内置 slicer 自动切片3–10 秒无需手工切格式wav / mp3 均可操作把源音频放进一个文件夹若素材是人声伴奏混合的歌曲先用音频分离选项卡调用 UVR5 提取干声。注意源音频要目标音色本人录制混入他人声音会导致模型音色不纯。模型训练参数配置新手推荐值以 v2/32k 默认配置configs/v2/32k.json为基准参数推荐值说明batch_size4显存紧张降到 2默认 4显存不足时报 OOM 就调低训练轮数100–200高质量数据 100 轮起步learning_rate1e-4默认值一般不动音高算法RMVPE精度与速度平衡最好需把 rmvpe.pt 放到项目根目录操作① 打开训练选项卡选音频文件夹 → ② 填实验名用英文/数字→ ③ 选采样率和底模版本 → ④ 点一键训练训练结束后在weights目录生成 .pth 模型同时输出 faiss 索引文件。注意训练过程中 WebUI 会占用较长时间期间不要中断中断后可用已保存的 epoch 断点续训。推理测试与关键参数操作① 切到推理选项卡刷新音色列表选择刚训练的模型 → ② 上传或填写源音频 → ③ 勾选使用音高并选 RMVPE → ④ 设置音调升降半音数如 4 变亮、-4 变低沉→ ⑤ 点转换。两个对效果影响最大的参数Index Rate0–1检索特征的融合强度默认 0.5调高更像目标音色但超过 0.9 容易出现声音发虚保护protect0–1保留非人声成分的强度默认 0.33处理含口技/音效的音频时调高RVC 训练与推理参数调优对比以下三个参数是实测中影响最明显的建议各跑一遍做 A/B 对比参数参数值 → 效果变化调整方向Index Rate0.2 偏中性、0.5 默认均衡、0.8 以上更像目标音色但易发虚起始值 0.5觉得不够像每次 0.1 往上试训练轮数50 轮音色偏糊、100–200 轮细节稳定、400 轮以上易过拟合出现金属音新手固定 150 轮数据量小时可减到 100采样率32k 快但高频损失明显、48k 音质上限更高但训练慢约 30%普通配音 40k 足够翻唱选 48k一个实用的调参习惯固定其他参数只动一个变量用同一段 10 秒源音频对比输出比凭感觉调快得多。RVC 常见问题排查训练报错 OOM显存不足现象训练到某个 epoch 报CUDA out of memory。可能原因batch_size 相对显存过大或采样率选到了 48k。解决方法batch_size 降到 2或改用 32k/40k 采样率仍不行就加--noautoopen关闭无关进程腾显存。转换后出现哑音部分段落无声现象输出音频在音高变化剧烈的地方断掉或失声。可能原因音高提取算法选错rmvpe.pt 未放到根目录导致 RMVPE 不可用。解决方法确认音高算法选 RMVPE检查根目录存在 rmvpe.pt 文件。音色泄漏输出里混入源声音现象输出里能听到源说话人的音色。可能原因训练集中混入了非目标音色的音频。解决方法清洗训练集后重训这是 RVC 用 top1 检索机制重点规避的问题数据干净的前提下基本不会出现。WebUI 打开后端口被占用现象启动提示 7865 端口已有服务。可能原因上一个实例没退出或本地有其他程序占了 7865。解决方法启动命令加--port 7866换端口或直接杀掉残留的 python 进程。RVC 进阶方向模型融合与微调用ckpt 处理选项卡的 ckpt-merge 对两个 .pth 模型按权重融合可混合多个音色或修掉个别瑕疵源码见 infer/modules/vc/utils.py实时变声推理tools/rvc_for_realtime.py支持端到端约 170ms 延迟ASIO 设备可压到 90ms适合直播和游戏场景ONNX 导出推理tools/export_onnx.py 可将模型导出为 ONNX 格式脱离 PyTorch 运行推理开销更低更完整的参数说明和报错案例可查 docs/cn/faq.md版本演进记录见 docs/cn/Changelog_CN.md。写在最后RVC 效果的上限基本由训练数据质量决定音频清洗值得多花时间参数调优其次。下一步建议拿 UVR5 分离一段歌曲干声做完整流程走一遍——分离 训练 推理串起来跑通后再进入 ckpt-merge 模型融合环节收益最明显。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考