10 分钟语音克隆教程:RVC 语音转换模型从零上手指南

发布时间:2026/9/1 11:31:05
10 分钟语音克隆教程:RVC 语音转换模型从零上手指南 10 分钟语音克隆教程RVC 语音转换模型从零上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个开源语音克隆与语音转换工具你提供约 10 分钟单人录音它训练出一个能把你的语音转换成目标音色的模型并带 Gradio Web 界面、UVR5 人声分离和实时 AI 变声能力适合想在普通显卡上快速完成音色转换的新手。 上手前先核对硬件与磁盘最低要求跑通之前先看你这台机器能不能带得动。RVC 的推理和训练都依赖 GPUFAQ 里对显存有明确结论4GB 以下显卡基本放弃4GB 还能救6GB 以上比较稳。项目最低要求推荐配置系统Windows / LinuxmacOS 可用性能一般Windows 10/11 或主流 Linux 发行版显卡NVIDIA显存 ≥4GB6GB 及以上如 RTX 3060显存不足时调小 batch_size 和 configs/config.py 结尾的 x_pad / x_query / x_center / x_max保持默认内存 RAM16GB 以下容易在特征提取阶段报文件页面/内存错误16GB磁盘预留 10GB 以上预训练模型 训练产物20GB 第一次运行克隆、装依赖、下模型第一步克隆代码并进入项目目录git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI这条命令把 RVC 仓库拉到本地并切换进项目根目录。第二步按你的显卡装依赖需要 Python 3.9建议先建虚拟环境pip install -r requirements.txt # NVIDIA 显卡 pip install -r requirements-dml.txt # 无 N 卡走 AMD/Intel 的 DirectML分别安装 CUDA 版和 DirectML 版依赖两条只选其一。第三步下载预训练底模和辅助模型python tools/download_models.py这个 模型下载脚本 会把 hubert_base.pt、rmvpe.pt、UVR5 权重和 v1/v2 两套预训练底模拉进 assets/ 对应目录。跑完你会看到 assets/pretrained/ 和 assets/pretrained_v2/ 下各出现十几个 .pth 文件环境就算备好了。 最短出音路径10 分钟录音跑通第一个音色训练集要求不复杂约 10 分钟、同一人、底噪低、无长段静音的录音保存为 44100Hz WAV 放一个文件夹。唱歌一定要带音高指导纯语音可以不要RVC 会自动做切片、重采样和归一化所以你不用手工预处理。启动 Web 界面python infer-web.py它会起一个本地服务默认端口 7865并自动打开浏览器。进入训练标签页填实验名和训练文件夹路径然后只动下表这 4 个参数点一键训练参数默认值何时需要改目标采样率40k唱歌、追求高音质选 48k纯语音保持 40k模型是否带音高指导是练歌声必须开纯语音可关音高提取算法rmvpe_gpu显存小或 CPU 老就换 rmvpe纯 CPU总训练轮数 total_epoch20训练集音质差、底噪大保持 20~30音质高、时长多可以加到 100~200batch_size 默认按显存大小自动算显存 ÷ 2 取整显存不够时手动改 1 即可保存频率默认 5 轮一存不用动。一键训练会依次跑数据预处理、音高与特征提取、模型训练、索引训练四步。结束后你会得到两样东西logs/实验名/ 下的训练产物和 weights/ 里一个 60MB 的 .pth 小模型。接着到模型推理标签页点刷新音色列表选中你的音色、填一段待转换音频路径点转换——第一次出音就完成了。️ 调优速查算法选型、index_rate 与 pitch 校正音高提取算法速度精度适用场景pm快一般输入是歌声、只求快dio快一般CPU 差但语音质量高harvest极慢好低音质量好能等就选它crepe慢好吃 GPU效果优先rmvpe快最好默认首选微吃 GPU/CPU场景index_rate检索特征占比训练集音质高于推理源0.8 ~ 1音色更贴近训练集训练集音质一般0.3 ~ 0.7出现音色泄露结果往底模/推理源音色偏调高调到 1 基本消除泄露目标变调 pitch整数半音升/降八度12 / -12男女跨性别转换常用 12 或 -12日常微调±2 ~ 5显存相关的 RVC 训练参数也可以直接查4GB 显存用 x_pad1 / x_query5 / x_center30 / x_max325GB 用 x_pad1 / x_query6 / x_center38 / x_max416GB 及以上用 x_pad3 / x_query10 / x_center60 / x_max65这组值在 configs/config.py 里按显存自动设置。 高频排障5 个最常碰到的问题一键训练结束没有索引文件。现象训练日志正常走完但 logs 下没有 added 开头的 .index 文件。 原因训练集太大卡在了添加索引这一步内存不够。 解决1、手动点训练特征索引按钮重跑2、仍卡住就把训练集拆短或删掉冗余录音再训。分享模型时用错了文件。现象把 logs 下几百 MB 的 .pth 发给别人对方加载报 key 不存在。 原因logs 下的文件是实验状态存档不是推理用模型。 解决1、分享 weights/ 目录下 60MB 的小模型2、搭配对应的 .index 文件一起打包。训练或推理报 Cuda out of memory。现象训练中途或推理时显存溢出。 原因batch_size 或推理分块参数超出显存。 解决1、训练把 batch_size 降到 12、推理调小 config.py 里的 x_pad / x_query / x_center / x_max3、4GB 以下显卡直接放弃训练。特征提取时报文件页面/内存 error。现象step2 阶段进程崩溃。 原因开的 CPU 进程太多内存爆了。 解决1、拉低提取音高和处理数据使用的 CPU 进程数2、把过长的训练音频手工切短。训练完推理列表里看不到新音色。现象weights 里明明有新 .pth下拉框没有。 原因音色列表是启动时扫描的。 解决1、点刷新音色列表和索引路径2、还没有就查控制台与 logs/实验名 下的日志定位报错。 进阶出口实时变声、模型融合、人声分离实时变声tools/rvc_for_realtime.py 提供端到端 170ms 延迟的实时音色转换搭配 ASIO 音频设备可压到约 90ms非常依赖驱动支持Windows 下可直接用 go-realtime-gui.bat 启动。模型融合WebUI 的ckpt处理标签页可输入两个模型路径和一个 A 模型权重默认 0.5按权重混合出介于两者之间的新音色融合逻辑在 infer/lib/train/process_ckpt.py。人声分离WebUI 内置 UVR5 标签页支持人声伴奏分离、去混响、去回声先用它把歌曲里的人声提干净再拿去当训练集通常比直接喂原曲效果好。✅ 接下来做什么先用 10 分钟录音完整跑一遍一键训练别急着调参。推理时用 index_rate 和 protect 滑杆各试 2~3 档对比音色还原与电音程度。同一份数据分别用 40k 和 48k 训练听清采样率差异后再决定主力配置。分享模型时只发 weights 里的 60MB 小模型加 .index 文件。遇到没列出的报错先看 中文 FAQ 和 WebUI 内置的常见问题解答页。合规提醒本项目以 MIT 协议开源使用软件者、传播软件导出声音者自负全责。训练他人声音前务必取得授权输出内容不得用于诈骗、冒充或侵犯他人声音权益详见根目录 LICENSE。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考