GPT-SoVITS预训练模型下载部署与版本切换完整指南

发布时间:2026/8/30 14:22:23
GPT-SoVITS预训练模型下载部署与版本切换完整指南 GPT-SoVITS预训练模型下载部署与版本切换完整指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 的预训练模型决定了一个少样本语音克隆系统能合成出什么水平的声音模型选错了训练和推理全白干。本文解决四件事——选对模型版本、把模型文件放到正确位置、看懂tts_infer.yaml里的配置项、快速切换版本并排查常见故障。内容基于仓库内GPT_SoVITS/configs/与 webui.py 的实际代码。 快速上手先做这3件事第一次使用 GPT-SoVITS 预训练模型按顺序完成以下三步即可。启动 WebUI 触发自动检查。运行python webui.pywebui.py 中的check_pretrained_is_exist会核对当前版本所需的 GPT 权重、VITS 权重、chinese-roberta-wwm-ext-large和chinese-hubert-base四类文件是否存在缺失项会提示你下载。确认模型落盘位置。所有预训练模型统一存放在GPT_SoVITS/pretrained_models/目录下子目录结构与配置文件中的路径一一对应。跑一次试合成。在 WebUI 中用任意一段参考音频合成一句话能出声说明模型链路完整这一步能提前暴露路径与版本不匹配的问题。 版本怎么选六个版本对比先给结论日常标准合成选 v2情感表现优先选 v2Pro/v2ProPlus追求最新架构选 v4。各版本的核心文件如下表取自 tts_infer.yaml版本适用场景核心文件t2s vitsv1轻量部署、资源受限环境s1bert25hz-2kh-longer-epoch68e-step50232.ckpts2G488k.pthv2标准语音合成gsv-v2final-pretrained/s1bert25hz-5kh-longer-epoch12-step369668.ckpts2G2333k.pthv2Pro情感语音优化s1v3.ckptv2Pro/s2Gv2Pro.pthv2ProPlus增强专业版s1v3.ckptv2Pro/s2Gv2ProPlus.pthv3过渡版本s1v3.ckpts2Gv3.pthv4最新架构s1v3.ckptgsv-v4-pretrained/s2Gv4.pth其中t2s指文本转语义 token 的 GPT 部分权重vits指声码解码器VITS权重二者必须来自同一版本混装会直接报维度错误。各版本还共用两个基础模型chinese-roberta-wwm-ext-large文本理解和chinese-hubert-base语音特征提取。 部署路径自动与手动两种方式自动方式启动python webui.py时系统会检测缺失模型并触发下载进度输出在终端文件默认写入GPT_SoVITS/pretrained_models/。网络正常时这是最省事的路径。手动方式自动下载失败网络受限、代理问题时从官方渠道取得模型文件后手动放置。以 v4 为例先建目录再拷贝文件mkdir -p GPT_SoVITS/pretrained_models/gsv-v4-pretrained cp /path/to/s2Gv4.pth GPT_SoVITS/pretrained_models/gsv-v4-pretrained/注意文件名必须与配置文件中的vits_weights_path完全一致多一个后缀或换目录都会导致加载失败。其他版本同理按上表核对各自的子目录与文件名。⚙️ 关键配置项逐条讲解配置文件为GPT_SoVITS/configs/tts_infer.yaml每个版本块包含相同的六个字段逐项含义如下bert_base_path中文 RoBERTa 模型路径负责文本语义理解cnhuhbert_base_pathHuBERT 语音编码器路径负责提取参考音频特征t2s_weights_pathGPT 语义模型权重上表中的 t2s 文件vits_weights_pathVITS 声码解码器权重上表中的 vits 文件device运行设备取cpu或cudais_half半精度FP16开关仅 GPU 下有意义custom块是推理时的实际生效配置GPT_SoVITS/TTS_infer_pack/TTS.py 加载的就是它其余v1~v4块相当于预置模板切换版本时把对应块的内容复制进custom即可。 三步完成模型版本切换GPT-SoVITS 支持在配置里保留多个版本块切换只需三步打开GPT_SoVITS/configs/tts_infer.yaml确认目标版本如v4对应的模型文件已下载到位。把目标版本块的t2s_weights_path、vits_weights_path等字段复制覆盖到custom块或将custom.version改为目标版本。重启 WebUIpython webui.py使配置生效再做一次试合成验证。如果只需要更新某个版本的补丁权重直接覆盖对应文件即可例如 v4 解码器更新为wget -O GPT_SoVITS/pretrained_models/gsv-v4-pretrained/s2Gv4.pth 补丁文件地址 故障排查速查遇到报错时按表定位多数问题出在路径与精度设置两处症状可能原因处理方式FileNotFoundError配置路径与实际文件位置不匹配对照tts_infer.yaml中四个路径字段逐一核对目录名与文件名模型无法读取文件权限不足将模型文件设为755目录结构保持完整GPU 显存溢出误开了半精度或显存不足GPU 环境保持device: cudais_half: true显存紧张时改is_half: falseCPU 环境报错is_half未关闭CPU 下必须device: cpuis_half: false加载后维度报错t2s 与 vits 版本混装按上表把两个权重换回同一版本⚠️ 避坑建议修改tts_infer.yaml前先备份一份配置改坏是版本问题里占比最高的一类。v3/v4 模型要用 export_torch_script_v3v4.py 导出 TorchScript旧版本才用 v1 专用脚本混用会导出失败。下载完成后务必先做一次试合成不要等训练完才发现问题。资源受限环境直接用 v1 轻量版避免为 v4 模型硬扛显存。记录当前使用的版本与权重文件名排查问题时是最低成本的信息。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考