GPT-SoVITS 实战指南:用 5 秒声音样本完成第一次声音克隆与语音合成

发布时间:2026/8/30 20:51:21
GPT-SoVITS 实战指南:用 5 秒声音样本完成第一次声音克隆与语音合成 GPT-SoVITS 实战指南用 5 秒声音样本完成第一次声音克隆与语音合成【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS如果你只有一段几分钟的录音却想让程序用它说出任意文字GPT-SoVITS 是少数能直接落地的开源方案喂入 5 秒声音样本即可零样本语音合成投入约 1 分钟训练数据则能做少样本微调声音相似度更高。它支持中文、英文、日语、韩语、粤语五种语言的多语言语音合成推理界面、数据切分、降噪、自动标注ASR都整合在一个 WebUI 里。本文按能干什么 → 怎么跑起来 → 怎么喂数据 → 怎么验收 → 怎么排错的顺序讲清楚整个流程适合第一次接触 GPT-SoVITS 的新手。GPT-SoVITS 适合哪些实际场景不谈概念先看四件它确实能做的事给应用加一个专属音色不需要从头训模型拿目标说话人的 5 秒清音当参考直接合成新句子。适合原型验证、演示 Demo验证这个音色在我的内容里是否合适。少样本声音克隆当 5 秒零样本的音色不够像时用 1 分钟左右的干净录音微调得到更稳定、更像本人的效果这是它和纯零样本 TTS 工具的核心区别。多语言内容制作同一个模型可以合成与训练数据不同语言的文本跨语言推理做中英日韩粤多版本内容时不用为每种语言单独找模型。有声书、播客的配音生产仓库内置了 UVR5 人声/伴奏分离、音频自动切片、多语种 ASR 自动转写和文本校对工具入口在tools/uvr5/和tools/asr/一条流水线把原始长音频变成可标注的训练集。判断标准很简单你的需求如果是用某个人的音色说一段新文本而不是换歌声的音调那么 GPT-SoVITS 就是对的选型。最小可用流程从装环境到听出第一句合成音这一节就是完整的 GPT-SoVITS 安装教程主线跟着做完你应该能听到第一句合成结果。先准备什么Python 环境与依赖官方测试环境以 Python 3.10 为主也验证过 3.9/3.11NVIDIA 显卡对应 CUDA 12.6/12.8 的 PyTorch另支持 ROCm、Apple SiliconMPS和纯 CPU。先克隆代码git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS然后建一个干净的 conda 环境并运行安装脚本。脚本会按你指定的设备和模型源自动装依赖、下载预训练模型比手动pip install省很多事conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF--device填你的设备NVIDIA 显卡用CU126或CU128AMD 用ROCMMac 用MPS无显卡用CPU--source填模型下载渠道HF、HF-Mirror或ModelScope可选--download-uvr5顺带下载人声分离模型Windows 用户可以跳过命令行项目提供预编译整合包解压后双击go-webui.bat即可启动整个 WebUI只想打开推理界面则用go-webui-v2.bat。运行后应看到什么脚本结束时提示成功终端输出[SUCCESS]一类字样并且GPT_SoVITS/pretrained_models目录里已有模型文件。如果 install.sh 中途报错绝大多数情况是网络源不通换一个--source再跑一次而不是重装。第一次运行怎么验证在项目根目录启动总入口python webui.py启动后浏览器会自动打开 WebUI页面顶部是按编号排列的功能区0-前置数据集处理工具、1-GPT-SoVITS-TTS含1A-训练集格式化管理、1B-GPT微调训练、1C-推理、2-SoVITS训练/推理。第一次打开不必点进去操作确认各 Tab 能正常加载、没有模块缺失报错就说明环境通了。如果只想跑推理也可以直接执行python GPT_SoVITS/inference_webui.py单独打开推理界面。第一次推理5 秒参考音频出第一句进入1-GPT-SoVITS-TTS / 1C-推理Tab这是最轻量的起点不需要任何训练上传一段约 5 秒的参考音频尽量干净、无人声叠混、音量稳定输入要合成的文本并选对文本语言点合成等待生成后试听你应该看到什么一条带播放器的音频结果。第一遍重点听三件事——音色是否接近参考人、有没有漏字或多读重复、吞字、整句语速是否自然。零样本模式对参考音频质量比较敏感第一句像得像取决于你那段 5 秒录音本身。模型放哪里、数据标注怎么写这一节覆盖 GPT-SoVITS 数据准备的完整要求做训练集之前先看这里。预训练模型目录清单如果 install.sh 完整跑完以下目录都已就位无需手动处理手动安装或换版本v2/v3/v4/v2Pro时按此核对内容放置位置说明GPT/SoVITS 预训练权重GPT_SoVITS/pretrained_models/推理和训练的基础模型不同版本如 s1v3.ckpt、s2v4.pth按版本放入G2PW 多音字模型GPT_SoVITS/text/下命名为G2PWModel仅中文合成需要解压后必须改名为G2PWModelUVR5 人声分离权重tools/uvr5/uvr5_weights/处理带 BGM 的音频才需要ASR 模型tools/asr/models/多数模型首次使用时自动下载离线环境可预置到该目录标注文件的数据格式训练集标注用.list文本文件每行一条四列之间用竖线分隔音频路径|说话人名称|语言|文本内容其中语言字段有固定取值zh中文、ja日语、en英文、ko韩语、yue粤语。一行示例D:\GPT-SoVITS\xxx/xxx.wav|xxx|en|I like playing Genshin.两点新手最容易踩的坑文本必须和音频内容严格一致。后续合成质量直接受标注错误影响ASR 转写后一定要人工校对一遍。长音频先切段。WebUI 的0-前置数据集处理工具提供切分、降噪、ASR、标校正的一体化流程填音频路径 → 切片 → 可选降噪 → ASR → 校对做完再去训练 Tab。微调训练进阶选项不是必需项零样本跑通之后如果想提升音色相似度再进入微调环节。训练入口对应GPT_SoVITS/s1_train.pyGPT 部分和GPT_SoVITS/s2_train.pySoVITS 部分WebUI 里对应1B-GPT微调训练和2-SoVITS训练两个 Tab按顺序完成即可。官方经验值约 1 分钟的干净录音就足以让相似度有可感知的提升数据更干净背景杂音少、单说话人比数据更长更重要。多 GPU 可分布式训练单卡新手按默认配置跑完第一轮再说。怎么判断一次合成结果是否可用拿到音频后建议按下面四条快速验收比感觉好不好听更可操作音色相似度和参考音频并排听重点比声线和气息。v3/v4 系列的特点是合成结果更贴近参考音频本身如果参考音有背景音乐或混响结果会带着同样的脏。稳定性长文本里有没有重复句、吞字、突然变调。这是 GPT 生成环节的老毛病换个参考音或调整推理参数往往比调训练更有效。速度官方给出的 v2 ProPlus 参考值——4060 Ti 上 RTF 约 0.028、4090 上约 0.0141400 词约 4 分钟的文本推理耗时 3.36 秒CPUM4上约 0.526。RTF 小于 1 表示快于实时生产用途一般够用。清晰度与底噪v4 起原生输出 48k 音频听感上不应再发闷如果你听到明显金属感或高频异常先确认用的是与代码匹配的预训练模型版本再考虑换参考音。新手最容易卡住的几个问题以下是 GPT-SoVITS 常见问题里值得记下的几条按出现频率排序装依赖卡住或失败先确认 conda 环境是 Python 3.10再换--sourceHF 与 ModelScope 之间切换重跑 install.shWindows 手动安装时还要把 ffmpeg 可执行文件放到项目根目录手动安装的 Linux 环境则需自行安装 ffmpegconda install ffmpeg或sudo apt install ffmpeg切分和音频处理都依赖它。中文合成多音字不准检查GPT_SoVITS/text/下是否存在名为G2PWModel的目录。G2PW 是中文专用组件缺了它中文前端会退化为普通拼音规则。参考音频有音乐或噪声先用0-前置数据集处理工具里的 UVR5 分离出人声再当参考音这一步对零样本效果的影响比调任何参数都大。显存吃紧给运行环境开启半精度fp16即is_half相关选项设为 true显存占用会明显下降前提是 GPU 支持。Mac 用户官方说明 Mac GPU 上训练的模型效果显著偏低所以训练建议走 CPU 路径这也是--device MPS/CPU的默认推荐。更完整的操作细节中文文档入口在 docs/cn/README.md同目录下还有英文docs/en/Changelog_EN.md、日文、韩文、土耳其文的说明文件需要逐版本对比特性时查对应的 Changelog 即可。跑通第一次零样本合成之后下一步的路线很固定换更干净的参考音再听一遍 → 不满意就上 1 分钟微调 → 效果确认后考虑接入 API仓库提供了api.py与api_v2.py两个接口入口做批量合成。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考