GPT-SoVITS v4:1分钟录音微调专属音色,5秒零样本克隆,输出48kHz无金属音

发布时间:2026/8/30 20:35:15
GPT-SoVITS v4:1分钟录音微调专属音色,5秒零样本克隆,输出48kHz无金属音 GPT-SoVITS v41分钟录音微调专属音色5秒零样本克隆输出48kHz无金属音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个用极少录音就能让 AI 开口说话的开源语音合成工具WebUI 形式不用写代码。上传 5 秒人声样本几秒后它就能用这个声音念任意文字用 1 分钟素材微调音色更像本人。这也是声音克隆 TTS里上手最快的一条路。⚡ 30 秒先跑起来克隆仓库git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS安装依赖并自动下载全部预训练模型--device按你的环境选CU126|CU128|CPU|MPS--source选模型下载源cd GPT-SoVITS bash install.sh --device CU128 --source ModelScope启动 WebUIpython webui.py浏览器打开后你会看到分 Tab 的主界面1A 语音切分、1B 文本获取、1C 推理都在里面切分、降噪、ASR 标注、训练、合成一条流水线点完即可各步细节后面章节展开。 它到底好在哪5 秒参考音频零样本克隆出声不用训练直接上传 5 秒人声作为参考音频输入文字就能得到这个音色朗读的音频。场景很直接手头只有人物一小段采访录音想让他说一段新文案不用等他进录音棚。1 分钟数据微调音色相似度再上一个台阶WebUI 内置的流水线把从一段长音频到可训练数据集拆成了切分、降噪、ASR 转写、校对几个按钮长录音丢进去自动切片ASR 自动打好字幕改完错字就能开始微调1 分钟干净素材通常就够用。v3/v4 的音色更贴近你上传的参考音频而不是训练集里所有声音的平均值。v4 修复金属音原生 48kHz 输出v3 曾因非整数倍上采样出现金属噪音v4 修复了这个问题并直接输出 48kHz 音频v3 原生只输出 24kHz。不用它的话你可能要自己叠一层超分才敢把成品发到平台上用 v4导出即可用。 按场景选版本版本适合特点v1 / v2 / v2Pro训练集音质平平对低质量素材更宽容硬件成本与速度接近 v2v2ProPlus追求速度官方实测 4090 上 RTF 约 0.0141400 词约 4 分钟音频只需 3.4 秒推理v3 / v4素材干净、追求音色还原音色更贴近参考音频情感更丰富v4 原生 48kHz大多数人选 v4素材够干净时音色最像本人、没有金属音如果素材是手机录的、底噪大就退回 v1/v2 系列README 里明确说这类训练集 v3/v4 发挥不出来。各版本的模型路径与推理参数统一放在 tts_infer.yaml改路径、切版本都在这里。 进阶往深了看inference_webui.py——合成界面怎么调参数、批量推理在哪里开看它GPT_SoVITS/text/——中文、英文、日文、韩文、粤语文本前端的处理逻辑为什么这个词读错可以来这里找答案docs/cn/Changelog_CN.md——各版本改了什么、踩过的坑升级前翻一遍GPT_SoVITS/prepare_datasets/——训练集从文本对齐到语义特征提取的完整脚本看懂数据怎么进模型 适合谁来用播客主自己的干声丢进去直接出一版带情绪的旁白成片游戏/动画配音1 分钟录音让角色用目标声线念完整台词有声书作者批量生成章节音频v2ProPlus 速度够快开发者仓库提供 api.py 和 api_v2.py把合成能力挂到自己的产品里想学 TTS 的人数据集制作、GPT 训练、SoVITS 训练全链路都开源可跑照着 WebUI 走一遍就知道 TTS 模型吃什么数据5 秒录音换一段新文案的念白1 分钟素材换一个专属音色——去把仓库拉下来30 秒先让界面跑起来。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考