GSVI 使用指南:3 步把 GPT-SoVITS 部署成文本转语音推理服务

发布时间:2026/8/21 22:45:19
GSVI 使用指南:3 步把 GPT-SoVITS 部署成文本转语音推理服务 GSVI 使用指南3 步把 GPT-SoVITS 部署成文本转语音推理服务【免费下载链接】GPT-SoVITS-InferenceInference Specialization项目地址: https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-InferenceGSVIGPT-SoVITS Inference Plugin是一个只做推理的文本转语音TTS项目它基于 GPT-SoVITS 封装出带网页界面和 HTTP API 的语音合成服务把角色模型文件夹放进trained目录就能让指定角色说出任意文字。全程不涉及训练也不需要改代码。GSVI 是什么GSVI 是在 GPT-SoVITS 的fast_inference_分支上做的推理特化版本整合了社区贡献的推理优化代码并引入独立的 Inference 子项目作为主模块。它提供两种使用方式开箱即用的 Gradio 合成界面app.py以及 FastAPI 后端服务pure_api.py两者默认一起启动也可以只跑后端。项目的目标很直接把 GPT-SoVITS 的使用过程做简单让训练好的角色模型更容易在用户之间分享。适合哪些人和哪些场景适合拿到别人分享的 GPT-SoVITS 角色模型ckpt/pth 参考音频想快速跑起来的用户想在自己的应用里接入本地 TTS 的开发者例如 SillyTavern、游戏、虚拟助手、教育工具需要按情感、语速、语言等维度控制合成效果的二次开发者不适合想训练新音色的人。项目明确不推荐用于训练正确做法是在 GPT-SoVITS 原版完成训练再用 GSVI 做推理需要在 macOS 上用 GPU 训练模型的人。macOS 分支仅做 CPU 推理且 Mac GPU 训练出的模型质量明显偏低 核心能力能做什么能按角色和情感生成语音每个trained下的角色文件夹就是一个可合成角色一个角色可以绑定多种情感每种情感对应一条参考音频。请求时指定character和emotion参数即可情感不合法时自动回退到该角色的默认情感。情感绑定通过模型管理界面完成webuis/character_manager/webui.py或 Windows 下双击10 启动模型管理界面可选.bat。能合成中、英、日及混合语言文本text_language参数支持auto / zh / en / ja默认按多语言混合处理中文数字读法、中英标点切分等问题已做专门修复。能精细调节合成效果合成参数包括语速speed默认 1.0、GPT 采样参数top_k / top_p / temperature不熟悉可不动、并行批次数batch_size、输出格式formatWAV / MP3 / OGG、逐句流式返回stream以及请求结果缓存save_temp开启后相同请求直接复用已生成的音频。设备与半精度在 gsv_config.json 中配置服务端口、语言、是否启用 API 在 common_config.json 中配置。能作为 HTTP 服务接入第三方应用后端默认监听 5000 端口提供两个接口GET /character_list返回角色及情感列表JSONGET/POST /tts提交文本返回音频。已开启 CORS支持别名系统2.2.4 起可用别名见 Synthesizers/gsv_fast/configs/params_config.json。完整参数说明见 api_doc.md。能让角色模型即放即用角色模型文件夹遵循固定结构.ckpt/.pth模型文件与命名好的参考音频放在同一目录即可trained └── hutao ├── hutao-e75.ckpt ├── hutao_e60_s3360.pth └── hutao said something.wav拿到别人分享的整个文件夹放进trained就能用这是 GSVI 存在的核心价值之一。快速上手GPT-SoVITS 推理环境怎么装先获取代码git clone https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-InferenceWindows 怎么装最省事的方式是下载官方预打包版本prezip解压后把角色模型放进trained双击GPT-soVITS Start.exe或直接运行 0 一键启动脚本/ 目录下的3 启动GSVI.bat。手动安装则执行pip install -r requirements.txt后按目录内 bat 文件操作bat 0/1 用于更新依赖bat 5 启动纯后端bat 10 启动模型管理界面。Linux 怎么装conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.shmacOS 怎么装先装 FFmpegbrew install ffmpeg再执行pip install -r requirements.txt并初始化 git 子模块。注意 macOS 下走 CPU 推理且依赖要求 Python 低于 3.11numba0.56.4 的限制。模型放哪里预训练模型从 GPT-SoVITS 官方模型仓库Hugging Face 的 lj1995/GPT-SoVITS下载放入GPT_SoVITS/pretrained_models角色模型放入trained结构见上文用 Docker 部署仓库自带 Dockerfile构建前需移除requirements.txt中的pyaudio并预置输出目录、日志目录、预训练模型、trained角色目录与 nltk 数据等挂载卷。已测试通过的环境Python 3.9 PyTorch 2.0.1 CUDA 11Python 3.10.13 PyTorch 2.1.2 CUDA 12.3Python 3.9 macOS 14.3Apple 芯片CPU。启动成功后浏览器打开http://127.0.0.1:5000/即为合成界面访问http://127.0.0.1:5000/tts?text你好会直接返回一段音频。❓ 常见疑问需要在 GSVI 里训练模型吗不需要。GSVI 不推荐训练它包含训练界面入口但版本偏高、可能出现兼容问题且默认不附带降噪等训练辅助模型。正确流程是用 GPT-SoVITS 原版训练 → 把产出的 ckpt、pth 和参考音频放进 GSVI 的trained→ 用 GSVI 推理和分发。支持哪些操作系统Windows 10、Linux 和 macOSApple 芯片CPU 推理均有测试环境记录另提供 Docker 部署方式。界面语言支持中文、英文、日文等多语种见 i18n/locale/。如何接入 SillyTavern 等应用启动 GSVI 后把http://你的地址:5000作为 TTS 服务地址用 GET 或 POST 调用/ttscharacter传角色文件夹名即可。注意角色名区分大小写、全角/半角和语言拼写调用前可先请求/character_list确认可用角色与情感。角色或情感不生效怎么排查依次检查角色文件夹名与请求参数是否完全一致大小写、全半角trained中是否同时存在模型文件和参考音频预训练模型是否已放入GPT_SoVITS/pretrained_models情感是否在/character_list返回的列表中不在则回退默认情感。问题仍未解决时按 0 一键启动脚本/说明.txt 的建议先执行 999-0-1 更新流程或加入项目 QQ 群863760614和 DiscordAI Hub求助。下一步克隆仓库、安装依赖把预训练模型和角色模型放入对应目录双击3 启动GSVI.batLinux/macOS 直接运行 app.py打开http://127.0.0.1:5000/完成第一次合成随后按 api_doc.md 把/tts接口接进你的目标应用。更多中文说明见 docs/cn/README.md。【免费下载链接】GPT-SoVITS-InferenceInference Specialization项目地址: https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-Inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考