OpenVoice 语音克隆本地部署完整指南:3秒音频秒变你的专属 TTS

发布时间:2026/9/1 9:18:05
OpenVoice 语音克隆本地部署完整指南:3秒音频秒变你的专属 TTS OpenVoice 语音克隆本地部署完整指南3秒音频秒变你的专属 TTS【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice你手上有几秒的人声录音想让这段声音念出任意文字还能切换情绪、调整语速甚至跨语言朗读OpenVoice 就是干这个的。这篇指南带你从拉仓库到听到第一段合成语音再把最常见的坑提前标出来省去反复折腾的时间。环境准备先对一遍这份清单OpenVoice 官方只支持 Linux 环境如果你用 Windows 或 macOS可以参考 docs/USAGE.md 末尾社区贡献的安装方式。检查项要求备注操作系统Linux官方安装流程仅针对 LinuxPython 版本3.9用 conda 隔离别用系统自带的PyTorch自行安装GPU 环境需匹配 CUDA 版本磁盘空间约 2 GB主要是模型权重文件依赖全部锁定在 requirements.txt 里pip install -e .会一次装齐包括librosa0.9.1、faster-whisper0.9.0、gradio3.48.0等。最短路径先听到第一段合成语音下面这几条命令跑完你就能在终端里听到 OpenVoice 生成的声音了。# 创建独立环境Python 版本必须 3.9 conda create -n openvoice python3.9 -y conda activate openvoice # 克隆仓库并安装 git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .模型权重不随仓库分发需要单独下载V1 的 checkpoint 压缩包解压到项目根目录下的checkpoints/文件夹V2 解压到checkpoints_v2/下载地址见 docs/USAGE.md 对应章节。核心代码就四步直接照抄import torch from openvoice import se_extractor from openvoice.api import BaseSpeakerTTS, ToneColorConverter device cuda:0 if torch.cuda.is_available() else cpu # 1. 加载基础 TTS 和音色转换器 base_tts BaseSpeakerTTS(checkpoints/base_speakers/EN/config.json, devicedevice) base_tts.load_ckpt(checkpoints/base_speakers/EN/checkpoint.pth) converter ToneColorConverter(checkpoints/converter/config.json, devicedevice) converter.load_ckpt(checkpoints/converter/checkpoint.pth) # 2. 从参考音频提取音色向量 target_se, _ se_extractor.get_se(resources/example_reference.mp3, converter, target_dirprocessed, vadTrue)再调用base_tts.tts()生成一段中间音频接着用converter.convert()把音色换成你的就完事了。原理上它把音色和风格拆开处理基础 TTS 负责说什么、怎么说转换器只负责用谁的声音说互不干扰。场景拆解三个高频用法换个情绪、换个语速基础 TTS 的speaker参数控制说话风格可选值有friendly、cheerful、excited、sad、angry、terrified、shouting、whispering。比如想生成一段耳语# speaker 换成 whisperingspeed 调低到 0.9 base_tts.tts(This audio is generated by OpenVoice., outputs/tmp.wav, speakerwhispering, languageEnglish, speed0.9)换完风格后别忘了重新加载对应的source_se文件如en_style_se.pth否则音色转换会对不上。完整示例在 demo_part1.ipynb 里每个风格都有对应代码块。中文 / 英文跨语言朗读基础 TTS 内置了EN和ZH两个语言标记直接传languageChinese即可切换。V2 版本则原生支持英语、西班牙语、法语、中文、日语、韩语六种语言开箱即用。跨语言克隆的参考音频和输出文本可以是不同语言不需要训练集里见过这种组合。具体写法看 demo_part2.ipynbV2 用法看 demo_part3.ipynb。不写代码直接开 Gradio 界面python -m openvoice_app --share浏览器打开本地地址就能上传参考音频、输入文字、点生成适合先快速验证效果再回头改参数。避坑指南踩过的坑都在这了现象原因怎么解决生成音频背景有杂音参考音频里有环境噪音、多人说话或大段静音换一段干净、单人、无长静音的录音参考 docs/QA.md 里的排查清单换参考音频后效果没变se_extractor按文件名缓存到processed/文件夹同名文件不会覆盖给每段参考音频起唯一文件名或手动删掉processed/目录安装时报 Silero VAD 下载失败机器无法访问 GitHubse_extractor.py里的 VAD 模型拉不下来手动下载对应 zip 包解压到~/.cache/torch/hub/下具体路径见 docs/QA.md音色对了但情感 / 口音不像参考人OpenVoice 只克隆音色不克隆情感和口音风格由基础 TTS 模型决定换用带目标情感的基础说话人模型或调整speaker参数参考音频太短 2 秒效果差音色向量提取信息不足用3 秒以上的清晰人声别追求越短越好进阶方向与更多资源官方使用文档docs/USAGE.md涵盖 V1/V2 安装、Gradio 启动、各语言 checkpoint 说明常见问题docs/QA.md质量排查、语言支持、安装报错都有风格控制示例demo_part1.ipynb每种情感风格都有可直接跑的代码跨语言克隆示例demo_part2.ipynbV2 多语言示例demo_part3.ipynb水印功能ToneColorConverter默认开启wavmark水印见 openvoice/api.py公开部署时建议保留避免语音被滥用许可协议V1 和 V2 均为MIT License商业使用免费【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考