ChatTTS-ui 语音合成音色定制:10分钟拿到3种选音色方法

发布时间:2026/9/20 22:45:32
ChatTTS-ui 语音合成音色定制:10分钟拿到3种选音色方法 ChatTTS-ui 语音合成音色定制10分钟拿到3种选音色方法【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-uiChatTTS-ui 是一个本地文字转语音合成工具支持中英混排输入。本文按实际任务拆解四件事启动服务、用三种途径选音色、把自备音色文件放进项目、调节语气效果。照做一遍10 分钟内就能听到第一段定制语音。最快上手合成三条命令听到第一段语音先克隆仓库并装好依赖git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui cd ChatTTS-ui pip install -r requirements.txt python3 app.py首次启动会自动下载 ChatTTS 模型文件网络连不上 Hugging Face 时会自动切到国内魔搭镜像源。终端出现 Start 提示、浏览器自动打开后即可使用默认地址是http://127.0.0.1:9966在网页文本框输入一句话并点击合成。默认使用预置音色 2222稍等几秒就能听到第一段语音。这一步不需要任何额外配置先跑通流程。选音色的三种途径预置音色、自定义种子值、音色文件合成时你听到的声音由三种途径决定按场景任选其一途径操作方式适合场景预置音色voice填数字要一个稳定可复现的固定音色自定义种子值custom_voice填大于 0 的整数想当场生成一个新音色音色文件.csv 或 .pt 文件放入 speaker 目录要复用某个已确认的音色预置常用值有 2222、7869、6653、4099、5099任意其他数字也可以填。填了custom_voice后voice字段会被忽略系统以这个数字为随机种子决定音色随机性的整数生成音色并自动存成 speaker 目录下的{值}.csv下次填同一个值即可得到同一音色。注意同一种子值在不同机器上音调可能略有差异先试听确认可用再固定使用。音色文件放进项目版本不匹配时的格式转换步骤0.92 版本起支持 .csv 和 .pt 两种音色文件。把文件放进 speaker 目录 后重启程序它就会出现在音色下拉框里API 的voice参数也可以直接填文件名带或不带后缀都行。从魔搭等渠道下载的 .pt 文件默认文件名形如seed_XXXX_restored_emb.pt因为 0.96 版本后 ChatTTS 内核升级不能直接用了。需要先在项目根目录执行音色格式转换脚本 cover-pt.pypython cover-pt.py脚本会把 speaker 里所有以seed_开头、_emb.pt结尾的文件转成以_emb-covert.pt结尾的新文件原文件转换完成后可以删掉。之后在界面下拉框选这个新文件即可使用该音色。调节语气效果prompt 标签的三种写法prompt参数控制语音的细微效果写法是一串方括号标签常用的有三种[oral_X]口语感强弱X 越大越聊天腔[laugh_X]是否带笑X0 为无笑声[break_X]停顿时长X 越大停顿越明显标签直接拼接X 取非负整数。比如合成一句带停顿、偏口语的表达可以这样调用 APIimport requests res requests.post(http://127.0.0.1:9966/tts, data{ text: 欢迎收听本地语音合成教程, voice: 2222, prompt: [oral_2][break_4] }) print(res.json())返回的 JSON 里带 wav 文件路径和可下载网址。另外 temperature默认 0.3、top_p默认 0.7能调节合成的随机程度想更稳定就往低调。设备与显存门槛自动选 GPU 还是 CPU启动时程序会自动挑选计算设备也可以用.env文件里的device变量强制指定default优先找英伟达 GPU显存不足会自动退回 CPUREADME 中描述的门槛为显存低于 4G 强制 CPUcpu强制 CPU 推理mps使用 Apple 芯片的 GPUcuda强制使用英伟达 GPU没有 GPU 也能跑只是合成速度慢。有 4G 以上显存的英伟达卡时装好 CUDA 12.8 和 CUDA 版 torch启动即自动走 GPU 加速。遇到问题先查这里四个高频现象音色文件不在下拉框里—— 原因文件放错目录或扩展名不是 .csv/.pt。处理移到 speaker 目录后重启程序。下载的 .pt 音色报错或声音异常—— 原因0.96 内核升级后旧格式不兼容。处理先跑python cover-pt.py转换再用-covert.pt结尾的新文件。有英伟达显卡却仍走 CPU—— 原因装的是非 CUDA 版 torch。处理卸载后重装 CUDA 版且系统需已装 CUDA 12.8 工具包。同一种子值两台机器听感不同—— 原因随机音色受运行环境影响音调可能漂移。处理接受小差异或用 .csv/.pt 音色文件把声音固定下来。到这里选音色、换音色、调效果三条线就都通了。下一步建议挑一个顺耳的种子值试听两遍后存成文件之后直接当固定音色用。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考