如何用Concat文字转语音与声音克隆本地生成AI旁白:免费Kokoro音色完全教程

发布时间:2026/9/27 6:24:58
如何用Concat文字转语音与声音克隆本地生成AI旁白:免费Kokoro音色完全教程 如何用Concat文字转语音与声音克隆本地生成AI旁白免费Kokoro音色完全教程【免费下载链接】ConcatThe truly free, and open-source cross-platform CapCut replacement (supports MCPs).项目地址: https://gitcode.com/gh_mirrors/wo/ConcatConcat 是一款真正免费、开源的跨平台视频剪辑工具CapCut 替代方案内置本地运行的文字转语音TTS与声音克隆功能使用免费的 Kokoro 音色模型把旁白文字在电脑上直接合成为音频全程无需联网调用付费 API。本教程带你从零完成 Kokoro 音色下载、AI 旁白生成以及用几秒录音克隆任意声音。一、Concat 的本地语音能力到底强在哪Concat 的语音模块concat-speechcrate走的是「本地优先」路线包含两条能力文字转语音TTS输入文字本地合成 WAV 旁白直接落到项目时间轴语音转文字本地 Whisper 模型自动生成带时间轴的字幕。所有模型按需下载到应用数据目录tts-models/模型id/首次下载后会校验 SHA-256 指纹保证字节级完整。合成在本地 CPUmacOS 可选 CoreML 加速完成不上传任何录音和文字——对在意隐私的创作者非常友好。二、三大AI语音模型怎么选Concat 提供三套 TTS 引擎在「设置 › 语音」中下载模型定位体积特点Kokoro紧凑版 int8内置音色推荐约 132 MB英语中文28 位说话人速度快Kokoro全精度内置音色约 350 MB比特级完整权重音质差异极小Pocket TTS声音克隆约 98 MB用几秒录音克隆任意声音英语Chatterbox Turbo录音室级克隆约 1 GB最接近录音室音色支持[laugh]等表情标签仅桌面端新手建议先装Kokoro 紧凑版下载量只有全精度的三分之一绝大多数耳朵听不出差别需要克隆声音时再补装 Pocket TTS。三、一键下载Kokoro音色模型步骤打开设置 › 语音Settings › Speech会看到模型列表与各自体积说明点击 Kokorocompact的下载按钮进度条会显示下载与解压两个阶段.part分段下载 暂存解压中断也不会留下半成品下载源为 Concat 自建镜像镜像不可达时自动回退到上游双重保障macOS 用户可在同页开启加速开关CoreML引擎下次加载时生效。模型清单与校验值定义在 models/manifest.toml下载与合成引擎实现在 tts.rs。四、Kokoro文字转语音生成AI旁白的完整操作1. 打开文字转语音面板通过顶部菜单文件 › 文字转语音或素材托盘中的 Speak 工具。如果当前选中的是文字标题片段面板会自动填入该标题的文案否则从空白稿开始音频会落在播放头位置。2. 选择音色Kokoro 内置 28 位说话人命名自带口音与性别af_美国女性默认af_heart、am_美国男性bf_英国女性、bm_英国男性zf_中文女性如 zf_xiaoxiao、zm_中文男性如 zm_yunjian。面板里会显示「American · female」这样的人话标签上次选的音色会被记住。3. 调节语速与停顿Speed语速0.5× ~ 2.0×1.0 是该声音的自然语速Pauses句间停顿0 ~ 1默认 0.2 属「自然」调高读出来更像纪录片旁白。4. 点击「Generate speech」生成合成逐句报告进度可随时取消。完成后WAV 文件写入项目文件夹的audio/目录随项目一起保存、随项目一起删除自动进入素材箱的Generated › Speech分类自动作为片段插入时间轴——标题稿落在标题起点自由稿落在播放头。界面逻辑与交互细节可参考 speech.slint 与 speech.rs。五、声音克隆用10秒录音克隆任意声音Concat 的克隆不依赖云端原理很简单让模型「听」一段几秒的参考录音再用那个声音读你的文案参考窗口最多取 10 秒。使用 Pocket TTS 克隆的步骤先导入一段有清晰人声的片段到项目素材箱视频、音频均可打开文字转语音面板模型选Pocket TTS打开Use sample voice使用样例声音开关在波形列表里选中那段录音——列表按波形缩略图展示一眼挑出「干净的那条」用Voice from滑杆微调起点从这个人声出现的位置开始听调 QualityQuick / Balanced / Fine对应 3/5/8 步与语速后生成。特别实用的一点选中时间轴上的某个片段时面板会直接把它的录音作为默认样例——相当于用视频里主角自己的声音给新镜头配音。追求更高拟真度可以装Chatterbox Turbo它是三者中最接近录音室音色的引擎还支持在稿子里插入[laugh]、[chuckle]、[sigh]表情标签让旁白带笑意或叹息。代价是约 1 GB 体积和更长的等待时间。六、常见问题速查没有下载模型就点了生成面板会提示「Download a voice model in Settings › Speech first」去设置里装好即可Kokoro 和 Pocket 能一起用吗可以两者独立缓存、互不冲突但同一时间只跑一个合成任务防止两个任务争取消标志合成很慢优先选 int8 紧凑版macOS 上打开加速开关Pocket 的 Quality 选 Quick克隆出来的声音不像换起点滑杆找一个人声最清晰的片段避开背景音参考录音太安静峰值过低引擎会直接给出警告。七、相关文件导航语音引擎与模型管理src/crates/concat-speech/src/tts.rs语音面板交互逻辑src/crates/concat/src/panes/speech.rs模型清单与校验值models/manifest.toml语音合成数据接口docs/api/types.mdConcat 让「本地生成 AI 旁白」变成三件简单的事下个模型、选个音色、点下生成。所有音频都留在你的电脑里免费且开源。【免费下载链接】ConcatThe truly free, and open-source cross-platform CapCut replacement (supports MCPs).项目地址: https://gitcode.com/gh_mirrors/wo/Concat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考