
ClearerVoice-Studio 上手全攻略3步跑通语音增强、语音分离与音质修复【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio周五深夜你把一盘老磁带转出来的音频拖进播放器访谈嘉宾的声音被电流声、风扇嗡嗡声和翻纸声裹得严严实实十年前的录音又闷又糊。如果你也经历过录音能听但听不清的尴尬那么 ClearerVoice-Studio 就是为你准备的。这个开源的 AI 语音处理工具包主打语音增强去噪、语音分离、语音超分辨率与目标说话人提取预训练模型开箱即用几行代码就能把听不清变成听得清。30秒速览这个工具包到底能做什么判断维度结论项目定位开源 AI 语音处理工具包内置 SOTA 预训练模型核心能力语音增强、语音分离、语音超分辨率、音视频目标说话人提取上手成本纯 WAV 场景一条 pip 命令无需自己训练模型适合人群内容创作者、普通用户、研究者与开发者附带组件Train 训练框架 SpeechScore 语音质量评估工具包整个仓库由三部分组成clearvoice统一推理入口、train训练与微调脚本、speechscore16 种质量评估指标。其中 FRCRN 去噪模型在 ModelScope 上已被调用超过 300 万次属于久经考验的成熟方案。第一步最省事的环境配置方法只用 WAV 文件的用户一行命令搞定pip install clearvoice需要源码安装或参与开发时克隆仓库后以可编辑模式安装git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable .关键提醒如果输入的是 MP3、AAC、FLAC、OGG 等非 WAV 格式请先安装 FFmpegUbuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 下载静态版并配置 PATH。只处理.wav则无需安装。第二步3行代码跑通第一次语音增强新建任意 Python 文件粘贴下面这段带中文注释的最小示例from clearvoice import ClearVoice # 创建语音增强处理器选用全频带 48kHz 模型 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 处理单个音频文件返回波形而不落盘 output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) # 把结果写回本地文件 myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav)第一次运行时模型会自动从 HuggingFace 下载到./clearvoice/checkpoints目录之后可离线使用。前后对比一听便知背景噪音被擦掉、人声更靠前——相当于给声音做了一次磨皮。第三步按真实场景选择任务与模型这套工具不是一套代码只干一件事而是按需求给了四套能力外加一套打分工具。场景一给嘈杂录音降噪三个模型怎么选模型采样率适用特点FRCRN_SE_16K16kHz轻量快速适合实时或大批量去噪MossFormerGAN_SE_16K16kHz效果与速度均衡评测中 PESQ 最高3.47MossFormer2_SE_48K48kHz全频带处理高音质场景首选场景二把多人对话拆成单个人声会议录音、访谈素材里两人同时说话时用语音分离任务myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_pathsamples/input_ss.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_separated.wav)写入后会自动生成output_separated_s1.wav和output_separated_s2.wav两个文件。该模型在 WSJ0-2Mix、WHAM! 等公开基准上的 SI-SNRi 指标均处第一梯队如 WSJ0-2Mix 达 22.0 dB。场景三把闷糊的老录音修到 48kHz语音超分辨率带宽扩展能把 16kHz/24kHz/32kHz 的低分辨率音频提升到 48kHz适合修复年代久远的素材myClearVoice ClearVoice(taskspeech_super_resolution, model_names[MossFormer2_SR_48K])官方推荐的流程是先用MossFormer2_SE_48K去噪、再用MossFormer2_SR_48K升采样评测显示该组合能把 16kHz 输入的 Log-Spectral Distance 从 2.80 压低到 1.93PESQ 从 1.97 提升到 3.15。场景四从视频里认人提取目标说话人当手里是一段有画面的视频只想保留画面中某个人的声音时myClearVoice ClearVoice(tasktarget_speaker_extraction, model_names[AV_MossFormer2_TSE_16K]) myClearVoice(input_pathsamples/path_to_input_videos_tse, online_writeTrue, output_pathsamples/path_to_output_videos_tse)模型通过视频中的唇部/人脸信息锁定目标说话人支持 AVI、MP4、MOV、WEBM 等视频格式。场景五效果好不好让客观分数说话听起来不错不够严谨时用 SpeechScore 打分from speechscore import SpeechScore mySpeechScore SpeechScore([PESQ, STOI, SISDR, DNSMOS]) scores mySpeechScore(test_pathaudios/noisy.wav, reference_pathaudios/clean.wav, windowNone, score_rate16000, return_meanFalse)其中 DNSMOS、NISQA、DISTILL_MOS、SRMR 属于非侵入式指标不需要干净参考音频直接传reference_pathNone即可。全部 16 种指标PESQ、STOI、SI-SDR、SNR、LLR、LSD、MCD 等支持任意子集组合与目录批量打分。新手最常踩的4个坑非 WAV 格式报错就怀疑是代码 Bug——其实缺的是 FFmpeg装上即解。忽略首次模型下载——第一次运行偏慢属正常现象若自动下载失败可从 ModelScope 手动下载权重放入./clearvoice/checkpoints。批量处理时忘了开关——online_writeFalse只在处理单文件时返回波形处理目录或.scp列表文件时务必用online_writeTrue并指定output_path。给超分辨率喂过低的采样率——MossFormer2_SR_48K要求输入有效采样率至少 16kHz低于该值请先重采样或直接走增强流程。进阶锦囊给开发者的三种扩展玩法Numpy 直通接口demo_Numpy2Numpy.py演示了输入、输出均为 NumPy 数组的调用方式方便把 ClearVoice 嵌进训练或推理管线省去磁盘 IO。模型微调与重训train/目录提供语音增强16k/48k、语音分离8k/16k、超分辨率48k及目标说话人提取的训练脚本train/data_generation/speech_enhancement还自带加噪、加混响数据生成脚本。官方建议用 conda 创建 Python 3.8 环境后执行pip install -r requirements.txt。统一的评测闭环用 SpeechScore 给处理结果批量打分return_meanTrue可输出均值形成处理→评估→调参的完整闭环。30分钟行动清单与常见问题上手清单执行pip install clearvoice或源码安装并装好 FFmpeg跑通demo.py与demo_with_more_comments.py把各任务开关逐个打开体验用samples/目录下的示例音频测试增强与分离效果用 SpeechScore 给自己的结果打一次分形成量化认知FAQ问完全没有编程基础能用吗能。安装后只需改改示例里的文件路径即可官方演示脚本每个用例都带有开关逐行注释。问没有 GPU 能跑吗可以。CPU 能跑通全部推理流程只是速度较慢有 GPU 会明显加快建议推理任务优先分配 GPU。问支持哪些音频格式WAV 原生支持MP3、AAC、FLAC、OGG、OPUS、WMA、M4A、AIFF 等格式需 FFmpeg 支持同时支持单双声道与 16/32 位精度。问只想快速提升音质先学哪个任务语音增强是性价比最高的入口追求高音质选MossFormer2_SE_48K追求速度选FRCRN_SE_16K先跑通一个场景再横向扩展。ClearerVoice-Studio 的价值在于把前沿模型封装成了普通人都能驾驭的工具。从今晚这条老录音开始去跑通你的第一个语音增强脚本吧。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考