faster-whisper 完整指南:语音转文字提速 4 倍,三分钟上手

发布时间:2026/9/5 15:26:30
faster-whisper 完整指南:语音转文字提速 4 倍,三分钟上手 faster-whisper 完整指南语音转文字提速 4 倍三分钟上手【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper一段一小时的会议录音用原版 Whisper 转录可能要等上十几分钟而 faster-whisper 往往几分钟就能给出同样准确的结果。faster-whisper 是基于 CTranslate2一个专门加速 Transformer 模型推理的引擎重写的 OpenAI Whisper 语音识别库它解决的核心问题只有一个让语音转文字这件事跑得更快、更省内存。全文按先看数据 → 装起来 → 跑通 → 进阶的顺序展开零基础也能照着做。先看数据快多少省多少官方在 NVIDIA RTX 3070 Ti 上对 large-v2 模型测了一组对比数据转录 13 分钟音频实现方式计算精度耗时显存占用openai/whisperfp162 分 23 秒4708 MBfaster-whisperfp161 分 03 秒4525 MBfaster-whisperbatch_size8fp1617 秒6090 MBfaster-whisperint8 量化int859 秒2926 MB几个值得注意的点官方宣称最快可达原版 4 倍速精度基本不变int8 量化一种把模型权重压缩到 8 位整数、以牺牲极少精度换内存的手段在 CPU 和 GPU 上都能用显存直接从 4.5 GB 降到 2.9 GB批量推理BatchedInferencePipeline把多条音频片段拼在一起送进模型能再快一截。没有 GPU 也没关系在 i7-12700K 的 CPU 上跑 small 模型int8 模式下 13 分钟音频约 1 分 42 秒。三步装好一条命令的事环境要求很简单Python 3.9 及以上。pip install faster-whisper和原版 openai-whisper 最大的区别之一它不需要你单独安装 FFmpeg。音频解码交给 PyAV 库完成而 PyAV 已经把 FFmpeg 的底层库打包好了——少装的这一步正是很多人卡在ffmpeg not found报错上的原因。想装最新的开发版克隆仓库后执行pip install --force-reinstall faster-whisper https://gitcode.com/GitHub_Trending/fa/faster-whisper/archive/refs/heads/master.tar.gz即可。GPU 加速最小配置长这样默认情况下模型跑在 CPU 上。想用上 CUDA 加速需要补两块 NVIDIA 库——cuBLAS矩阵运算加速和 cuDNN深度学习算子库pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*⚠️版本搭配是关键坑点对照你的环境选你的环境做法CUDA 12 cuDNN 9装最新 ctranslate2直接用CUDA 12 cuDNN 8pip install --force-reinstall ctranslate24.4.0CUDA 11 cuDNN 8降级到ctranslate23.24.0另外Linux 下用 pip 装上述 NVIDIA 库后启动 Python 前要先设置LD_LIBRARY_PATH否则会找不到库文件Windows 用户则可以把库文件放进 PATH 里的任意目录。跑通第一段转录安装完成后最简用法就是下面这几行from faster_whisper import WhisperModel model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) print(检测到的语言:, info.language, info.language_probability) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})两个新手必踩的坑先说清楚segments是生成器。拿到它的那一刻模型还没开始干活只有真正遍历for 循环或list(segments)时才会触发转录。看到卡住没反应基本是这个原因。模型是按需下载的。代码里写的base、large-v3、turbo都只是代号首次加载时对应权重会自动从 Hugging Face Hub 拉取之后走本地缓存。有 GPU 时把devicecuda搭配compute_typefloat16或int8_float16即可参数都在 faster_whisper/transcribe.py 的WhisperModel类里能看到完整列表。进阶玩法批量、逐字时间戳、静音过滤批量推理——长音频的提速利器。BatchedInferencePipeline可以直接替换WhisperModel.transcribe传入batch_size参数from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) batched BatchedInferencePipeline(modelmodel) segments, info batched.transcribe(audio.mp3, batch_size16)按官方基准同样条件下 fp16 下 1 分 03 秒的任务批量模式只要 17 秒。逐字时间戳——加一个word_timestampsTrue参数就能拿到每个单词的起止时间做字幕、逐句校对都会用到。VAD 静音过滤——加vad_filterTrue内置的 Silero VADVoice Activity Detection语音活动检测会先把纯静音段剪掉再转录。默认策略比较保守只去掉超过 2 秒的静音想更激进可通过vad_parametersdict(min_silence_duration_ms500)调整参数定义在 faster_whisper/vad.py。批量模式下 VAD 是默认开启的。蒸馏模型——distil-large-v3这类蒸馏版检查点同样兼容加载时指定languageen并关闭condition_on_previous_text速度和精度都能再上一档。项目地图代码都在哪儿仓库结构很小主要看这几个地方faster_whisper/transcribe.py——核心WhisperModel和BatchedInferencePipeline所有转录参数都在这里定义faster_whisper/vad.py——Silero VAD 静音过滤逻辑faster_whisper/audio.py——基于 PyAV 的音频加载与解码faster_whisper/tokenizer.py——多语言分词器封装benchmark/——官方速度/内存/WER 基准脚本想复现对比数据可以翻这里的实现tests/——用 pytest 跑的测试集docker/Dockerfile——官方给出的 GPU 环境容器示例配 CUDA 环境时可以直接参考。如果你有自己微调过的 Transformers 格式 Whisper 模型仓库还提供了转换工具ct2-transformers-converter能把它们转成 CTranslate2 格式可加--quantization float16之类参数转换后直接WhisperModel(本地目录)加载即可详见 requirements.conversion.txt 列出的转换依赖。适合谁、下一步做什么faster-whisper 当前的版本是 1.2.1采用 MIT 许可证适合三类人需要批量处理音频的开发者、没有独显但想本地跑语音识别的用户int8 CPU 模式够用、以及已有 Whisper 应用想直接换引擎提速的团队。如果你的需求还涉及说话人分离、实时流式转录可以基于它再叠一层应用逻辑。下一步建议先用base模型 CPU int8 跑通自己的音频确认流程没问题后再按需上 GPU 或批量模式。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考