whisper.cpp 新手指南:5 步跑通本地语音转文字,音频不用出设备

发布时间:2026/8/30 10:25:12
whisper.cpp 新手指南:5 步跑通本地语音转文字,音频不用出设备 whisper.cpp 新手指南5 步跑通本地语音转文字音频不用出设备【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp你有一分钟的客户电话录音希望立刻拿到文字版。用 whisper.cppOpenAI Whisper 模型的 C/C 移植版在自己电脑上跑一条命令音频就转成了带时间戳的文本——不用注册账号不用上传文件不占带宽。项目速览whisper.cpp 把 Whisper 语音识别模型搬进了纯 C/C 实现依赖为零推理基于自带的 ggml 张量库相比 Python 原版跑在 CPU 上也能保持接近实时的速度且运行时内存分配为零。维度Python 版 Whisperwhisper.cpp运行环境需 Python PyTorch 全家桶一个可执行文件部署服务/脚本命令行、可嵌入 Android/iOS/浏览器推理加速GPU 为主CPU 即可另支持 CUDA、Metal、Vulkan数据去向可本地完全本地离线首次接触建议直接用它自带的命令行工具whisper-cli源码在 examples/cli/。最短路径上手1. 环境要求任意主流系统Windows、macOS、Linux均可装好 CMake 3.18 和 C 编译器GCC 9 / Clang 10 / MSVC即可。仓库内置了 CMake 工程与 Makefile 两条构建路径无需手动安装第三方库。2. 获取源码git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp3. 下载模型模型是独立的二进制文件ggml 格式用仓库自带脚本拉取。新手推荐base.en仅英语142 MiB或tiny75 MiB最快sh ./models/download-ggml-model.sh base.en不传参数运行该脚本会列出全部可下载模型含各档位的量化版本。4. 构建cmake -B build cmake --build build --config Release5. 首次运行仓库自带一段肯尼迪讲话的示例音频 samples/jfk.wav./build/bin/whisper-cli -m models/ggml-base.en.bin -f samples/jfk.wav看到终端打印出 And so my fellow Americans... 之类的带时间戳文字流程就跑通了。 想跳过构建步骤直接体验也可以直接执行make base.en它会下载模型并对 samples 目录下所有 wav 跑一遍推理。选型与调优模型怎么选核心权衡是精度 vs 内存/耗时磁盘占用与运行时内存直接来自项目 README 的实测数据模型磁盘内存占用适合谁tiny75 MiB~273 MB低配设备、快速验证base142 MiB~388 MB日常录音新手默认项small466 MiB~852 MB会议、长音频、要更高准确率medium1.5 GiB~2.1 GB专业转录需 8GB 内存large-v32.9 GiB~3.9 GB精度优先的离线批量任务带.en后缀的是英语专用模型同体积下英语识别效果通常优于多语言版中文等多语言场景请用无后缀版本并用-l zh指定语言。参数怎么调whisper-cli -h可查看全部选项高频的几个如下参数含义建议-l指定语言auto为自动检测知道语种就显式指定更稳-tp采样温度0~1默认 0识别乱码/重复时配合-tpi逐步升温-tr翻译为英语外语音频直接翻成英文-t线程数设为 CPU 物理核心数左右-of-osrt/-otxt/-oj输出文件路径与格式批量处理时落盘而不是看终端量化项目内置quantize工具可把模型压成整数版本如 q5_0内存和磁盘占用显著下降、精度损失很小./build/bin/quantize models/ggml-base.en.bin models/ggml-base.en-q5_0.bin q5_0也可以跳过转换直接用脚本下载已量化好的模型如base.en-q5_1。⚠️ 内存紧张的老设备上优先用量化版而非换更小的全精度模型。实战场景场景一给视频做字幕——多语言播客或讲座视频直接翻译成英文 SRT 字幕ffmpeg -i episode.mp3 -ar 16000 -ac 1 -c:a pcm_s16le episode.wav ./build/bin/whisper-cli -m models/ggml-small.bin -f episode.wav -tr -osrt -of episode工作流先用 ffmpeg 转成 16-bit WAVwhisper-cli 目前只吃这种格式再用-tr翻译成英文并输出episode.srt拖进视频播放器或剪辑软件即可。场景二会议录音转文字纪要——已知语种的录音指定语言 初始提示词./build/bin/whisper-cli -m models/ggml-small.bin -f meeting.wav -l zh \ --prompt 会议纪要涉及产品发布与技术评审工作流--prompt提供上下文能明显改善专有名词的识别跑完把结果复制进笔记工具稍作整理。场景三低配设备离线运行——树莓派、老笔记本或嵌入式设备用 tiny 量化模型sh ./models/download-ggml-model.sh tiny-q5_1 ./build/bin/whisper-cli -m models/ggml-tiny-q5_1.bin -f samples/jfk.wav工作流模型压到 75 MiB 以内内存占用约 273 MB 级别在无 GPU 的 ARM 设备上同样可跑通完整流程。排坑与自检现象原因处理报错无法读取音频或格式相关错误whisper-cli 目前仅支持 16-bit WAV先用ffmpeg -i in.mp3 -ar 16000 -ac 1 -c:a pcm_s16le out.wav转码failed to load model/ 模型无效模型文件不完整或路径写错重新运行sh ./models/download-ggml-model.sh model确认-m后是相对于当前目录的有效路径识别全是乱码或重复句子音频质量差或采样温度过低陷入循环提高-tp并配合-tpi 0.2逐步升温或换更大模型英文音频用.en模型却识别成外语语言参数冲突显式加-l en多语言音频改用无后缀模型内存不足或明显卡顿模型档位与机器内存不匹配换量化模型quantize生成或下载-q5_1/-q8_0版本用-t降低线程数CMake 配置失败编译器版本过低升级到 GCC 9 / Clang 10 / MSVC 2019确认 CMake ≥ 3.18跑完whisper-cli -h逐条核对参数拼写是排除手误类错误最快的办法。小结whisper.cpp 的价值在于一条命令完成离线语音转文字CMake 构建、一个下载脚本、一条推理命令全程无外部依赖。模型下载脚本models/download-ggml-model.sh命令行工具源码examples/cli/C 风格 API 头文件include/whisper.h实时流式转录示例examples/stream/项目说明与构建文档README.md【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考