whisper.cpp 语音转文字:3分钟本地跑通离线转录

发布时间:2026/8/30 13:04:58
whisper.cpp 语音转文字:3分钟本地跑通离线转录 whisper.cpp 语音转文字3分钟本地跑通离线转录【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp刚录完一段2小时的会议录音当天就要交文字稿。传云服务商又担心内容外泄。whisper.cpp 是 OpenAI Whisper 模型的纯 C 实现音频直接在电脑本地转成文字——本地离线语音识别录音全程不用离开机器。 它到底能帮你干什么个人电脑上最好用的语音转文字工具而且是完全离线的。不装 Python、不依赖 GPU 框架一个可执行文件就把活干完了源码在 include/whisper.h 里写得清清楚楚。你能用它把任意录音转成文字稿丢进一个 WAV 文件出来带段落时间戳的文本终端实时滚动输出你能用它直接生成字幕文件加一个参数就输出 .srt 或 .vtt 字幕拖进剪辑软件直接用你能用它做实时转写whisper-stream 示例读麦克风输入边说边出字适合现场会议和直播字幕你能用它做多语种识别与翻译加-l auto自动判断说话语言加-tr把识别结果直接译成英文⏱️ 3分钟跑通第一次转录先对照环境表确认机器是否达标再照着这条命令链走它就是最短的 whisper.cpp 安装教程项目最低要求推荐值系统Windows / macOS / LinuxmacOS Apple SiliconMetal 加速内存4GBtiny/base 模型8GB 以上构建工具CMake C/C 编译器CMake 3.14 及以上磁盘约 300MB1GB放多个模型git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp sh models/download-ggml-model.sh base.en cmake -B build cmake --build build --config Release ./build/bin/whisper-cli -m models/ggml-base.en.bin samples/jfk.wav -otxt跑完终端逐行打印转录结果当前目录多出一个与音频同名的文本文件。base.en 是纯英语模型仓库自带的 jfk 示例正好是英文效果立竿见影转录过程全程离线不需要任何 API 密钥。想查所有参数随时运行./build/bin/whisper-cli -h。整个过程不注册、不联网转多长的录音都不花一分钱这也是本地离线语音识别最实在的好处转得越多越省钱。挑对模型事半功倍模型大小直接决定速度和准确率。别按参数量挑按你要处理什么挑你要处理什么推荐模型磁盘 / 内存特点实时对话、随手快查tiny约75MB约273MB最快日常够用日常随手记base / base.en约142MB约388MB速度准度均衡最常用专业转写small约466MB约852MB准确率明显提升高精度需求medium约1.5GB约2.1GB较慢只留给重要材料选型建议内存有 8GB 就直接上 small转写质量会上一个台阶只有 4GB 就留在 base完全够用。纯英语音频选 .en 版本速度更快也更准语言混杂时换多语言版再用-l指定语种中文、西班牙语、法语、德语都能覆盖。模型用sh models/download-ggml-model.sh small这类脚本就能拉下来不用手动找地址。从一次到一批批量会议录音做什么一周的会议录音一次转完按文件归档怎么做用 shell 循环遍历-of给结果文件起名与音频一一对应for f in meetings/*.wav; do ./build/bin/whisper-cli -m models/ggml-base.en.bin -otxt -of ${f%.wav}.txt $f done注意什么一次只跑一个2小时的录音在 base 模型上大约几分钟出结果适合睡前挂着跑机器吃紧就加-t 4限制线程数老视频补字幕做什么给一段录制的课程音频生成带时间戳的字幕怎么做同一条命令加上-osrt输出与音频同名的 .srt 文件时间戳精确到毫秒注意什么时间戳是段落级而非逐字级源文件是 mp3 就先转 16 位 WAV见下面故障表实时转录做什么说话的同时出字幕怎么做编译 stream 示例先装好 SDL2 依赖再运行whisper-stream -t 8 --step 500注意什么--step 0开启 VAD 模式检测到有人说话才转写安静环境更省电 踩了坑对着这张表查报错说不支持该格式 / 只认 16 位 WAV原因whisper-cli 只读 16 位 WAVmp3、flac 直接喂进去会失败。 解法先用 ffmpeg 转码再转写ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav中文音频转成乱码或串味英文原因用了 .en 纯英语模型或没指定语言。 解法换多语言模型如 base命令里加-l zh或-l auto。加载模型时卡死或崩溃原因内存不足medium 运行时约吃 2.1GB。 解法降一档模型或用自带工具量化压缩./build/bin/quantize models/ggml-base.en.bin ggml-base-q5_0.bin q5_0。输出文件不见了原因结果写在当前工作目录不在音频旁边。 解法在跑命令的目录里找同名 .txt或用-of显式指定输出路径。核心实现都放在 src/想搞懂它内部怎么跑的从那里读起。过去要交给云服务商的活现在一条命令在自己电脑上搞定数据不出机器、转多少都不花钱。下一步先拿 jfk 示例跑通再换一段真实录音。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考