
Buzz 本地离线语音识别实测2 小时会议录音 25 分钟出稿【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的本地离线语音识别工具基于 OpenAI Whisper完全在你自己的电脑上完成离线音频转录和翻译。不传云端、不按分钟计费、不依赖网络我用它处理了一个月的会议录音和讲座音频存着没处理的音频数量终于清零了。下面我以一条 2 小时的客户会议录音为主线讲清楚它在 Buzz 里被处理的完整过程包括我踩过的坑和几个值得记住的设置。先说结论这条 2 小时录音的完整旅程一条 2 小时的客户会议录音约 120MB 的 MP3从导入到出稿我的实测结果是这样的无独显的笔记本上运行离线音频转录耗时约 25 分钟生成的初稿约 15 页错别字几十处集中在专有名词补了两轮修正 字幕重排后导出 SRT 和 TXT直接进剪辑流程全程音频文件不出我的电脑文字落在指定文件夹对我而言本地转录的价值不只是免费而是数据完全不出设备——一条包含客户报价的录音这份安心感值很多钱。三大系统装好 Buzz一条命令的事Buzz 对三大桌面系统都有现成安装包macOS 下载 dmgWindows 跑安装程序未签名时弹出警告点更多信息 → 仍要运行即可这是开源软件的常见情况。Linux 用户走 Flatpak 或 Snap 两个商店渠道一条命令装好flatpak install flathub io.github.chidiwilliams.Buzz也有 PyPI 渠道适合喜欢折腾的pip install buzz-captions后用python -m buzz启动需要自己先装好 ffmpeg。有个硬件门槛要注意CPU 必须支持 AVX2太老的机器直接不支持。装完打开就是主界面所有转录任务都在这里状态、进度一目了然双击结果行即可打开。这是后面所有操作的起点。本地离线语音识别选引擎一句话加一档就够Buzz 里要先配的是引擎说白了就是选哪种 Whisper 实现来跑模型这一项对速度的影响比模型大小更直接。我的建议没有独显或只有核显的选 Whisper.cpp——C 重写、支持 Vulkan核显都能参与加速现代笔记本上能接近实时有 NVIDIA 显卡且显存不低于 6GB 的选 Faster Whisper速度提升明显想加载社区定制模型、或用 MMS 系列上千种语言再选 HuggingFace 选项。模型档位记住一句话日常用 base重要内容用 small。tiny 档用来预览和测试medium 到 large 的精度提升是边际性的耗时却成倍上涨除非是极其重要的访谈否则性价比不高。模型管理页面能查看每个模型的下载状态随时删除和重新下载。模型文件存放在系统缓存目录显示文件位置按钮可以直接打开——这个按钮后面在处理离线机器时会变成救星。手动指定语言和初始提示错别字少一半的两个设置我第一次用自动检测语言时翻过车录音明明说的是中文模型前几秒先猜成别的语种再中途切换结果一塌糊涂。从此我定了规矩知道语言就手动指定官方文档也明确推荐这么做。第二个是初始提示在高级...选项里。处理专业录音前把会出现的术语、人名、公司名先写进去。我转一场医学讲座时预先填了几个药名拼写错误明显少了一截。第三个建议默认打开的开关词级时间戳。它给每个词标上时间点是后面做字幕精修和重排的基础现在不打开、后面会后悔。状态变成 Completed 后双击那一行进入转录查看器搜索、播放、调速、逐段修改都在里面比对着 TXT 全文找错字高效得多。从初稿到交付字幕重排、导出格式与文件夹监控转出来的字幕经常一句话被拆得稀碎。Buzz 内置重排工具按静音间隙合并、按标点分割、限制每条字幕最长字符数几下点完字幕就整齐了配合剪辑软件导出特别顺手。再往上还有两个高阶玩法说话人识别能把多人对话按角色分开嘈杂录音可先启用语音分离再转录识别率直接上一个台阶。加上AI 摘要插件1.4.5 起可用转录完成后自动生成要点总结长会议受益最大。导出格式记住对应关系即可TXT 方便做笔记SRT 是剪辑软件通用的标准字幕VTT 适合网页视频。想批量处理一堆讲座录音就在偏好设置里指定一个监控文件夹音频丢进去自动开始转录等于一条半自动流水线。Buzz 离线音频转录踩过的 3 个坑转录太慢按顺序排查降一档模型、关掉无关程序、确认 GPU 加速真的生效。另一个实测项Whisper.cpp 的线程数不是越多越快我把环境变量BUZZ_WHISPERCPP_N_THREADS设为 8我的机器是 16 线程转录时间缩短了约 15%再往上加反而更慢。Buzz 突然崩溃多数时候是模型下载损坏去模型管理页删掉重新下载即可。完全没有网的环境也能用先在联网机器下好模型点显示文件位置找到缓存文件夹Linux 在~/.cache/Buzz整体拷到离线机器的相同位置就行。想自动化的话它还有命令行接口buzz add加几个参数就能启动任务--srt、--vtt直接产出字幕文件配合文件夹监控能搭出完整的本地离线语音识别流水线。更多细节可以看官方文档转录引擎的实现代码在 buzz/transcriber/比宣传文案更直观。用了一个月后最大的变化是我录音时不再惦记这录音以后怎么办录音本身就是可搜索、可编辑的文字。下次你手上有不敢传云的音频装一个 Buzz拖进一段三分钟的片段跑完你第一次离线音频转录吧。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考