Buzz 离线语音转文字实操笔记:从导入 mp3 到产出 SRT 字幕的四步走

发布时间:2026/9/14 14:45:27
Buzz 离线语音转文字实操笔记:从导入 mp3 到产出 SRT 字幕的四步走 Buzz 离线语音转文字实操笔记从导入 mp3 到产出 SRT 字幕的四步走【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费、离线的语音转文字工具基于 OpenAI 的 Whisper 模型把音频转写和翻译全部放在你自己的电脑上完成。本文按真实操作顺序走一遍装好它、转出一条文字稿、把稿子校对成能交付的状态最后聊聊我踩过的几个坑。音频不出本机Buzz 的离线逻辑大多数在线转录服务会把录音上传到服务器识别完再把文字发回来Buzz 反着来——它先把 Whisper 模型下载到本地首次使用会占几百 MB 磁盘之后所有识别运算都在你的 CPU 或 GPU 上跑。这意味着三件事隐私兜底会议录音、客户访谈全程不离开设备可断网运行官方 FAQ 明确支持纯离线环境只需在有网机器上先把模型下好拷到目标机器的模型缓存目录Linux 下是~/.cache/Buzz零边际成本不按分钟计费也没有次数上限要说不足的话离线是把双刃剑所有算力压力都落在你自己的硬件上。Buzz 要求 CPU 支持 AVX2太老的机器直接跑不起来官方 FAQ 也提示没有独显的电脑转录速度会明显受限这类场景建议后面讲的小模型 Whisper.cpp 组合。安装 Buzz三大平台的四种选择装好后第一次打开别急着找设置先确认它能不能正常启动因为下面这些坑大多发生在安装这一步。Windows从发布页下载安装包双击安装。注意安装包未签名首次运行会弹警告点「更多信息 → 仍要运行」即可这是官方 README 里写明的正常现象。macOS下载.dmg安装。一个反直觉的点现在的 Buzz 只支持 Apple SiliconIntel 芯片的 Mac 停留在 1.4.5 版本不再更新。LinuxFlatpak 或 Snap 二选一。Python 用户需要预装 ffmpeg然后两条命令pip install buzz-captions python -m buzz有 NVIDIA 显卡想要 GPU 加速README 里给了 PyTorch CUDA 的额外安装指引没有独显也不用慌Buzz 内置的 Whisper.cpp 后端支持 Vulkan 加速核显甚至纯 CPU 都能跑这也是官方推荐给 Mac 用户的方案。从 mp3 出第一份文字稿主界面比想象中朴素但任务表格已经齐活了文件、模型、任务类型、状态一行一个任务。主界面的任务表格每行一个文件可看到模型、任务与实时状态即上文说的一行一个任务出第一份稿子就四步导入文件点菜单栏 Import Media File 或工具栏的「」也可以CtrlO除本地音视频外还支持粘贴 YouTube 链接选择任务与模型任务选 Transcribe转录或 Translate to English翻译成英文模型从 tiny 到 large 任选点击 Run任务进入队列状态从 Queued 到 In Progress 再到 Completed双击该行打开转录查看器进入校对环节关于模型第一次用记住一个原则就行官方 FAQ 也是这么建议的tiny / base速度快出草稿、实时转录够用small / medium速度与准确度的平衡点日常首选large准确度上限但对硬件和时间都是考验重要内容再上顺带一提模型下载位置可以「Help → Preferences → Models」里点 Show file location 直接打开删错、下坏都能在这里处理。校对文字稿播放、搜索与三种格式导出双击任务行进入查看器这里才是 Buzz 把转录推向交付的地方。查看器界面带起止时间的段落表格、搜索框与底部播放器对应上文的播放校对与搜索定位几个真用得上、但新手容易忽略的功能分段播放勾选 Loop Segment点击某一段就会循环播放那一小段音频专门用来核对拿不准的字变速播放0.5x 到 2.0x 可调校对长录音时开 1.5x 能省一半时间搜索跳转CtrlF打开搜索框Enter 跳到下一处匹配长录音里找预算合同这类关键词很顺手手调时间戳Ctrl←/→以 0.5 秒为步进调整段落起止时间字幕对齐靠它导出支持 TXT、SRT、VTT字幕文件可直接丢进剪辑软件。如果你需要 DOCX 格式1.4.5 起内置的 Export to DOCX 插件可以接管在 Help → Plugins 里启用即可。更多快捷键细节可以看仓库里的 Transcription Viewer 文档。转之前该知道的事踩坑与边界 这一节都是我或文档里明写的坑建议转长录音前先花两分钟读完。语言别全靠自动检测。官方文档明确建议知道语言就手动选。Whisper 靠开头几秒猜语言猜错时整篇稿子的准确率会塌方。词级时间戳是个隐藏开关。导入选项里的 Word-Level Timings 默认关闭但如果你之后想把文字稿重组成规整字幕按最大长度拆分、按标点断句、按静音间隙合并必须先打开它。开了词级时间戳的稿子Resize 时还会分析原音频的静音段来优化字幕边界没开的话就只能改最大长度。这个功能在 编辑与 Resize 文档 里有完整说明。模型下坏会直接崩。官方 FAQ 指出模型文件下载不完整或损坏时 Buzz 可能崩溃处理办法是在模型偏好里删掉重新下载。说话人识别有边界。多人访谈可以点 Identify speakers 区分说话人并重命名标签但 Intel 版 macOS 不支持此功能且重叠说话、音量差异大的录音仍可能需要手工修正。进阶但不强求的三件事麦克风实时转录带一个适合投屏的演示窗口、文件夹监控新音频自动入队、以及 CLI 脚本化——比如一条命令把一批录音转成字幕buzz add --srt --vtt presentation.mp4CLI 的完整参数任务类型、模型后端、输出格式、输出目录见仓库内的 CLI 文档。如果你要处理一小时以上的长音频再给一个硬件参考官方 FAQ 建议显卡显存至少 6GB 时才考虑 Faster Whisper 后端否则老老实实用 Whisper.cpp 加小模型慢一点但稳。五分钟最小验证不必先装一堆东西一条命令就能验证 Buzz 是否可用PyPI 安装方式下buzz add --txt 任意一段.mp3跑完后音频文件旁边会出现一个同名的.txt文件——打开它看到转写出的文字就说明整条离线链路已经通了。剩下的就是慢慢把模型、字幕、翻译这些功能逐个用熟。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考