Buzz 本地音频转录完整指南:Whisper 离线转录与翻译教程

发布时间:2026/9/7 16:59:46
Buzz 本地音频转录完整指南:Whisper 离线转录与翻译教程 Buzz 本地音频转录完整指南Whisper 离线转录与翻译教程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的本地音频转录与翻译工具它完全离线运行音频文件不离开你的电脑不依赖云端 API也就没有网络故障和调用配额的问题。它支持约 99 种语言的转录与翻译输入方式涵盖文件导入、实时录音、URL 导入输出可导出为 TXT、SRT、VTT 等格式。录音资料不上云Buzz 解决什么问题设想一个场景你手里有 10 小时的访谈录音内容涉及客户或内部信息上传到任何云端转录服务都让你犹豫。此时你需要的不是更快而是更安全。Buzz 的设计目标就是这类需求隐私可控转录和翻译全程在本地完成音频不经过任何服务器无网络依赖模型下载一次后即可离线工作内网、飞机上都能跑无 API 配额不用按分钟计费不用处理限流和密钥管理多语言覆盖约 99 种语言可转录翻译任务统一输出为英文完整语言清单见 buzz/transcriber/transcriber.py。对使用者来说它就是一个图形界面工具对音频而言处理流程是本地解码 → 本地模型推理 → 本地出文本没有任何一步需要联网。三步跑起来安装 Buzz 并完成第一次转录步骤 1按系统选择安装命令平台安装方式命令 / 说明Windowswinget 或官方安装包winget install ChidiWilliams.Buzz或从发布页下载 .exe首次运行若提示安全警告选更多信息→仍要运行macOSHomebrewbrew install --cask buzzLinuxFlatpak / Snapflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz源码安装PyPI先装 ffmpeg再执行下面的命令pip install buzz-captions python -m buzz提示Buzz 依赖 ffmpeg 做音频解码源码安装前请确认系统里已装好最新版 ffmpeg。使用 Nvidia 显卡的话可以为 PyPI 版本额外配置 CUDA 以启用 GPU 加速。步骤 2下载模型首次选择模型时Buzz 会自动把对应规模的 Whisper 模型下载到本地缓存Linux 下位于~/.cache/Buzz之后即可离线使用。如果目标机器完全无法联网可以按 docs/ 中的 FAQ 说明在另一台机器上下载模型后拷贝到对应缓存目录。步骤 3第一次转录打开主界面 → 导入一个音频或视频文件 → 语言保持自动检测、任务选转录、模型先选 small → 开始转录。几分钟内你就能在任务列表里看到带时间戳的逐句结果并点击打开转录查看器。三个高频工作流文件、录音、编辑导出Buzz 的界面围绕三条主线组织对应它最典型的三种用法。文件转录批量处理音视频适合手头有一批会议、课程、播客文件的情况点导入文件或CtrlO选入一个或多个文件也支持直接粘贴 URL 导入网络音视频在转录选项面板设置语言、任务类型转录 / 翻译为英文、模型大小需要时展开高级选项填初始提示、调整温度、开启语音提取适合背景音乐较重的混音音频。任务会进入队列按序执行长文件也可以拆成多段并行观察进度。实时录音会议与讲座场景左侧切换到录音转录选择麦克风设备 → 点红色按钮开始 → 停止后自动保存录音与转录结果。几个实用习惯用暂停跳过寒暄、噪音段落避免无意义内容被转录正式录音前先说一句测试语确认设备拾音正常重要场合把模型调大一档用时间换准确率。编辑与导出把转录稿改成能用的稿子转录结果进入查看器后支持逐段编辑修正错字、微调时间戳、合并或拆分片段。导出环节支持 TXT、SRT、VTT 等格式字幕文件名可以用命名模板自定义。如果想调整每句字幕的长度和换行方式内置的片段缩放功能可以直接在界面里完成原理一句话界面背后发生了什么Buzz 本身不做语音识别算法它的工作是把 OpenAI Whisper 模型搬到你的机器上启动时按需下载并缓存模型导入的音频先经 ffmpeg 统一解码再交给本地加载的模型逐段推理得到带毫秒级时间戳的文本最后写入本地数据库供界面检索、编辑和导出。核心推理逻辑集中在 buzz/transcriber/ 目录下不同后端Whisper、faster-whisper、Whisper.cpp 等也在这里切换。你可以把它理解为一个模型调度 音频流水线 编辑器的组合而不是一个识别引擎。模型选型一张表定档档位速度准确率内存需求典型用途tiny最快基础1GB试跑、低配设备、草稿稿base快良好~1GB日常快速转录small中等优秀~2GB日常推荐档多数场景用它medium较慢非常好~5GB专业内容、口音较重large最慢最佳~10GB关键资料、低质量音频经验法则先从 small 起步效果不够再往上走设备吃紧时向 tiny/base 退。GPU 显存 ≥6GB 的机器建议用 faster-whisper 后端纯 CPU 或核显环境 Whisper.cpp 是更省心的选择。三个值得动的参数温度temperature默认是一个从 0.0 升到 1.0 的梯度元组(0.0, 0.2, 0.4, 0.6, 0.8, 1.0)。清晰录音用低值0.0–0.2更稳嘈杂或有口音的音频可适当调高给模型更多尝试空间。初始提示initial prompt把专业术语、人名、机构名写进提示里模型会显著减少这些词的错写。医学、法律、金融类内容尤其受益。语言指定自动检测在多数场景够用但多语混杂或检测失误时手动指定主语言能直接提升准确率。进阶玩法文件夹监控与 CLI文件夹监控watch 模式在首选项里配置一个监听目录往里面丢音频文件就会自动建任务、自动转录适合持续产生录音资料的团队相当于一个无人值守的本地转录流水线。命令行批量处理不想开界面时CLI 可以直接下达任务完整参数见 docs/cli.mdbuzz add --task transcribe --model-size small --srt interview.mp3把这条命令放进脚本里循环处理目录中的文件就是最朴素的批量方案。踩坑与调优小贴士转录太慢降一档模型关闭词级时间戳确认电脑处于高性能电源模式长音频先分段。内存吃紧换小模型并调低首选项中的并发任务数CPU 核心数的一半是不错的起点。错字多先排除音频本身质量差的问题再依次尝试更大模型、补充初始提示、调温度顺序反过来做基本是白费时间。模型下载损坏导致异常在设置 → 模型里删除对应模型重新下载即可。完全离线的机器参考 docs/ FAQ 手动搬运模型缓存目录Buzz 本身不需要联网即可工作。写在最后Buzz 做的事情并不复杂——把 Whisper 放在本地跑起来再用一套顺手的界面和导出流程包起来——但它正好补上了云端转录方案最让人介意的两个缺口隐私和依赖。如果你的录音资料不该上网或者工作环境不能依赖外网从 small 模型开始试一次文件转录基本就能判断它是否适合你的流程。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考