Buzz 免费离线音频转录完整指南:本地 Whisper 转文字的实战手册

发布时间:2026/9/7 2:17:02
Buzz 免费离线音频转录完整指南:本地 Whisper 转文字的实战手册 Buzz 免费离线音频转录完整指南本地 Whisper 转文字的实战手册【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线音频转录工具基于 OpenAI 的 Whisper 模型在本地把音频、视频转成文字支持多种后端与 GPU 加速可导出 TXT、SRT、VTT 等格式。对不想把音频上传云端的用户来说它让转录在自己电脑上以零成本完成。为什么把本地音频转录交给 Buzz三条选型理由都是能直接落地的数据留在本机音频文件、模型、转录结果全部在你的设备上处理不经过任何第三方服务器适合处理会议录音、访谈、内部培训这类敏感材料。使用成本为零MIT 许可开源不按分钟收费、没有订阅模型下载完成后转录本身不依赖网络。可选的 AI 翻译功能需要你自己配置 OpenAI 兼容 API。硬件覆盖广Whisper.cpp 后端支持 NVIDIA CUDA、Vulkan核显也能加速与 Apple Silicon模型从 tiny 到 large 共 5 个档位任选配置低和追求精度的机器都能跑。功能与适用场景概览功能典型场景 本地文件转录MP3、WAV、MP4 等音视频批量转文字或字幕️ 实时录音 演示窗口讲座、发布会现场即时转写并投屏展示 YouTube 链接导入不下载视频直接把在线内容转成文字️ 说话人识别与语音分离多人对话、噪声环境提升识别质量 翻译为英语或 AI 翻译双语字幕、跨语言材料整理⏱️ 文件夹监控与命令行新文件自动入队、脚本化批量处理从安装到出第一个结果一次上手的最小路径各平台安装方式各一句话Windows下载安装包直接安装程序未签名出现安全提示时点更多信息→仍要运行即可继续。macOS下载 .dmg 文件拖入应用程序文件夹。LinuxFlatpak 或 Snap 二选一Flatpak 一条命令flatpak install flathub io.github.chidiwilliams.Buzz习惯命令行的话也可从 PyPI 安装buzz-captions需要 Python 3.12 环境并提前装好 ffmpeg。装好后4 步拿到第一段转录主界面点工具栏按钮或按 CtrlO选择一个音频或视频文件选择任务Transcribe 转写 / Translate to English 翻译、手动指定语言、挑选模型点 Run等待任务状态变为 Completed双击该任务行打开转录查看器查看文字三种典型用法本地文件、实时录音与在线链接Buzz 的核心工作流分三条线对应你手头素材的来源。本地文件转录处理已有的音视频这是最常用的入口从导入到导出不到一分钟。菜单 File → Import Media File或按 CtrlO 选择文件选择任务、语言、模型档位点 Advanced 按钮在 Initial prompt 填入专有名词做字幕则勾选 Word-Level Timings点 Run状态变为 Completed 后双击打开查看关键参数Initial prompt把人名、术语等易错词放进去能明显减少错拼详见官方文档 docs/docs/usage/1_file_import.mdExtract speech噪声较大的音频先提取出干净的语音轨再转录识别率更稳实时录音会议与讲座即时转写把麦克风变成实时字幕机适合现场活动。录音页选择任务、语言、模型与麦克风选录音模式Append below新句加在下方、Append above加在上方或 Append and correct追加并回改末尾错误更吃硬件点 Record 开始需要现场展示时打开 Presentation window结束后转录内容按普通任务保存可编辑可导出关键参数实时转写资源开销大建议用 Whisper.cpp 较小档位模型能上 GPU 就上 GPUAdvanced 里的Silence threshold过滤低音量背景噪声队列Queue持续变长时增大Transcription step降低负载在线链接转录YouTube 直接处理不用手动下载视频一个 URL 走完全程。把视频 URL 粘贴到主界面的 URL 输入框Buzz 自动下载音频流指定语言可用自动检测手动指定更稳定运行转录完成后双击打开查看要点链接模式同样支持翻译任务与全部导出格式和文件模式共用同一套参数。把结果变成成品编辑、调整与导出流水线拿到文字只是第一步查看器里的三段流水线把它变成可交付的成品。阶段一校对文本打开转录查看器后左侧是带时间戳的段落表底部是音频播放器边听边改。时间戳微调Ctrl←/→ 以 0.5 秒为单位移动段落起点CtrlShift←/→ 移动终点推荐设置勾选 Loop Segment 后点击某一行可循环播放该行播放速度支持 0.5x–2.0x快速校对用 1.5x–2.0xCtrlF 调出搜索栏定位关键词阶段二重排为字幕行带词级时间戳的转录可点击 Resize 重新合并字幕。推荐设置开启按标点拆分并设定单行最大长度让换行落在句读处延长显示时间给每段结尾增加固定秒数字幕停留更久且不会越过下一段的起点阶段三多格式导出TXT纯文本进笔记和文档SRT标准字幕Premiere、Final Cut 等剪辑软件直接加载VTT网页字幕格式JSON结构化数据适合脚本处理推荐设置在 PreferencesCtrl/Cmd ,里设导出文件名模板如{{input_file_name}} {{date_time}}批量导出时命名统一不混乱更多变量说明见 docs/docs/preferences.md想扩展能力可以看内置插件系统 plugins/例如 AI 摘要与自动字幕重排。调优指南模型选型、加速与高频排错速度和精度主要取决于模型档位与运行后端按下表选型即可。档位大致内存相对速度精度推荐场景tiny~75MB⭐⭐⭐⭐⭐基础快速预览、低配设备、实时录音base~142MB⭐⭐⭐⭐良好日常使用速度与质量均衡small~466MB⭐⭐⭐良好偏上正式转录的默认起点medium~1.5GB⭐⭐优秀研究用途、高精度要求large~2.9GB⭐最佳多语言、专业级转录加速方法NVIDIA 用户选 CUDA 加速的后端Whisper.cpp 走 Vulkan核显同样受益把模型放进显存转录速度可提升数倍Apple Silicon 用户走原生优化路径。问转录速度太慢怎么办 答先降档位tiny/base 对短音频基本接近实时再换 GPU 加速后端仍不够可在 Whisper.cpp 下用环境变量BUZZ_WHISPERCPP_N_THREADS调线程数取 CPU 核心数的一半附近通常更快。问识别准确率不高怎么提升 答三件事手动指定源语言而不用自动检测在 Initial prompt 填入专有名词与术语升到 medium/large。噪声大的音频再叠加 Extract speech。问Windows 安装时弹出安全警告 答官方安装包未签名属正常现象点更多信息→仍要运行即可完成安装。问实时录音延迟越来越大 答实时转写很吃资源。换更小档位 Whisper.cpp并在 Advanced 中增大 Transcription step录时留意 Queue 指标增长过快就继续加大 step。问断网还能用吗 答能。转录全程在本地完成只有下载模型和可选的 AI 翻译需要联网模型备齐后可完全离线工作。Buzz 适合谁以及下一步做什么三类人最适合从它开始学生与研究者讲座录音、访谈素材量大用 medium 以上档位 Initial prompt 填方言词汇和技术名词术语识别率会明显提升。内容创作者导入视频文件生成 SRT 字幕后导入剪辑软件再用查看器工具栏的 Translate 按钮接 AI 产出第二语言字幕。企业会议记录实时录音 Presentation window 现场展示配合文件夹监控新落盘的录音自动进入转录队列归档。接下来可以做的四件事先下载 tiny 与 base 两个模型用一段 1 分钟左右的样例对比速度和精度再定常用档位在 PreferencesCtrl/Cmd ,里设好默认导出路径与文件名模板做字幕的转录任务固定开启 Word-Level Timings事后用 Resize 重排配置文件夹监控让新丢进目录的音频自动排队处理这四步完成后文件转录、实时录音、字幕导出就会成为你工作流里固定的一环全部在自己的电脑上完成。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考