
faster-whisper-GUI离线跑完22段录音转写全程不到两小时【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI周五下午22段会议录音摊在桌面上合计5小时40分钟都要变成带时间戳的文字稿。faster-whisper-GUI 就是我为这摊事找的工具一个基于 faster-whisper 的离线语音转文字GUI音频全程在本地处理不碰任何云端。先交代一下我手上这摊事素材是22个m4a文件单段最短18分钟、最长74分钟其中3段是英文访谈其余全是中文会议。要交付的东西每段一个带时间戳的SRT加一份TXT文字稿3段英文还要标出说话人。纯手动听写的话至少得熬两个通宵。下面是我实际走通的路径按顺序做就能拿到一样的东西。软件怎么跑起来先克隆仓库装依赖启动脚本就在根目录git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt python FasterWhisperGUI.py窗口是Fluent风格的界面语言和主题色在设置页就能改。第一次启动会在后台拉取Silero VAD等依赖模型我这边耗时约6分钟进度条走完才能加载Whisper模型。第一次跑卡在这一步别急着重开我以为是网断了其实是它在正常下载等它自己走完就好。模型怎么选看你的硬件说话这一步决定速度和准确率核心就四个选项模型大小日常会议用small或medium就够我最终用的是large-v3单段50分钟音频实测8分钟左右出结果设备有N卡选cuda没有就cpu计算精度float16偏快int8省内存float32最稳线程数默认4我机器16核调到12后CPU转写明显提速。模型支持从Hugging Face在线下载也支持指向本地目录直接加载加载逻辑可以看模型加载源码。首次下载慢不慢全看你的网络下面避坑清单里有我后来用的离线加载做法。三个真正影响结果的转写参数转写参数页选项很多但动三处就够语言直接指定zh别用Auto省掉前30秒的语言检测3段英文访谈我单独改成en跑温度temperature正式会议我压到0.2内容松散的访谈放到0.5压得太低反而容易漏词VAD过滤vad_filter开着它Silero VAD会把静音段直接跳过22段文件实测省了约11%的转写时间。再顺手把word_timestamps打开后面导出逐字LRC就靠它。剩下的beam_size、patience这些保持默认就行。批量文件怎么跑整文件夹拖进去模型就位后把22个m4a全拖进文件列表软件自动过滤掉非音频文件点开始就排队跑。我中途去开了个会回来时21段已经出结果全程没看一次屏幕。列表里每个文件的状态一目了然跑砸的单独删掉重跑就行不用整批清空。跑完切到结果页起止时间、文本、单词级时间戳都在表格里错了双击就能改改完再导出。输出支持ASS、JSON、LRC、SMI、SRT、TXT、VTT七种格式我这次每段导了SRT和TXT两份。进阶让转写结果分清谁在说话如果你遇到多人开会分不清谁说了什么可以打开WhisperX的说话人分离。做法是切到WhisperX选项卡勾选说话人识别并限定人数区间我按3人开会设了3~3。跑完每句话前会带出speaker编号3段英文访谈的纪要整理基本就是复制粘贴的活了。我栽过的几个跟头转出来全是重复词循环念同一句话温度太高加VAD没开模型在静音段里幻听。降到0.2、打开vad_filter重跑一遍就干净了。卡在模型下载页半天不动大模型走Hugging Face直连太慢。提前把模型下好放进本地缓存目录界面里勾使用本地模型直接加载我后来全程没再碰过在线下载。CPU上medium跑得心疼不是坏了是模型选大了。8核机器用medium以下、线程数拉满50分钟音频40分钟出结果日常够用。英文访谈里夹中文专名断词很怪默认词表不认识这些专名。把专名填进hotwords热词栏下一段就认对了。它把faster-whisper那套命令行参数全搬进了图形界面转写错了也能回头改字。今晚就能试挑一段30分钟左右的录音按上面的顺序走一遍。【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考