
Transformers 语音识别指南Whisper 转写 5 分钟跑通【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers整理会议录音时是否因为多人插话让转写结果错乱成一锅粥做播客后期时是否希望先把多人对话变成结构化文字再分别归到每个嘉宾名下Transformers 的语音识别ASRpipeline 就是干这个的配合 Whisper 这类预训练模型把一段录音直接变成带时间戳的文字不用懂声学知识几行代码、5 分钟跑通。从噪音到文字原理一图流整条链路做三件事重采样把任意采样率的音频归一化到模型要求特征提取把波形转成声学特征Whisper 逐帧解码出文字。你不需要理解声学细节只需把录音喂进去拿回结构化文本。项目里的两条识别路线seq2seq 路线以 Whisper 为代表精度取向对应examples/pytorch/speech-recognition/run_speech_recognition_seq2seq.py。CTC 路线解码更快、微调数据需求小对应examples/pytorch/speech-recognition/run_speech_recognition_ctc.py。一键安装步骤环境准备# 克隆仓库并安装核心依赖 git clone https://gitcode.com/GitHub_Trending/tra/transformers cd transformers pip install -U transformers torchaudio soundfile若后续要跟着示例做训练依赖清单见examples/pytorch/speech-recognition/requirements.txt。5 分钟跑通语音转写最小示例# demo.py加载 ASR 管道并转写一段会议录音 from transformers import pipeline asr pipeline(automatic-speech-recognition, modelopenai/whisper-base) out asr(meeting_16k.wav) print(out[text])音频建议是 16kHz 单声道soundfile读到的 numpy 数组也可直接传入。首次运行会自动下载模型权重base 约 1GBtiny 约 150MB之后调用即出文字。参数调优时间戳、切块与批量return_timestampsTrue返回句级时间戳改成word可拿到词级做说话人归属对齐时最有用。chunk_length_s30长音频按多少秒切块stride_length5让相邻块保留 5 秒重叠避免切点处丢字。batch_size批量转写多个文件时提升吞吐CPU 上建议从 2 起步。预处理对识别效果的影响示例数据以实测为准场景直接转录 WER重采样静音裁剪后换更大模型后单人清晰语料6%5%4%双人交叉对话28%17%12%有背景噪声34%24%15%WER 为词错率越低越好。可见多人重叠与噪声场景下重采样、裁剪与模型选型带来的改善最明显单人清晰语料本身余量不大。进阶组合批量处理 词级时间戳# batch_asr.py批量转写并输出词级时间戳 from transformers import pipeline import soundfile as sf asr pipeline(automatic-speech-recognition, modelopenai/whisper-base) files [day1.wav, day2.wav] # 一整天的会议录音 for f in files: wav, sr sf.read(f) r asr(wav, return_timestampsword, batch_size2) print(f, -, r[0][text][:50], ...) print(r[0][chunks][0]) # 词级时间戳便于对齐说话人chunks里每个元素带word、start、end三个字段可以直接落到会议记录里把文字对齐回具体时间点。常见问题下载失败、转写慢、采样率模型下载失败export HF_HUB_CACHE./hf_cache export TRANSFORMERS_OFFLINE1先把权重拷进缓存目录再切离线模式网络不稳定时也可先在能联网的机器上下载好模型权重再拷贝。CPU 转写太慢初始化时加device1切到 GPU显存有限就换openai/whisper-tiny精度损失小、速度快得多。采样率不规范ASR 模型一般要求 16kHz 输入import torchaudio wav torchaudio.transforms.Resample(44100, 16000)(wav[None])关键路径索引管道源码src/transformers/pipelines/automatic_speech_recognition.py示例与训练脚本examples/pytorch/speech-recognition/训练文档examples/pytorch/speech-recognition/README.md含单卡/多卡命令排障文档docs/source/en/troubleshooting.md贡献指南CONTRIBUTING.md社区参与入口项目维护比较活跃新特性与修复都走 PR 流程评审测试。遇到问题先在docs/source/en/troubleshooting.md和ISSUES.md里检索没有答案再走反馈渠道提问想贡献代码或文档按CONTRIBUTING.md提 PR 即可。涉及音频前处理或微调的需求examples/pytorch/speech-recognition/下的脚本都能直接跑照着改参数就能验证自己的数据。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考