Sherpa-onnx 新增 Whisper Large V3 Turbo 支持:本地语音识别如何又快又准

发布时间:2026/9/12 4:08:25
Sherpa-onnx 新增 Whisper Large V3 Turbo 支持:本地语音识别如何又快又准 Sherpa-onnx 新增 Whisper Large V3 Turbo 支持本地语音识别如何又快又准【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx想让离线语音识别又快又准Sherpa-onnx 把 Whisper Large V3 Turbo 搬进了本地推理开发者不用改现有架构换个模型文件就能用上更快的语音转文字能力。这件事为什么和你有关做字幕、会议转写、离线听写的人都有同一种纠结Whisper 小模型跑得快但识别率低large 级别模型准但慢到没法实时。Turbo 版相当于给标准版加了涡轮——马力准确率基本没减油耗计算量却大幅下降。据 OpenAI 公开数据large-v3-turbo 的解码层数比 large-v3 少 8 倍推理速度约为其 8 倍准确率基本持平。对嵌入式设备、树莓派这类算力有限的场景这意味着准和快第一次可以兼得。这次更新到底改了什么sherpa-onnx 在 1.10.28 版本中加入 whisper turbo 支持PR #1390。仓库里的 ONNX 导出脚本 scripts/whisper/export-onnx.py 和 scripts/whisper/export-onnx-with-attention.py 现在都把turbo列为合法模型名并与large、large-v3同组处理——因为它们输入特征维度都是 128即 16kHz 音频的 mel 频谱帧推理管线无需任何改动。说人话Whisper 分 encoder听音频、提特征和 decoder把特征变成文字两段。Turbo 版砍掉的是 decoder 的冗余层数只保留单遍输出。变化是同样一段 10 秒音频标准版要跑两遍、Turbo 一遍出结果端侧延迟随之减半再减半。开发者怎么快速用起来路径很简单找模型 → 放同一目录 → 跑示例。从项目 Release 的 asr-models 页面下载已导出的 turbo 模型包含 encoder、decoder、tokens 三个文件解压即可无需自己导出先克隆仓库git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx直接参考现成示例把模型路径改成你自己的Pythonpython-api-examples/offline-whisper-decode-files.pyC/Cc-api-examples/whisper-c-api.c、cxx-api-examples/whisper-cxx-api.ccC#dotnet-examples/offline-decode-files/run-whisper-large-v3.sh 里已写好--whisper-encoder、--whisper-decoder、--tokens三个参数的完整命令行照着换文件名即可。如果你手上有原始权重用 scripts/whisper/export-onnx.py 也能自行导出。选型参考和同类模型怎么比判断标准就四条按自己场景各打各的分维度Whisper Large V3 TurboSenseVoice 等轻量模型Whisper large-v3 标准版语言覆盖99 种语言多语混合强中英日韩为主同 Turbo噪声鲁棒性优优优算力需求中低高部署复杂度与 sherpa-onnx 现有 Whisper 模型一致零迁移成本低同 Turbo别只看表格。示例脚本里都内置了 RTF实时率 耗时/音频时长统计逻辑建议拿自己业务里的真实音频各跑一遍数据比任何对比文章都可信。换模型不换架构这就是 Sherpa-onnx 接入 Turbo 的最大价值多语言的离线识别从够用的快升级到够快且够准。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考