SenseVoice 快速上手完整指南:5 种语言语音识别加情感事件识别,比 Whisper 快 15 倍

发布时间:2026/8/24 6:45:36
SenseVoice 快速上手完整指南:5 种语言语音识别加情感事件识别,比 Whisper 快 15 倍 SenseVoice 快速上手完整指南5 种语言语音识别加情感事件识别比 Whisper 快 15 倍【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址: https://gitcode.com/gh_mirrors/se/SenseVoice一堆录音待转写人工听太慢、通用模型对中文不准。SenseVoice 是一个开源的多语言语音理解模型语音识别、语种识别、情感识别、声学事件检测四合一。这篇文章带你三步走通装环境、出结果、用你自己的数据微调文中所有速度和精度数字都能在仓库的 benchmark 里查证。读完之后你手上会有一个跑通的环境10 分钟内看到你第一条音频的识别结果一套可核验的对比数据推理快多少、中文错字率低多少都来自仓库实测官方的微调数据格式一条命令自动补齐语种、情感、事件标签一份4 条的避坑速查版本、30 秒限制这类新手最容易栽的点场景切入批量语音转写的常见卡点先对号入座下面三种情况你可能都遇到过录音积压。一百小时的客服通话、播客音频等着转文字人工逐条听写再快也要按周算。通用模型中文不行。多语言大模型认英文尚可中文同音字经常写错仓库 benchmark 里就有把滨海新区听成冰海心区的实例粤语更是基本没法用。转出了字丢了信息。你还想知道说话人是怒是喜、音频里有没有背景音乐或掌声这些得再挂别的模型。SenseVoice 的思路是一次推理把文本 语种 情感 声学事件全部给出来不用自己拼流水线。项目速览SenseVoice 核心参数与同类对比⚡ 一句话定位SenseVoice 是用40 万小时以上数据训练的多语言语音基础模型已发布的 SenseVoiceSmall 版本支持中文、粤语、英文、日文、韩文 5 种语言的识别与语种判断顺带输出情感和事件标签。项目数据已发布模型支持语言5 种中、粤、英、日、韩研究版训练数据40 万小时以上覆盖 50 语言情感标签7 种开心、难过、愤怒、中性、恐惧、厌恶、惊讶声学事件标签8 种背景音乐、语音、掌声、笑声、哭声、喷嚏、呼吸、咳嗽推理速度同参数量对比比 Whisper-Small 快 5 倍以上比 Whisper-Large 快 15 倍CPU 实时率8 线程约 20 倍速处理 1 秒音频只需 1/20 秒边缘端体积q8 量化后约 254 MB和同类方案相比差异在三点一个模型出四份结果。语种、情感、事件都是模型原生输出的标签不用串联多个小模型也不额外增加延迟。非自回归架构。白话说它把整段音频听完一次性出整句而不是一个字一个字地生成这就是快的来源。CPU 也能跑全套。仓库自带 llama.cpp 运行时单个自包含二进制、内置 VAD语音端点检测负责把长音频自动切成语音片段运行不需要 Python 环境。从 0 到 1 上手安装步骤与首次运行教程一键安装步骤先拿到代码并装好依赖下面 4 行完成环境搭建git clone https://gitcode.com/gh_mirrors/se/SenseVoice cd SenseVoice pip install -r requirements.txt pip install -U funasr1.3.26最后一行最容易被忽略仓库示例依赖新版 FunASR装过旧版的话先升级能省一轮报错排查。30 秒跑起 WebUI不想看代码直接启动官方图形界面把音频拖进去就能识别python webui.py批量识别 5 种语言样本仓库自带中、粤、英、日、韩五种语言的示例音频跑一行看全部效果python demo1.py到这里已经能用了。后续想走接口调用可以看仓库里的 api.py它封装了 FastAPI 服务入口适合嵌进你自己的系统。效果验证184 条普通话 benchmark 前后数据对比最有说服力的数据来自仓库 llama.cpp 运行时的 CPU benchmark184 条真实普通话音频8 线程 CPU同一批音频分别交给 whisper.cpp 和 SenseVoice 跑。指标实施前whisper.cpp small实施后SenseVoiceSmall q8字错率参考字里出错的比例越低越好22.12%8.17%实时率处理速度超实时的倍数越高越快4.6 倍约 20 倍附带输出仅文本语种 情感 事件标签两点解读字错率降到原来的约三分之一q8 是 int8 量化降低数值存储精度、换更小更快的部署体积后的结果比官方 fp32 参考值 7.81% 略高一点属正常代价。15 倍加速是主 benchmark 的 GPU 环境数字20 倍速是 CPU 实测两者硬件不同不冲突。精度侧看仓库自带的官方 benchmark 图在 AISHELL、Wenetspeech 等中文与粤语数据集上SenseVoiceSmall 对 Whisper 有明显优势情感识别不微调的情况下也达到了同级别最优模型的水平。深入一层微调数据格式与自动标注流程想在自己的业务里进一步提升精度就得走微调。官方训练数据是 jsonl 格式一行一个 JSON 对象一条音频样本占一行仓库里的真实样例长这样{key: wav004, source: /data/audio/wav004.wav, target: 小凳子, text_language: |zh|, emo_target: |NEUTRAL|, event_target: |Speech|, with_or_wo_itn: |woitn|}字段含义对照 data/train_example.jsonl字段含义取值key音频唯一 ID任意字符串source音频文件路径本地路径target标注文本音频里说的话text_language语种标签\|zh\|/\|en\|/\|yue\|/\|ja\|/\|ko\|emo_target情感标签\|HAPPY\|、\|SAD\|等 7 种event_target事件标签\|BGM\|、\|Speech\|等 8 种标签不用手工标。官方提供 sensevoice2jsonl 工具你只给音频清单和文本转写它就调用 SenseVoice 模型自动补全语种、情感、事件三类标签一条命令完成sensevoice2jsonl \ scp_file_list[train_wav.scp, train_text.txt] \ data_type_list[source, target] \ jsonl_file_outtrain.jsonl \ model_diriic/SenseVoiceSmall生成 train.jsonl 后把它配进 finetune.sh 再启动训练即可整体流程如下图避坑指南常见问题速查问装完就跑示例为什么报错答大概率是 FunASR 版本旧了先执行pip install -U funasr1.3.26再重试。问为什么直接推理方式只收 30 秒以内的音频答30 秒是裸模型的输入上限。长音频请走 AutoModel 加 fsmn-vad 的链路它会自动切段再识别任意时长都行。问中文准为什么日韩一般答官方模型的主力数据集中在中文、粤语和英文benchmark 优势也主要体现在中文和粤语。你的业务如果以日韩为主先查上面的多语言对比表再决定要不要微调。问微调到底要改什么答两处。一是从源码安装 FunASR 拿到训练入口二是把 finetune.sh 里的 train_tool 指向 funasr/bin/train_ds.py 的绝对路径。Deepspeed多卡训练加速框架配置仓库里已备好不用自己写。✅ 读完这篇文章你拿到了✅ 装好并跑通的环境本机能看到识别结果✅ 心里有数比 Whisper-Large 快 15 倍中文 q8 字错率 8.17%✅ 掌握 jsonl 训练格式一条命令自动生成标注数据✅ 记住 4 个坑版本、30 秒上限、语种差异、微调配置下一步建议很具体先拿自己手上 10 条音频跑一遍 demo1.py把结果和真实内容逐条对一遍算出你业务场景下的真实错字率不达标再按上面深入一层的部分跑自动标注攒够数据启动微调。【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址: https://gitcode.com/gh_mirrors/se/SenseVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考