FunASR说话人分离完全指南:三步自动标记“谁说了什么“

发布时间:2026/9/7 7:12:51
FunASR说话人分离完全指南:三步自动标记“谁说了什么“ FunASR说话人分离完全指南三步自动标记谁说了什么【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR会议录音结束整理有多难两小时的会三点结束。一支麦克风四个人声还有几处抢话。转写工具给你的是一大段没有名字的文本。想知道谁说了什么得反复倒回去听录音。纪要拖到晚上才整理完。FunASR说话人分离给出的答案是它能把多人录音自动拆成带说话人标签的分段同时输出带时间戳的文本。不用人工标注也不用先注册声纹。它到底能干什么FunASR说话人分离有四个能力值得知道自动说话人标注每段语音挂一个匿名编号spk 0、spk 1…不需要训练你的模型一条流水线出转写VAD切分、说话人分离、ASR识别、标点恢复一次调用全做完带时间戳输出每句都有起止时间字幕、检索可以直接复用 多种用法本地 Python、CLI 命令、OpenAI 兼容 HTTP 服务任选其一原理拆解三级流水线那它是怎么做到的其实是三级流水线每一级只干一件事。输入端VAD 把长音频切成段第一级是 VADVoice Activity Detection检测音频里哪些位置有人声。它像个剪辑师在静音处下刀把两小时长音频切成一段段可处理的语音。FunASR 默认用轻量级的 FSMN-VAD 完成这一步。处理端CAM 按谁的声音分组第二级是说话人分离speaker diarization把混在一起的语音按说话人拆开。CAM 声纹模型给每段语音算一个音色向量——像前台按嗓音认人——把同一个人的话归到同一个编号下。输出端ASR 识别文本并挂标签第三级是 ASRAutomatic Speech Recognition语音转文字。它像速记员写下每个人说了什么附起止时间和 spk 编号。你拿到的是形如0000-0004 spk0 下季度…的列表。仓库里还有端到端的 EEND-OLA 说话人分离实现结构如下说话人分离三步走从克隆到第一条转写第一步拿代码并安装git clone https://gitcode.com/GitHub_Trending/fun/FunASR pip install funasr第二步三行代码开启说话人分离from funasr import AutoModel model AutoModel(modeliic/SenseVoiceSmall, vad_modelfsmn-vad, spk_modelcam) res model.generate(inputmeeting.wav)[0]spk_modelcam是关键一行。不加它输出就是一份没有名字的分身纯文本。第三步看结果res[sentence_info]就是结果每条含start/end毫秒时间戳、spk说话人编号、text内容。习惯命令行的人一条命令搞定详见 CLI 说明funasr meeting.wav --spk -f json两个落地案例案例一企业会议纪要自动化谁在用团队的会议组织者和行政同事。痛点是会一结束就得有人手动扒录音半天才出一份纪要。现在会后录音跑一次说话人分离直接得到带说话人编号的文本张三上次提了什么可以按人检索。效果是纪要从明天的活变成散会即出。这条路径是 模型选择指南 里的标准组合。案例二多方通话录音归档谁在用客服与录音归档团队。长录音里声音多查一条投诉要来回翻几十分钟。把 FunASR 挂进 在线 runtime 服务 后转写带上 spk 标签按说话人编号过滤就能定位到人。服务整体结构如下调优与边界三条建议可以照抄模型选择多语种或跑 CPU 用 SenseVoice-Small纯中文、要字级时间戳换 Paraformer详见 模型选择指南长音频超过一小时的录音建议先按时间切片再分批跑。说话人越多标签越容易混长音频尤其明显更长的一体化路径可看 MOSS 接入文档服务化多人并发请求时走funasr-server的 OpenAI 兼容接口别让每个应用自己加载 Python 模型两条边界也要说清楚spk只是单次录音内的匿名编号不识别真实姓名、不能跨录音匹配、不能当声纹验证用重叠语音无法拆分两人同时说话的那段可能只归属其中一人。回到开头那场两小时的会散会那一刻你收到的不是一堆录音而是一份带说话人标签、随时可以按人检索的文件。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考