
Meta-Voicebox核心架构图解时长模型与Flow-Matching音频模型的两阶段设计完全拆解【免费下载链接】Meta-voiceboxImplementation of Meta-Voicebox : The first generative AI model for speech to generalize across tasks with state-of-the-art performance.项目地址: https://gitcode.com/gh_mirrors/me/Meta-voiceboxMeta-Voicebox 是 Meta 提出的首个具备任务通用能力的语音生成 AI 模型通过时长模型与Flow-Matching 音频模型的两阶段设计实现文本引导的语音填充生成。它用不到自回归模型的 1/20 耗时即可完成零样本 TTS 语音合成、降噪、内容编辑等任务。本文结合项目核心架构图带你一次看懂它的完整工作流程。 什么是 Meta-Voicebox一个多面手语音生成模型传统语音模型往往一招鲜只能做文本转语音或者只能做降噪。而 Meta-Voicebox 的核心思想与 GPT 类似——通过上下文字in-context learning学会多种任务️零样本多语言 TTS 语音合成给一句参考语音 目标文本即可克隆音色语音降噪只去除片段噪声保留背景环境声✂️内容编辑替换指定词语保留说话人风格多样化采样同一文本生成多条风格各异的语音项目简介详见 README.md核心代码位于voicebox/模块目录下。本地运行可克隆仓库git clone https://gitcode.com/gh_mirrors/me/Meta-voicebox️ 核心架构总览两阶段语音填充生成Meta-Voicebox 的本质是一个非自回归的 Flow-Matching 填充infilling模型给定音频上下文 文本补全中间缺失的语音。其整体流程分为清晰的两阶段如下图所示整个数据流自底向上阶段输入输出① 时长模型音素序列 时长上下文每音素的帧级时长② Upsample 上采样帧级时长 音素帧级对齐的音素序列③ 音频模型含 [MASK] 的音频上下文填充后的完整语音这种先定时长、再生成音频的两阶段设计是理解整个 Meta-Voicebox 架构的钥匙。⏱️ 第一阶段时长模型——决定每个音素唱多久时长模型Duration Model是整个两阶段设计的起点负责解决语音合成中最关键的节奏问题每个音素phone应该持续多少帧从上图可以清晰看到输入音素序列如[SIL HH AW AA R Y UW T AH D EY SIL]Howdy, teddy!被 mask 区域标注为[M]模型可采用回归regression或 flow-matching两种方式预测时长输出逐音素的帧数序列如[1 2 3 2 2 3 2 1 1 1 3 1]随后经过Upsample 上采样把1 个音素 → N 帧展开为与音频帧对齐的帧级音素序列为下一阶段提供精确的节奏蓝图。 亮点时长模型本身也可用 flow-matching 建模使节奏预测同样具备多样性和流畅性而非固定单一值。 第二阶段Flow-Matching 音频模型——生成高保真波形Flow-Matching 音频模型承接上阶段的输出是真正画音的部分输入带[MASK]的音频上下文左侧和右侧的参考音频片段任务在音频上下文的约束下补全被 mask 的语音区域输出与上下文无缝衔接的高保真采样音频相比自回归模型逐帧猜下一个Flow-Matching 以非自回归方式并行生成整段语音这也是 Meta-Voicebox 快达20 倍的关键所在。同时它可以同时参考过去 未来双方向上下文让生成片段与前后音频平滑过渡。 一图看懂三大典型应用一个模型三种玩法得益于两阶段架构 上下文字学习的通用性Meta-Voicebox 只需调整输入 mask 的方式就能切换不同任务 降噪Denoisingmask 掉含噪声片段 → 模型按上下文擦除突发噪声️ 零样本 TTS以参考语音为上下文、目标文本为条件 → 克隆音色朗读新内容 纯文本采样整句 mask → 同一文本生成多条风格不同的语音样本 性能对比Meta-Voicebox 凭什么胜出下表展示了 Meta-Voicebox 与 VALL-E、YourTTS、A3T、Demucs 等主流方案的任务能力对比关键优势数据指标Meta-VoiceboxVALL-E词错误率WER越低越好1.9%5.9%音频相似度越高越好0.6810.580推理速度最高快 20 倍基准可以看到Meta-Voicebox 是唯一同时覆盖零样本 TTS、降噪、局部编辑和多样化采样四项能力的模型在可懂度与音色相似度上也全面领先。 快速上手与进阶学习克隆仓库git clone https://gitcode.com/gh_mirrors/me/Meta-voicebox阅读入口从 README.md 了解训练数据规模英文 60K 小时 / 多语言 50K 小时覆盖 6 种语言浏览源码核心包位于voicebox/模块可对照上文两阶段架构逐步阅读关注规划中的能力零样本 TTS、跨语言风格迁移、瞬时噪声去除与内容编辑见 README 中的 Todo 清单总结Meta-Voicebox 用时长模型定节奏 Flow-Matching 音频模型出波形的两阶段设计把语音生成变成了类似 GPT 的通用填充任务——mask 哪里就生成哪里。这套架构既带来了 20 倍的速度优势也解锁了 TTS、降噪、编辑的统一能力是当前语音生成领域值得深入研究的标杆工作。【免费下载链接】Meta-voiceboxImplementation of Meta-Voicebox : The first generative AI model for speech to generalize across tasks with state-of-the-art performance.项目地址: https://gitcode.com/gh_mirrors/me/Meta-voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考