Amphion 预训练 HiFi-GAN 语音声码器使用指南:下载、目录结构与源码解析

发布时间:2026/10/2 13:25:48
Amphion 预训练 HiFi-GAN 语音声码器使用指南:下载、目录结构与源码解析 音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载Amphion/æmˈfaɪən/是面向音频、音乐与语音生成的可复现研究工具包其声码器Vocoder模块负责将梅尔频谱等声学特征还原为可听波形。本文围绕仓库中发布的hifigan_speech预训练 HiFi-GAN 语音声码器展开讲解如何下载并正确部署该模型、其网络结构与训练配置的源码级细节以及在 Amphion 中调用它完成波形重建的完整操作路径。模型概况hifigan_speech预训练权重Amphion 官方在pretrained/hifigan/README.md中发布了面向通用语音的 HiFi-GAN 预训练模型hifigan_speech。其核心信息如下模型标识hifigan_speech托管平台HuggingFace 平台的amphion/hifigan_speech_bigdata模型仓库训练数据VCTK LibriTTS LJSpeech 三个开源语音数据集据 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的说明该 HiFi-GAN 检查点使用约685 小时语音数据训练而成是 Amphion 在语音声码器方向发布的标准预训练权重。它不绑定某个特定下游任务而是作为通用语音波形生成器可服务于文本转语音、语音转换、歌声合成等各类流水线的最后一级。下载与部署目录结构要求与仓库内其他预训练依赖如 BigVGAN、DiffWave一致hifigan_speech同样以「整目录落盘」的方式使用。pretrained/README.md 给出了明确要求需要将hifigan_speech整个文件夹下载并放入Amphion/pretrained/hifigan目录最终目录结构如下Amphion ┣ pretrained ┃ ┣ hifigan ┃ ┃ ┣ hifigan_speech ┃ ┃ ┃ ┣ log ┃ ┃ ┃ ┣ result ┃ ┃ ┃ ┣ checkpoint ┃ ┃ ┃ ┣ args.json其中checkpoint目录存放模型权重与训练中间产物args.json记录该次训练使用的全部超参数是推理时恢复模型结构的关键依据log、result分别存放训练日志与过程中的合成样本。注意必须保持「文件夹套文件夹」的完整结构pretrained/hifigan/hifigan_speech/...不要只把权重文件单独拷出否则 Amphion 在按路径加载预训练声码器时可能无法定位args.json与checkpoint。网络架构源码解析HiFiGAN 生成器实现Amphion 对 HiFi-GAN 生成器的实现位于 models/vocoders/gan/generator/hifigan.py核心类是HiFiGAN第 150 行起。从源码结构看其前向计算分为四个阶段对应forward方法第 202-218 行输入投影conv_pre将cfg.preprocess.n_mel维的梅尔谱经一个核大小为 7 的 Conv1d 投影到upsample_initial_channel通道默认 256多级转置卷积上采样按upsample_rates默认[8, 8, 4]总上采样倍率 256逐级用ConvTranspose1d提升时间分辨率每一级通道数按upsample_initial_channel // (2 ** (i1))递减多感受野残差块每个上采样级之后并联num_kernels默认 3个残差块ResBlock1/ResBlock2不同残差块使用不同的核大小与膨胀率以捕获多尺度波形细节输出取各分支平均输出整形conv_post将特征压缩回单通道经tanh输出最终波形。此外生成器对卷积层使用weight_norm并在第 145 行提供remove_weight_norm方法——这正是 HiFi-GAN 推理阶段「移除权重归一化以降低开销」的标准做法。该实现完全对齐经典 HiFi-GAN 的「多感受野融合 周期/尺度判别器对抗训练」设计。训练配置参数对照exp_config.jsonAmphion 为 HiFi-GAN 提供了开箱即用的训练配置 egs/vocoder/gan/hifigan/exp_config.json其model.hifigan字段与上述源码逐项对应model: { generator: hifigan, hifigan: { resblock: 2, upsample_rates: [8, 8, 4], upsample_kernel_sizes: [16, 16, 8], upsample_initial_channel: 256, resblock_kernel_sizes: [3, 5, 7], resblock_dilation_sizes: [[1, 2], [2, 6], [3, 12]] } }各参数在源码中的实际作用如下resblock选择残差块类型1使用 ResBlock1、2使用 ResBlock2hifigan.pyupsample_rates/upsample_kernel_sizes成对驱动各级转置卷积zip遍历见第 168-173 行乘积 8×8×4256 即梅尔谱帧率到采样率的放大倍数upsample_initial_channel决定conv_pre的输出宽度与各级通道衰减的基数第 156-184 行resblock_kernel_sizes/resblock_dilation_sizes与残差块数量一一对应len值被记为num_kernels直接决定并联残差分支数第 154-155 行。配置同时指定了预处理只提取梅尔谱与原始音频extract_mel/extract_audio训练损失项包含feature、discriminator、generator、mel四类——其中mel损失保证了波形重建后梅尔域的重构一致性。结合 egs/vocoder/gan/README.md 可知HiFi-GAN 是 Amphion GAN 声码器家族的一员判别器侧支持 MSD多尺度、MPD多周期、MS-STFTD 等多种选择。在 Amphion 中使用加载与推理预训练hifigan_speech的直接用途是作为声码器完成最终波形合成。Amphion 的 GAN 声码器流水线egs/vocoder/gan/README.md分为数据准备、特征提取、训练、推理四步其中推理通过 egs/vocoder/gan/hifigan/run.sh 的--stage 3触发底层调用 bins/vocoder/inference.py。脚本支持三种输入模式sh egs/vocoder/gan/hifigan/run.sh --stage 3 \ --infer_mode [infer_from_dataset|infer_from_feature|infer_from_audio] \ --infer_datasets libritts vctk ljspeech \ --infer_feature_dir [预测声学特征目录] \ --infer_audio_dir [音频目录] \ --infer_expt_dir Amphion/ckpts/vocoder/[YourExptName] \ --infer_output_dir Amphion/ckpts/vocoder/[YourExptName]/resultinfer_from_dataset从数据集直接读取梅尔特征合成infer_from_feature输入自备的mels/*.npy声学特征目录适合接在 TTS/VC 等模型的预测特征之后infer_from_audio输入 wav 文件做快速分析-重合成验证。若直接以官方预训练权重作为声码器可将--infer_expt_dir指向pretrained/hifigan/hifigan_speech该目录下含checkpoint与args.json符合加载约定。此外若需在已有检查点基础上继续训练或微调可参照 egs/vocoder/gan/tfr_enhanced_hifigan/README.md 的用法用--resume_type resume恢复全部训练状态或--resume_type finetune仅加载模型权重配合--checkpoint指定断点路径。使用注意事项默认CUDA_VISIBLE_DEVICES0多卡训练/推理时通过--gpu 0,1,2,3指定多进程训练默认主端口29500冲突时用--main_process_port调整预训练模型面向「语音」领域VCTK/LibriTTS/LJSpeech若任务域差异较大如歌声建议参照 tfr_enhanced_hifigan 等方案在目标数据上微调后使用模型托管于 HuggingFace 的amphion/hifigan_speech_bigdata仓库下载时务必保留hifigan_speech文件夹的完整内部结构。小结hifigan_speech是 Amphion 面向通用语音发布的高质量预训练 HiFi-GAN 声码器约 685 小时语音数据训练覆盖 VCTK、LibriTTS、LJSpeech。通过本文介绍的下载目录规范放入pretrained/hifigan/hifigan_speech、源码级参数理解upsample_rates、resblock_kernel_sizes等与三种推理模式读者可以在自己的 TTS/VC 流水线中直接复用该模型完成梅尔谱到波形的重建或基于其权重在目标数据上进行微调。赞分享音频语音媒体生成深度学习【免费下载链接】AmphionAmphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support reproducible research and help junior researchers and engineers get started in the field of audio, music, and speech generation research and development.项目地址https://gitcode.com/GitHub_Trending/am/Amphion点击查看免费下载相关推荐Amphion 中 DiffWave 扩散声码器预训练模型下载、目录组织与源码级应用指南Amphion 中 DiffWave 扩散声码器预训练模型下载、目录组织与源码级应用指南 导读 本文围绕 Amphion 官方 DiffWave 预训练模型展音频语音媒体生成深度学习如何快速掌握HiFi-GAN声码器从安装到语音合成的完整指南如何快速掌握HiFi GAN声码器从安装到语音合成的完整指南 HiFi GAN是一款基于生成对抗网络GAN的高效高保真语音合成工具能够快速生成自然流畅的esp-iot-solution 组件 adc_mic 实战指南基于 ADC 连续采样实现模拟麦克风录音esp iot solution 组件 adc_mic 实战指南基于 ADC 连续采样实现模拟麦克风录音 导读 本指南围绕 esp iot solution音频语音媒体生成深度学习上一篇Dexed FM合成器完全指南从零开始掌握专业级音色设计下一篇开源电子签名平台如何用DocuSeal和Documenso告别昂贵的SaaS订阅创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考