
如果一首歌没有现成的“无人声伴奏版”但你又非常想做一个带歌词字幕的卡拉OK视频该怎么办这是很多想在 Niconico 投稿、或者自己收藏翻唱素材的朋友经常碰到的问题。本文就以 [【ニコカラ】Salt, Pepper, Birds, and the Thought Policeon/off vocal] 这类标题为例拆解从原曲音源到 on/off vocal 双版本视频的完整制作思路。你会发现制作ニコカラ并没有想象中那么神秘。它主要涉及三件事音源分离、音轨封装、字幕压制。下面会逐一展开并提供可直接复制的命令和配置。无论你是第一次接触音频处理还是已经熟悉视频压制都可以在这篇文章里找到可落地的方案。1. ニコカラ与 on/off vocal先搞清楚你做的到底是什么1.1 什么是ニコカラ“ニコカラ”是“NicoNico 卡拉 OK”的简称。简单说就是把一首歌做成适合跟着唱的影片通常包含歌词字幕、动态背景并且提供两个音轨一个是带原唱人声的版本一个是没有原唱人声的伴奏版本。观众在看视频时可以手动切换音轨选择“跟着原唱听效果”还是“只听伴奏自己唱”。这种双音轨设计是ニコカラ最核心的体验。所以你会发现很多ニコカラ标题会写上“on/off vocal”或者“off vocal 付き”表示视频里既包含演唱音轨也包含伴奏音轨。1.2 on vocal 与 off vocal 的区别on vocal音轨里包含完整的人声和伴奏适合听原曲、感受演唱语气。off vocal音轨里已经把人声去掉只保留伴奏乐器部分适合翻唱、练习、或者自己录制人声后混音。在制作上on vocal 通常直接使用原曲音轨即可。难点在于 off vocal 音轨。官方 CD 可能没有发行伴奏版尤其是同人歌曲或网络发布的歌曲想要得到“干净”的伴奏就需要自己动手处理。1.3 为什么自己制作 off vocal 有难度很多人以为去掉人声就是把中置声道消掉实际上效果很差。现代音乐制作中人声和乐器往往在频率、立体声声像上互相重叠简单的相位抵消会丢掉低频鼓点、吉他细节还会残留大量“塑料感”的伪声。所以主流方案已经变成“音源分离”用深度学习模型把音频拆成 vocals、drums、bass、other 等独立音轨再把除 vocals 之外的部分重新合成伴奏。这也是本文要重点讲解的思路。2. 环境准备与工具选型2.1 总体流程先给出一张完整流程再逐个步骤展开。获取原始歌曲音频WAV 或高质量 MP3。使用音源分离工具生成 off vocal 伴奏。准备背景画面静态图或动态视频。使用字幕工具打出歌词时间轴。用 FFmpeg 将画面、字幕、双音轨封装成最终视频。2.2 工具清单工具作用类型Demucs深度学习音源分离命令行工具UVR5音源分离图形界面桌面 GUIAudacity音频剪辑、应急去人声桌面 GUIAegisub字幕时间轴与卡拉OK特效桌面 GUIFFmpeg视频封装、音轨合成命令行工具本文的示例以 Demucs 作为主要分离工具因为它在效果和可自动化程度上比较均衡且完全免费。2.3 安装要点以 Windows Python 环境为例。安装 Demucs 需要 Python 3.8 及以上版本。python -m venv venv venv\Scripts\activate pip install demucs安装完成后验证一下demucs --versionFFmpeg 的安装则建议直接下载官方 build 包然后把ffmpeg.exe所在目录加入系统 PATH。验证方式ffmpeg -version如果你的操作系统是 macOS 或 Linux可以换用source venv/bin/activate激活虚拟环境其余命令一致。版本说明Demucs 的模型和依赖更新较快不同版本的参数名可能略有差异。如果命令报错优先查看当前版本的demucs --help。3. 核心操作一用 Demucs 分离人声生成伴奏音轨3.1 Demucs 基础命令假设我们有一个原始音频文件original.wav把它放在input目录下。执行demucs --two-stemsvocals -n htdemucs input/original.wav这里解释几个关键参数--two-stemsvocals表示只分离成两轨人声轨和伴奏轨。对于制作 off vocal这种模式非常实用。-n htdemucs表示使用高质量的混合模型。如果显存或内存不够可以换成-n demucs效果略低但更轻量。输出目录默认是separated/htdemucs/original/里面会有vocals.wav和no_vocals.wav两个文件。经过这一步你就可以拿到一个相对干净的伴奏音轨no_vocals.wav这就是 off vocal 版本的基础。3.2 使用 UVR5 图形界面如果你不习惯命令行可以使用 UVR5Ultimate Vocal Remover 5这类图形工具。流程是导入原始音频。选择分离模型常见的有 UVR-MDX-NET、Demucs 等。设置输出格式为 WAV。点击开始处理。UVR5 的好处是界面直观、参数可调适合对效果要求比较高、愿意反复试听对比的用户。但由于模型文件较大首次下载可能需要等待一段时间。3.3 Audacity 应急方案如果不想安装深度学习工具临时用 Audacity 也能应急。但需要说明的是传统效果器的分离效果通常不如深度学习模型。操作方法在 Audacity 中导入音频。选中整段音频。菜单栏选择“效果 - Vocal Reduction and Isolation”。默认参数即可试听后调整。这种方式的优点是快缺点是低频损失明显人声抑制不彻底。如果对音质要求不高只做临时试唱可以用这种方式。3.4 分离效果优化建议为了让分离效果更好有几点需要注意。第一原始音频质量直接决定结果。尽量使用无损 WAV 或高码率 MP3不要用从视频平台二次转码过的音频。第二不同歌曲风格适合不同模型。摇滚、电子乐的低频成分多有些模型会把鼓点和贝斯切掉纯钢琴伴奏的歌曲分离起来难度也不同。建议多试两个模型选出听感最自然的版本。第三分离后的伴奏不要直接使用。可以先用 Audacity 打开no_vocals.wav检查人声残留比较明显的段落再用 EQ 衰减中频段比如 1kHz 到 4kHz 区间可以进一步削弱残留的人声。4. 核心操作二准备画面与双音轨封装4.1 画面素材准备ニコカラ 视频通常使用静态插画、动态背景视频或者纯色渐变背景。如果你有图片素材图片分辨率建议不低于 1920x1080并且注意版权合规。把画面制作成视频流可以直接用 FFmpeg。以图片加背景音乐为例把一张图片bg.png循环生成画面ffmpeg -loop 1 -i bg.png -t 180 -r 30 -c:v libx264 -pix_fmt yuv420p video.mp4这条命令生成了一个时长 180 秒、帧率 30fps 的 MP4 视频。4.2 双音轨封装实现 on/off 切换在 FFmpeg 中我们可以把两个音频轨封装进同一个视频容器然后播放器允许用户手动切换音轨。这种做法的好处是文件只有一个但音轨是双份。先准备两个音频文件vocals.wav带人声的 on vocal 音轨。no_vocals.wav分离出来的 off vocal 音轨。封装命令如下ffmpeg -i video.mp4 -i vocals.wav -i no_vocals.wav -map 0:v -map 1:a -map 2:a -c:v copy -c:a aac -metadata:s:a:0 languagejpn -metadata:s:a:0 titleon vocal -metadata:s:a:1 languagejpn -metadata:s:a:1 titleoff vocal output.mp4解释一下参数-map 0:v保留视频流。-map 1:a将第一个音频流作为音轨 1。-map 2:a将第二个音频流作为音轨 2。-metadata:s:a:0 titleon vocal给音轨 1 设置标题。-metadata:s:a:1 titleoff vocal给音轨 2 设置标题。最终在支持多音轨切换的播放器如 mpv、VLC、PotPlayer中就可以按下快捷键切换 on/off vocal 音轨了。4.3 处理音画不同步音画不同步通常有三个原因原始音频长度和视频画面长度不一致。分离工具输出的音频采样率与原曲不一致。字幕渲染时间偏移。在封装前先检查音频时长ffprobe vocals.wav ffprobe no_vocals.wav如果长度不一致可以使用 apad 和 atrim 进行统一。例如把音轨统一裁剪到 180 秒ffmpeg -i no_vocals.wav -af atrim0:180,asetptsN/SR/TB -ar 44100 fixed_off.wav尽量让 on 和 off 音轨使用相同的采样率比如统一为 44100Hz 或 48000Hz这样可以避免封装时出现采样率不匹配导致的偏移。5. 核心操作三歌词字幕与卡拉OK效果5.1 时间轴与文本准备字幕对于ニコカラ 来说不是“可选项”而是必备元素。最常用的工具是 Aegisub。操作步骤新建字幕文件。导入音频作为打轴的时间参考。按空格键播放、暂停逐句记录歌词开始时间和结束时间。导出 ASS 字幕文件。打轴时注意歌词轴尽量贴合歌手换气节奏而不是贴着每个假名。卡拉OK模式中字幕会在歌唱前一点点出现通常提前 100 到 200 毫秒让观众有预备时间。5.2 卡拉OK karaoke 标签ASS 里通过\k标签实现卡拉OK逐字变色效果。一个基础示例Dialogue: 0,0:00:01.00,0:00:05.00,Default,,0,0,0,,{\k50}Salt {\k40}Pepper {\k60}Birds\k50表示前半句持续 50 厘秒。{\k...}标签会让前面的文字按照时间逐字变色。特效生成器可以自动根据假名或罗马音生成完整标签Aegisub 自带“卡拉OK模板执行器”。如果只是做“整句普通字幕”不需要逐字变色可以直接使用Dialogue: 0,0:00:01.00,0:00:05.00,Default,,0,0,0,,Salt, Pepper, Birds, and the Thought Police5.3 字体与排版建议字体选择直接影响观感。日文歌词通常使用“源ノ角ゴシック JP”或“M PLUS Rounded 1c”中文歌词可以使用思源黑体或思源宋体。注意把字体文件复制到本地后再渲染避免因系统缺少字体导致字幕变成方块。以下是一个基础样式定义示例[V4 Styles] Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding Style: Default,Source Han Sans JP Medium,72,H00FFFFFF,H000000FF,H00000000,H96000000,-1,0,0,0,100,100,0,0,1,3,1,2,80,80,40,1采用白色主色、黑色描边、半透明背景阴影在复杂画面上保持可读性。6. 常见问题与排查思路6.1 分离后的伴奏人声残留严重问题现象常见原因解决思路伴奏里还能听到歌手声音模型能力有限或参数不当换用 htdemucs 模型用 Audacity 中频 EQ 衰减 1k-4kHz检查原始音频是否为单声道单声道音源分离难度大于立体声因为深度学习模型依赖立体声声像信息。如果原始音频是单声道建议先用 AI 工具做母带级立体声扩展再分离。6.2 分离后伴奏音质发闷问题现象常见原因解决思路鼓点、镲片、高频细节丢失模型剔除了过多中高频成分对比不同模型只衰减人声频段而非整段丢弃适当提升高频 EQ音源分离本质是“取舍”的过程不可能做到百分百无损。追求绝对音质时需要人工 EQ 补偿。6.3 封装后音画不同步问题现象常见原因解决思路开头正常越到后面越偏音频采样率不一致统一使用 44100Hz 或 48000Hz用 ffmpeg 先标准化音轨采样率另一种情况是分离工具输出的 WAV 带有微小延迟偏移可以把 vocal 轨和 no_vocals 轨在 Audacity 中对齐到采样级。6.4 视频中有两个音轨但播放器无法切换问题现象常见原因解决思路播放器只播放音轨 1播放器不支持多音轨切换使用 mpv、VLC、PotPlayer检查音轨 title 元数据是否正确7. 工程建议与版权提醒7.1 文件命名与工程管理制作过程中会产生大量中间文件建议采用以下目录结构project_root/ ├── input/ │ └── original.wav ├── separated/ │ ├── vocals.wav │ └── no_vocals.wav ├── subtitle/ │ └── lyric.ass ├── video/ │ └── output.mp4 └── script/ └── build.bat这样做的价值在于当某个步骤出错时你可以快速定位中间产物不用重新跑一遍完整流程。尤其是音源分离非常耗时保留中间文件可以节省大量时间。7.2 音频标准化在封装之前建议对 on vocal 和 off vocal 做响度标准化。否则当用户从“带人声”切到“无人声”时听到的音量会突然变化体验很差。使用 loudnorm 滤镜统一响度ffmpeg -i no_vocals.wav -af loudnormI-16:TP-1.5:LRA11 loud_no_vocals.wav建议 on 和 off 轨都执行同样的响度处理效果更好。7.3 版权与投稿合规这是必须认真对待的部分。音源分离只建议用于个人学习、练习和二次创作不要用于商业用途。在 Niconico 或其他平台投稿时需要确认歌曲版权方是否允许二次创作和伴奏编辑。许多同人歌曲有明确的“翻唱/二次创作许可”说明。如果你的视频包含非原创插画需要确认插画作者的转载和使用许可。投稿时应标注是否使用了 AI 音源分离工具以及歌曲的原始出处避免误导观众。一句话总结技术可以做得到不代表版权上可以随便用。投稿前多花几分钟确认授权是对自己负责也是对原作者负责。8. 总结这篇文章围绕一个典型的ニコカラ 制需求完整讲解了 on/off vocal 双音轨视频的制作链路。你掌握的关键技能包括使用 Demucs 等工具进行 AI 音源分离生成干净伴奏。使用 FFmpeg 将画面和双音轨封装为一个视频文件。使用 Aegisub 制作卡拉OK字幕提升跟唱体验。掌握常见的音质、同步、残留问题排查方法。如果后续想进阶可以继续学习 Aegisub 的卡拉OK模板执行器编写自己的逐字变色效果也可以研究 Demucs 的自定义训练模型针对特定歌手的音色做更精细的分离。重要的是先跑通这条流程之后遇到类似的曲子你的处理速度会快得多。