AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通

发布时间:2026/8/14 7:25:01
AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通 AI视频剪辑实操教程看懂语义的剪口播Agent从装环境到出成片一次跑通【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills你有没有过这样的经历录了二十分钟的口播剪的时候光是为了删掉嗯啊那个和说错重录的句子就耗掉一整晚。用剪映的智能剪口播它只认字不认意思——同一个词换个说法它就漏掉自动识别的字幕里专业名词错得一塌糊涂还得手动一条条改。如果你正在被这类问题折磨这篇文章介绍的项目正好对症。chengfeng-videocut-skills是一个基于 Claude Code Skills 构建的 AI 视频剪辑 Agent。它不靠模式匹配剪片而是真正理解视频里说了什么能认出哪些是重复句、哪些是说到一半改口的残句、哪些是口误后重说的正确版本字幕也能用自定义词典把技术名词改准。本文用一条完整的使用路径带你从装环境走到导出成片。开工之前先搞清楚这个项目长什么样项目把剪辑拆成四个互相独立的技能Skill各自只干一件事像流水线上的四个工位技能负责的事产出物剪口播找出口误、重复、残句出删词清单人工复核过的删词账本不切媒体字幕用词典和文稿改准专名按句分屏subtitles.json画面在画面上盖标注、动画、推近效果visuals.json HTML 模块导出把剪辑、字幕、画面一次烧进视频成片.mp4这种拆分的好处是每一步的产物都是可检查的中间文件而不是一上来就咔一刀剪下去。剪口播这一步尤其反直觉——它从头到尾不碰视频文件只产出一份删词账本等你审完、确认了才轮到导出去真正执行剪切。第一步把环境装起来约10分钟项目目前支持macOS 和 Windows 10/11。先拉取仓库到本地git clone https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills机器上需要预先装好四样东西缺任何一个首次运行都会在对应环节明确停下不会静默跳过依赖用途版本要求Bun运行剪辑产品本体≥ 1.2Node.js跑就绪检查脚本近代版本即可ffmpeg剪辑与导出≥ 6含 ffprobeGoogle Chrome渲染字幕和动画桌面版macOS 用 Homebrew 一把装齐Windows 用 winget# macOS brew install oven-sh/bun/bun node ffmpeg # Windows装完新开一个终端PATH 才生效 winget install Oven-sh.Bun OpenJS.NodeJS.LTS Gyan.FFmpeg Google.Chrome云端转录还需要火山引擎的 API Key配置方式node scripts/videocut-cli.cjs config set transcription.apiKey 你的key装好依赖后对 Agent 说一句安装剪辑环境它会自动完成就绪检查确认 skills 是否最新、Runtime 是否配套缺什么补什么全程有 SHA-256 校验不会从漂移的latest版本乱装。首次安装需要等几分钟下载运行时属于正常现象。第二步剪口播——先出账本不动媒体这是整个项目最核心的能力。对 Agent 说使用剪口播处理这条视频。识别口误等我审核后再物理剪切并生成剪后字幕。它的内部流程可以概括为七步一线每一步都有明确产出物没出表就不算完成建档接受本地真实视频云端逐词转录建项目启动常驻服务修字用词典把转录听错的字改对先出修字表给你看删词把播放顺序完整读五遍每遍只盯一类问题汇总把五轮的判断合并成两张表删词汇总表 重复句子表审核把表呈给你打开审核页让你亲自复核复盘对比你的修改和 AI 的提案把口味差异沉淀进偏好文件其中五轮扫描是语义理解的关键每轮只带一个判据判断质量远高于一次带六个轮次找什么例子第1轮重复句间/句内这个功能呢连说两遍第2轮残句与改口说一半断掉换个说法重说第3轮口误重说数字、专名说错后重说对的第4轮英文卡壳词头、字母、音节重复第5轮口头禅与语气词按你偏好的密度来删一个值得记住的原则是**删前保后**后说的内容通常更完整所以重复和改口默认保留最后版本。相邻两句开头有至少 5 个字相同自动判定为重复并删前句。长句、整句、分叉重说这类高风险项一律标记为高优先级让你重点听。实战案例一段 19 分钟的口播原素材系统自动识别出 608 处问题114 处静音 494 处口误/重复生成可视化审核页面你确认后执行剪辑最终成片只有 72MB附带专业级字幕文件。第三步字幕——不重新转录用词典改字很多工具的AI 字幕就是重新听一遍剪好的视频既花钱又慢而且专名照样错。这个项目的字幕思路完全不同它直接用剪口播时已有的逐词稿 删词账本算出每个词在成片里的时间不需要再送一遍 ASR。改字分两级词典这个说话人固定的写法不看上下文直接改改完列清单。比如叉就是X大模型就是大模型文稿作者手上有稿子时才用逐处要证据对不上的报不敢定绝不瞎猜——因为名字写错比听错更糟改完字就分屏一个标点一段、一屏一行和剪口播的分段粒度完全一致。太长的句子均摊拆屏碎片屏自动合并但不跨句号并避免两句糊在一起。第四步画面——给口播配上会动的分镜这一步给剪好的口播盖视觉层圈重点标注、整屏动画、推近效果。层是 HTML 模块绑定在字幕屏上由播放器逐帧驱动你在预览里直接能看到效果。项目自带一套小黑漫画风格的 SVG 动效模板把生图拆解成可控的 SVG 层传送带、纸张、箱子、断点都能单独动适合演示类口播的步骤可视化。配画面的判断逻辑很克制并不是每段都要加东西画面正好是正在讲的东西 → 圈住标注说到哪个词圈哪里画面空白或弱相关 → 用整屏动画补画面自己足够清楚 →不动这是最常见的正确答案第五步导出——所有图层一次烧进 mp4导出是链条最后一段也是唯一真正画出像素的地方。先跑--dry-run看计划片长、帧数、字幕屏数、画面层数、输出尺寸数字不对就是上游有问题别等编码十分钟后才后悔。确认无误后正式导出剪辑、推近、字幕、动画层一次全部烧进视频。这里有个容易被忽略的常识源片分辨率是天花板放大不会变清楚。源宽超过 2560 就直接用原分辨率如果源片是 960×720 这种低清录屏优先去录屏工具里找同一次录制的高清导出——换源比任何后期都管用而且因为音频逐位相同换源后词稿、账本、字幕、画面层全都不用动。常见问题与避坑指南Q1云端转录超时怎么办检查上传环节的网络连接是否稳定。转录服务是云端的网络波动会直接导致超时。Q2审核网页打不开先查端口是否被占用。可以用lsof -i :8899macOS检查找到占用进程处理后重试。Q3剪完音画不同步系统底层用filter_complex trim技术保证时间轴精确对齐如果出现不同步多半是 ffmpeg 版本过低升级到 6.0 以上。Q4Runtime 装不上怎么办把 Agent 的报错原文整理后走上报 Bug技能提交。注意Runtime 缺失时绝不能让 Agent 自己手搓一个审片台网页来顶替——真实发生过一次Agent 手制的界面与产品账本格式完全不兼容等于白做一遍。这个项目明确要求产品不可用时停止就是停止。Q5剪辑结果总是不合我心意这是项目最值得称道的自进化机制。你在审核页里的每一次恢复、补删都会被记录进偏好文件口味差异写进cut-preferences.md专名错误补进词典规则空白记进待升级判例。下次剪辑AI 就会按你的风格来。动手之前先准备好这三样东西通读全文后你会发现这个工具的核心设计哲学是判断与执行分离AI 只负责理解和判断物理剪切永远等你确认。这既保证了安全也让每一刀都有据可查。现在就可以开始你的第一次尝试动手前请先确认一台 macOS 或 Windows 10/11 的机器Bun、Node.js、ffmpeg、Chrome 四样依赖齐备一个火山引擎 API Key用于云端逐词转录一段你自己的口播原素材最好是清晰、单人的首次体验效果最佳然后对 Agent 说安装剪辑环境完成就绪检查再喊一声剪口播剩下的交给它。剪完记得在审核页多看几遍——重点看 AI 标记为高风险的条目那是它自己都拿不准的地方也是你作为人的价值所在。【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考