
很多人接触 AI 漫剧是从一张惊艳的静帧图开始的。我在创作者社群里见过同一个场面有人用即梦生成一张古风角色图评论区一片惊叹然后就没有然后了。问原因回答大多是“图好出故事不好接”“人物一到下一个镜头就变脸”“配音和画面总是对不上”。这里有一个经常被忽略的事实单张图可以靠抽卡一部剧不能靠运气。AI 漫剧的全流程拆开看剧本、分镜、静帧、视频、配音、剪辑每个环节都有对应工具。但真正拉开差距的不是“会用工具”而是能不能把这六个环节串成一条稳定、可控、可复用的流水线。这篇文章我想从实操角度拆一遍这条链路。重点不是推荐哪个工具最猛而是帮你建立一套判断标准什么阶段该做什么为什么这么做以及出问题时先查哪里。1. 先搞清楚AI 漫剧真正难的不是单点工具而是流程编排1.1 为什么“教程全看了自己还是做不出来”很多新手第一次接触 AI 漫剧会先找工具教程。比如即梦怎么出图、豆包怎么写提示词、剪映怎么加字幕。单独看每一步都觉得不难可真到自己手里问题就变成一串连锁反应剧本写得像小说没有镜头感到了即梦里不知道该怎么分成静帧静帧生成了一张好看的脸但下一个场景换了个角度人物就变成了另一个人好不容易做出一段视频配音和字幕对不上剪映里来回拖也卡不出节奏。这说明一个问题教程解决的是“单点操作”而 AI 漫剧需要的是“流程编排”。单点操作解决的是“某个工具怎么用”流程编排解决的问题是“多个工具之间的输入输出如何衔接”。1.2 从“最小可交付单位”开始拆而不是从“一部剧”开始我见过最影响进度的想法是新手一上来就想做一部 30 集的完整漫剧。这个目标太宏大导致他会在剧本阶段反复修改世界观在角色设定上纠结发型和衣服结果一周过去了连第一集的镜头表都没出来。更现实的做法是先定义自己的“最小可交付单位”。我一般建议做成“一条能连续播放 30 秒到 60 秒的竖屏短片片段”包含至少 3 到 5 个镜头一个明确的小情节比如“主角发现线索起身追出去”同一角色在多个镜头里保持视觉一致有配音、字幕、简单的背景音乐和音效。这个最小单位不需要完整故事也不需要复杂转场但它必须能证明一件事你已经能把剧本、分镜、静帧、视频、配音、剪辑六段流程接起来了。能接起来后面扩到 10 集、30 集才有意义接不起来素材再多也只是素材。1.3 给流程设定质量门槛而不是等渲染完再补救平时做单张图不满意可以反复抽卡。但进入 AI 漫剧流程后每张图都要变成视频素材每个视频素材都要进剪辑轨道。如果前面的静帧风格不稳定后面到了剪映里再去修基本等于重做。所以在开始动手前可以先给流程设几个质量门槛剧本是否已经拆成了分镜表而不是一段纯文字角色参考图是否固定下来了有没有统一的角色描述静帧生成后是否已经检查过脸部、服饰、画幅、背景风格视频生成前是否已经确认运动幅度不会导致角色崩脸配音音色和口型是否能对上至少要保证情绪和字幕节奏一致。这些门槛不是“完美主义”而是为了避免返工。AI 生成工具最大的特点就是不确定性流程中的每个环节都要考虑如何把不确定性压到最低。越早发现问题修复成本越低。2. 剧本阶段用豆包把故事加工成可执行分镜表2.1 先把故事梗概变成“角色、场景、事件”三张表很多人拿到豆包之后第一句话是“帮我写一个漫剧剧本”。豆包确实能写但如果你只给它一个开放式需求它大概率会还给你一段小说式叙述里面堆满了心理描写和环境描写。这类文字拿去做 AI 漫剧基本没法用。因为在视觉生成里模型不认识“他很纠结”这种心理描写它只能识别“他在桌前皱眉手停在空中”这种画面描述。所以剧本阶段的第一步不是让豆包直接写故事而是先建立三张表角色表每个角色的姓名、年龄、基本外形、服装、标志性配饰、性格关键词场景表每场戏发生在什么地方室内还是室外古装还是现代白天还是晚上核心视觉元素是什么事件表每个镜头里角色做什么、看到什么、说什么下一步是什么。这三张表做好之后再把它们喂给豆包让它基于这些设定去展开情节。这样生成的内容不会跑偏而且后续做提示词时可以直接复用角色表和场景表里的字段。2.2 让豆包输出“分镜脚本”而不是“剧情文案”我常用的办法是给豆包一个固定输出结构。比如在对话里写请基于以下角色设定和场景设定把这一段剧情改写成分镜脚本。 每个分镜需要包含以下字段 1. 镜头编号 2. 画面内容主体、动作、表情、环境 3. 景别远景/全景/中景/近景/特写 4. 镜头运动方式固定/推近/拉远/横移/跟随 5. 人物台词 6. 画面备注视觉风格、光影氛围、情绪基调示例输入角色设定林默23岁男穿深灰色长风衣短发左耳戴黑色耳钉性格冷静。 场景设定深夜城市天台远处有霓虹灯下着小雨。 事件林默发现手机里多了一段录像内容是朋友被带走他决定追查下去。豆包生成的结果通常会更接近可执行分镜。这一步的价值在于你已经把“画面的信息结构”规定好了后面生成静帧时AI 只需要根据每个镜头去填画面即可。2.3 分镜表字段越细后面返工越少在实际项目里我会把分镜表做成一个表格字段包括镜头号、场景、景别、画面内容、角色状态、台词、字幕、时长参考、参考图编号。这里有一个非常容易被忽略的字段角色状态。比如“林默走到天台边缘”和“林默发现录像后的惊讶表情”生成出来的画面是完全不同的。如果分镜表里只写“林默在天台上”那 AI 模型大概率会自由发挥出来的图就会和你想象中的剧情脱节。下面是一个最小分镜表模板示例镜头号场景景别画面内容角色状态台词时长参考01深夜天台全景林默站在天台边缘雨丝可见冷静、思考无3秒02深夜天台近景林默低头看手机屏幕光照亮脸惊讶、紧张“这段录像……是谁发的”4秒03深夜天台特写手机屏幕显示监控画面无无2秒04深夜天台中景林默收起手机转身快步离开坚定、果断“我去找他。”3秒这个模板的好处是每个镜头都有明确的“画面内容”和“角色状态”。拿到即梦里生成静帧时不需要再临场发挥只需要把这一行信息翻译成提示词。2.4 剧本拆解时的常见问题用豆包生成分镜时最容易出现的三个问题是第一角色动作描述太抽象。AI 模型不理解“若有所思”你要写成“低着头手指不停敲击桌面眼睛看向窗外”。第二镜头和镜头之间的连续性缺失。比如上一个镜头角色还在白天下一个镜头突然变成夜晚。这通常是因为分镜表里没有写时间、光线和天气。第三台词和画面内容不匹配。人物的台词是长句子但镜头预计只有 3 秒配音根本来不及说完。这个问题最好在剧本阶段就控制住一个镜头里的台词尽量控制在 15 到 20 个字以内长句就拆成两个镜头。3. 静帧生成让即梦稳定出图的四层控制3.1 一致性不是靠“记住长相”而是靠“固定参考”很多人在即梦里生成角色图时会直接把分镜表里的“画面内容”翻译成提示词比如“一个年轻男人站在天台边缘穿灰色风衣”。生成出来大概率是“一张好看但不认识的脸”。这不是即梦不好用而是提示词的稳定性不够。AI 图像生成的底层逻辑是概率采样如果每个镜头的提示词里都少了关键约束角色就会随机漂移。想让同一角色在多个镜头里保持稳定常见手段有三种固定角色描述词把角色的五官、发型、服装、配饰写成固定字段每个镜头都复制到提示词里使用参考图功能在即梦等工具里传一张已经确定的角色图作为角色参考固定种子值生成满意的图之后记录种子值后续构图相同或相近时复用。这三种手段并不是互相替代的关系。只用角色描述词生成结果仍然会有偏差只靠参考图可能会受角度、光照影响固定种子值可以提高稳定性但不能完全控制构图。实际项目里通常是三者组合使用。3.2 正向提示词的结构化写法很多人搜索“即梦2.0 古装剧分镜词”本质上是在找一组能稳定输出古风分镜的提示词。但真正的稳定性不只来自某一句“魔法词”而是来自结构。我一般会把正向提示词写成四个部分主体描述 动作状态 环境背景 画风设定示例男性角色林默23岁深灰色长风衣黑色短发左耳黑色耳钉表情冷静 站在高楼天台的栏杆前低头看着手机手机屏幕发出冷光 深夜城市霓虹灯背景下着小雨地面有积水反射灯光 古风不对这里是现代都市悬疑风格电影感实拍质感暗色调细节丰富。注意上面示例里的“古风不对这里是现代都市悬疑风格”是提示词里的常见负向写法但在实际使用里最好直接写成“现代都市悬疑风格电影感实拍质感”不要加否定词。因为很多模型对否定词的理解并不稳定你写“不要古风”它有可能会把“古风”当成一种元素渲染进去。正确做法是直接描述你想要的画风把不想要的东西留给负向提示词或反向提示词。3.3 反推提示词和局部重绘生成一批静帧后不可能张张满意。如果发现某一张图的构图很好但脸部崩了、手部畸形或者角色衣服细节不对可以尝试的手段有先用反推提示词生成出这张图当前的完整描述再复制回正向提示词里做微调使用局部重绘功能只修改脸部、手部、背景等局部区域而不是整张重新生成保留满意的角色图生成后续镜头时作为参考图传入而不是重新想象角色长相。这些操作听起来零散但它们是保持“系列感”的重要方法。漫剧和单张插画最大的区别在于观众会看到同一个角色反复出现只要其中两个镜头里角色长相不一致整个叙事就会立刻出戏。3.4 静帧成片前的检查顺序如果生成后的画面总是出现角色不稳定、色彩不一致、构图偏出等问题建议按这个顺序排查先检查参考图参考图是否正确上传是否被误裁剪、误旋转再检查角色描述词是否每个镜头都保持了同样的核心字段然后检查环境描述光线、天气、时间段是否与分镜表一致最后检查参数分辨率、画幅比例、种子值、负面提示词是否变化。很多时候你以为是大模型抽风其实只是上一张图的参考图没传或者某个镜头复制提示词时漏了“浅灰色风衣”里的“浅”字。4. 图生视频从“一张好看的图”到“一段能用的镜头”4.1 图生视频的输入方式决定镜头叙事上限有了静帧之后接下来就是把图变成视频。市面上不少工具支持视频生成常见输入方式有三种文生视频、图生视频、首尾帧生成。在漫剧流程里我更建议大家优先使用图生视频而不是直接文生视频。原因是文生视频的随机性更大画面细节和角色长相很容易漂移图生视频至少能锁定一张已经满意的画面。首尾帧生成则适合做“角色从 A 动作到 B 动作”的过渡但参数控制相对复杂新手阶段先不用急着上。图生视频的核心目标不是让画面“动得越多越好”而是让画面“在保持角色一致的前提下动得自然”。如果输入是一张静态角色图生成视频后角色突然转头、嘴部乱晃、身体变形这条视频基本是用不了的。4.2 关键参数不是“拉满”而是“刚好”不同版本和不同工具的参数名称会略有差异但通常都涉及运动幅度、生成时长、种子值、画面比例。第一次使用时不要一股脑拉满所有参数建议先用默认值生成一条观察运动是否自然再逐步调整。几个常见判断运动幅度默认或较低值适合慢节奏镜头比如角色抬头、风吹衣角较高值适合动作戏但崩脸概率也会明显上升生成时长短片段更容易保持稳定一个镜头 3 到 5 秒通常更容易控制如果素材长度不够可以在剪辑阶段用多个镜头拼接种子值如果一条视频生成后人物崩了可以固定种子值微调提示词或运动幅度而不是完全重开。这里有一个很现实的经验与其在视频生成阶段追求长镜头不如先积累大量 3 秒左右的短镜头。原因是剪辑的本质就是切镜头短镜头之间的衔接可以掩盖很多 AI 生成的不稳定性。你不需要一个角色连续走 10 秒不崩脸你只需要让他每次出现 3 秒内不崩脸然后通过剪辑节奏让观众忽略中间的跳变。4.3 视频生成后的验收清单每次生成完视频先不要急着导入剪映。可以先建立一个检查清单角色脸部是否稳定有没有出现变形、闪烁衣物和发型的动态是否符合物理常识背景是否有突然扭曲或出现多余物体运动幅度是否符合镜头需求画面是否有明显的闪烁噪点。一旦发现某一条视频不合格直接标记为废片不要试图在剪映里靠特效修补。AI 视频的不稳定是基于画面像素层面的到了剪辑阶段很难修。4.4 批量生成时的注意点做漫剧需要视频素材量很大。批量生成视频时建议先做两条测试确认这套静帧和参数能稳定输出再开始批量。同时给每条视频命名时带上镜头编号和版本号比如S01_L03_V2方便后面排查。批量最容易出问题的环节是参考图和种子值错乱。因为有些工具的生成队列会保留上一次输入如果你没检查可能用上一张图的参考图生成了下一段视频结果角色和场景全错了。所以批量生成时每条视频后最好都检查一次“输入图是否正确”。5. 配音与字幕豆包负责“会说”剪映负责“说得像”5.1 配音工具选型和音色一致AI 漫剧里的角色只要有台词就涉及配音。现在很多剪辑软件和配音工具都支持文字转语音。豆包也常被用来做文本处理和语音合成你可以先把台词稿整理好再用配音工具生成音频。配音最核心的问题同样是“一致性”。如果你一个角色第一集用了 A 音色第二集换成了 B 音色观众会非常出戏。所以在项目一开始就要固定每个角色的音色、语速、语调。比较稳妥的流程是先录一段角色语音作为参考或者从配音工具里选一个稳定的音色把同一角色的所有台词分批生成尽量保持音色设置不变如果工具支持情绪标签可以在悲伤、愤怒、平静等情绪之间切换但不要随便更换基础音色生成音频后先和分镜表里的台词逐条核对看有没有多字、错字、重复读。另外AI 配音最忌讳“念稿感”。文字转语音生成的音频如果语速均匀没有任何停顿配合画面会非常突兀。有些配音工具支持添加停顿标记比如用逗号、句号、省略号来控制断句。不要让豆包一次性输出一大段没有标点停顿的台词要主动在台词稿里断好句子。5.2 从分镜表反推配音稿这一步很多人会做反先把配音做出来再回头去剪画面。其实更高效的顺序是先有分镜表再从分镜表反推配音稿。因为分镜表里已经写好了每个镜头的台词你需要做的是把这些台词按镜头顺序整理成一个“配音稿”然后交给配音工具生成。这样做的好处是音频长度和镜头时长能大致对得上不至于配音 10 秒但镜头只有 4 秒。5.3 剪映里的对轨与字幕音频生成后导进剪映需要和视频逐条对齐。最基础的操作是看波形图和字幕停顿点。很多 AI 配音在长句中间会有短暂停顿如果你的画面正好在停顿处切换节奏就会舒服如果画面切晚了观众会觉得拖沓切早了又会觉得配音还没说完。字幕不要手动一句一句打字剪映通常支持识别字幕或导入字幕文件。如果你的素材命名规范字幕文件也很容易批量生成。这里有一个建议字幕要作为“画面设计的一部分”来看待。字体的粗细、描边、位置会直接影响漫剧的观感。如果是现代悬疑可以用干净的无衬线字体如果是古风字体可以更有书法感。但注意字体样式要在整部作品里保持一致不要一个镜头换一种字体。5.4 背景音乐和音效的优先级很多人做完配音就急着渲染导出忽略环境音和音乐。但 AI 漫剧如果只有干巴巴的配音会显得非常“空”。我的优先级排序是第一层配音台词这是信息主体第二层环境音比如雨声、街道噪音、室内空调声第三层音效比如脚步声、关门声、手机提示音第四层背景音乐用于情绪渲染。不要四个声音全部堆在一起会让整个混音变得杂乱。剪映里音量分层要清楚背景音乐通常是垫底不要盖过配音音效要有明确的节奏点环境音只要一点点增强临场感即可。6. 剪辑交付素材进剪映之前先解决“找得到”和“排得对”6.1 素材命名与轨道分层开始剪辑前先把所有视频、音频、图片素材按照集数和镜头号归好类。即使只做一条 60 秒的短片素材也可能超过 20 个文件。如果你把它们命名为“001”“002”一旦流程出问题排查会很痛苦。推荐命名规则示例S01E03_L01_V2.mp4 S01E03_AUDIO_L01.wav S01E03_BGM_v1.mp3 S01E03_SFX_door.mp3其中S01E03代表第一季第三集L01代表镜头号V2代表版本号。这样哪怕中间修改过四五版也能一眼看出最终使用的是哪个版本。进入剪映后轨道分层建议固定为视频轨、字幕轨、配音轨、音效轨、音乐轨。不要把所有素材堆在一条轨道上。后期调整时如果没有分层你想移动某段音乐或字幕很容易误操作其他素材。6.2 字幕批量统一与风格克制剪映通常支持字幕识别但识别出来的字幕默认样式可能并不适合你的作品。建议先调好一个字幕样式再应用到所有字幕。字幕样式核心看三点字体、字号、安全边距。竖屏漫剧里字幕不要贴到屏幕边缘尤其是手机观看时容易被刘海区域遮挡。你可以保留一定的四周安全区域通常上方给标题和系统 UI下方给字幕。视觉风格上AI 漫剧本身画面已经足够“满”字幕不要再加动画、描边、阴影、彩色背景。绝大多数成熟作品的字幕风格都很克制只有关键词出现时才做强调。字幕的作用是让观众快速理解台词而不是炫技。6.3 渲染输出与平台适配不同平台对视频格式、画幅、时长要求并不相同。如果你准备把作品投放到红果这类竖屏短剧平台一定不能等到渲染完再去适配。要提前查清楚平台对竖屏比例、单集时长、字幕安全区、封面尺寸的官方要求。渲染输出时常见问题有两类一是码率设置过高或过低。过高会导致文件巨大上传慢过低会导致画面出现马赛克。漫剧画面通常以人物和字幕为主一般选择平台推荐的中高码率即可。二是输出帧率不统一。如果你生成视频时有的镜头是 24 帧有的是 30 帧剪辑导出时最好统一到一个帧率否则在手机上容易出现卡顿或不流畅。6.4 导出前的最终检查导出前建议最后看一遍时间线重点检查有没有静帧图没有替换干净的有没有音频波形超出正常范围的爆音有没有字幕错字、多字、字幕和配音不同步有没有镜头之间亮度、色调差异过大的问题有没有多余的黑帧或拖尾。这一步不要省。AI 视频项目里最难受的不是生成慢而是生成完 30 集后发现第一集里面有个镜头字幕写错了但你又不记得在哪条轨道上。所以导出前检查是最后的低成本纠错机会。7. 从自娱自乐到可交付一个 AI 漫剧制作者的工程化清单7.1 单集跑通再谈批量和接单很多人看完教程第一反应是想靠 AI 漫剧接单。我的看法是先把单集跑通。“跑通”的标准不是“我做完了”而是“我可以让另一个人按照我的流程重复做一遍结果不会差太多”。如果你的流程里每一步都靠手气那一两个镜头运气好还能看到了第 20 集你一定会被反复抽卡和重做消耗到崩溃。什么叫流程稳定就是同样一个分镜表你用同一组角色卡、参考图、提示词结构和种子控制生成出来的静帧质量在可接受范围内。稳定性的价值在单集里看不出区别在批量交付时直接决定生死。7.2 一个可复用的批量制作框架从个人创作者角度我建议把 AI 漫剧制作拆成六个阶段并在每个阶段留下可复用的文件资产项目设定角色表、场景表、画风定调、配音音色设定剧本分镜分镜表、台词稿、配音稿视觉资产角色参考图、场景参考图、风格参考图单镜头生成静帧图、视频片段、种子值记录后期合成配音、音效、背景音乐、字幕、剪辑时间线交付归档渲染视频、项目工程、素材目录、版本记录。每次完成一个小项目就把这套资产目录保存下来。下一次做新剧时不需要从零开始可以直接复用同类风格的提示词结构、角色描述模板、分镜表格式和字幕样式。这个框架真正的价值不是让你快而是让项目从“靠灵感推进”变成“靠流程推进”。灵感只负责开头流程负责把灵感变成 30 集还不崩。7.3 接单或合作时最容易出现的交付纠纷如果你已经完成了几条像样的作品开始接单或加入团队下面这些边界越早想清楚越好版权归属AI 生成的画面版权在不同平台规则下可能不统一合作前要和甲方确认成品版权、素材使用范围修改次数AI 视频最怕“先做一版然后无限次修改”。合作前明确包几次修改每次修改范围是什么素材授权第三方字体、音乐、音效是否有商用授权不要等上线后再被投诉交付格式明确交付的是剪辑后的整片还是需要同时交付工程文件和未合成素材。这不是教你规避责任而是让合作双方对结果有共同的预期。AI 视频制作仍然大量依赖人工判断和反复调试无法像流水线印刷一样保证每次输出完全一致。所以接单前先和对方确认清楚“可接受的质量标准”比盲目承诺“一定能做好”更重要。7.4 长期看哪些能力会越来越值钱工具会不断变化。今天你熟悉即梦可能下个月又出了新的模型今天你习惯用豆包整理分镜过段时间可能又有新的 AI agent 来接管一部分流程。但有几项能力不会过时第一对叙事节奏的感知。知道一个镜头应该多长、一句台词应该怎么断句、情绪该在哪里释放这是 AI 工具替代不了的。第二对流程抽象的能力。能把自己做项目的过程拆解成几个环节并为每个环节建立输入、输出和质量标准。这是从“用工具的人”到“搭流程的人”的分水岭。第三对风险的判断力。知道哪些环节容易崩哪些问题必须在什么时候检查怎么通过种子值、参考图、分镜表把不确定性降到可控范围。这种能力不是看教程能学会的必须靠实际跑完几个项目才能积累。如果你真要长期做 AI 漫剧不要只盯着新出的工具和技巧要多复盘自己做过的流程哪一步最浪费时间哪个环节返工率最高什么方法能稳定减少崩图、崩脸、音画不同步。把这些经验沉淀成自己的检查清单才是从“玩票”到“专业”的跨越。说到底AI 漫剧这个赛道真正值钱的不是一张好看的图也不是一段炫酷的视频而是一套能反复产出合格内容的流程。这套流程最好从今天这一条 60 秒短片开始。