AI漫剧制作全流程拆解:从零基础到接单的实战教程

发布时间:2026/9/18 1:07:18
AI漫剧制作全流程拆解:从零基础到接单的实战教程 AI漫剧这四个字,最近在短视频平台和各类接单群里出现的频率越来越高,有朋友一上来就问现在做这个到底还能不能赚钱零基础是不是真的能学会。我年初开始系统研究AI漫剧制作,当时纯粹好奇AI生成图片能不能变成连贯的剧情短视频,结果一跑通就发现,这已经是一条相当成熟的流水线:剧本、人物设定、分镜绘图、图生视频、配音、剪辑,每个环节都有对应的AI工具可以落地,甚至比传统动画制作省掉了几十倍的人力成本。这篇教程,我把自己反复跑过几十遍的完整AI漫剧工作流、工具组合、参数设置、翻车记录全部拆开揉碎讲清楚,零基础也能跟着一步步复现,学完确实可以直接上手接单。我会尽量用大白话讲,涉及工具的地方尽量说清楚为什么选它不选它的理由,方便你根据手里的硬件和时间做自己的取舍。1. 先搞清楚AI漫剧的生产逻辑,再动手不迟1.1 AI漫剧的核心逻辑先给没接触过的人一句话解释:AI漫剧就是用AI工具批量生成漫画风格的静态画面,再通过图生视频、镜头运镜、配音和剪辑,组成有剧情、有对话、有情绪起伏的连续短视频。它和传统动画最大的区别在于,传统动画需要逐帧手绘或者绑定骨骼做补间,而AI漫剧的主画面是画出来的一张图,动态只是在这张图上做的局部运动、镜头推拉和角色动作辅助。这意味着什么?意味着产量可以很夸张。传统动画一分钟可能要几百张原画,AI漫剧一分钟也许只需要6到10张高质量分镜图,动态交给视频模型去补。制作周期从几周压缩到一到两天,成本也大幅下降。这也是为什么很多做小说推文、短剧推广的团队开始转做AI漫剧——它天然适合平台分发,漫画风格自带视觉吸引力,又有短剧的剧情钩子。做AI漫剧前,你得先接受一个现实:它的审美上限取决于你的分镜意识和提示词控制力,而不完全取决于AI模型本身。同一个工具,有人做出来像PPT翻页,有人做出来有电影感,差别就在前面几个环节的功夫。所以这篇教程不只是告诉你点哪个按钮,还会告诉你每个节点我在想什么、为什么这么设置。1.2 一套完整工作流的全景预览我把整个AI漫剧生产拆成六个环节,你可以把它当成一条流水线:剧本和分镜脚本 → 人物设定与一致性控制 → 分镜画面生成 → 图生视频与动态化 → 配音和音效 → 剪辑、字幕和导出每一个环节都有对应的核心工具,而且都有很多替代品。整个流程跑熟之后,单集1到3分钟的漫剧,我的平均制作时间是6到10个小时。这不是我有多厉害,而是流程固定之后,大部分时间其实花在选图和等渲染上,真正的手工操作占比不高。1.3 适合谁学、不适合谁学先说适合谁:有一定网感、愿意研究提示词的人,做过短视频剪辑的人,做过小说推文的人,想低成本试水短剧赛道的个人或小团队,还有美术基础薄弱但审美在线的人。AI漫剧最吃的是审美而不是画工,你能判断画面好不好看、剧情节奏对不对,这比会画画重要得多。不适合谁:完全不想学提示词、只想全自动生成的人。市面上确实有一键生成工具,但那种工具生成的东西千篇一律,接商单基本过不了甲方那一关。想靠这行吃饭,至少要能控制人物一致性和画面风格,这两件事绕不开,也不难,但必须花点心思。2. 全套工具选型,我只留下这些工具选择是新手最容易蒙圈的地方,因为市面上的AI工具太多了,而且迭代速度极快。我这套组合不是唯一答案,但保证是我实测下来稳定、免费或低价可用、能跑通从剧本到成片全流程的方案。2.1 剧本工具:大语言模型是主力剧本环节我会先让大模型出框架,再人工打磨。推荐按优先级排序:DeepSeek、ChatGPT、Claude,三者选一即可。如果你在国内网络环境下使用,DeepSeek的性价比和可用性都很高,足够完成剧本初稿、分镜脚本、旁白文案、甚至提示词生成这些任务。实操中我的习惯是让模型一次输出四样东西:剧情大纲、单集脚本、分镜表(包含镜头号、景别、画面内容、旁白、对白、音效)、以及每一镜的绘图提示词。这四样是串联后面所有环节的基础数据,写得好能省后面一半功夫。2.2 绘图工具:Midjourney、即梦和SD系画面生成是AI漫剧的重头戏,工具选择直接影响画风和上限。我经常混用三套:Midjourney:画面质感最稳,漫画、国风、厚涂、日漫风格都能驾驭。配合--cref参数可以做角色一致性参考,配合--style参数可以稳定风格。缺点是需要付费,但现在体验门槛也不高。即梦(Jimeng):字节系工具,国内直接可用,图生视频一体化很方便,对中文提示词理解好,生成人物也比较精致。Stable Diffusion(WebUI或ComfyUI):适合要精确控制人物一致性、要训练LoRA的老手。学习曲线最陡,但上限也最高。如果你是完全新手,我建议从即梦Midjourney组合开始,先跑通流程,等熟悉了再研究SD和LoRA。别一上来就扎进ComfyUI的工作流里,容易劝退。2.3 图生视频工具:动态化的关键图生视频是把静态分镜变成动态镜头的环节。我目前主力用的是即梦的可图视频模型和可灵。这两个工具在画面动态幅度、人物动作稳定性、镜头控制上都表现不错。Vidu、Runway、Pika我也试过,可以把它们当作备选。选图生视频工具的核心指标是:人物变形是否严重、运动幅度是否可调节、画质损失大不大、是否需要排队。实测下来,国内这几款在中文语义理解上有优势,出图也更符合国内短视频受众的审美。2.4 音频工具:配音和音效旁白和对白我目前用剪映自带的朗读功能或者魔音工坊,前者方便快捷,后者音色更多。BGM直接在剪映曲库里选,音效也用剪映自带素材库。如果你要更高质量的AI配音,可以试试ElevenLabs,情感表现力很强,但中文音色和价格就见仁见智了。2.5 剪辑和导出工具剪辑我是剪映Premiere混用。剪映用于粗剪、字幕、BGM和快速导出,特别适合新手;Premiere用于精细调色、关键帧和更复杂的转场。导出参数我一般用H.264,码率拉到8Mbps以上,分辨率按平台要求,抖音快手视频号一般是1080P竖屏9:16。先记住这个工具组合,后面每个环节我都会展开讲用法。3. 从剧本到人物生成,手把手实操这节是全文的核心,我会按真实制作顺序一步步走,同时把踩过的坑、调过的参数都写出来。3.1 第一步:用大模型高效产出剧本和分镜脚本写剧本的第一步不是让AI自由发挥,而是给它搭好框架。你给模型的上下文越具体,它输出的东西越能直接用。我最常用的提示词模板是这样的:你是一名擅长抖音/快手短剧的编剧,请创作一部 [题材] 漫剧。 要求: 1. 每集时长控制在1到3分钟,总集数20集。 2. 每集结尾设置一个强钩子,引发追更欲望。 3. 主角人设要鲜明,有辨识度,方便画面统一。 4. 输出格式:剧情梗概 → 分集大纲 → 第一集完整脚本。 5. 第一集脚本中,请用表格列出分镜:镜头号、景别、画面描述、旁白、对白、音效。用这个模板,DeepSeek基本一次就能给出能用的结构。拿到之后不要直接开工,你要人工调整剧情节奏:开头3秒必须出现冲突或悬念,每15到20秒一个小高潮,结尾留钩子。这是短视频漫剧和传统影视编剧最大的区别,节奏密度要高得多。接下来把第一集脚本分镜表再细化。举个例子,有一集古风玄幻剧本,我拿到之后手动补充了这些标注:开头穿越镜头用全景,展示环境;女主抬头用特写,强调眼神;打斗场景用中景和快切;男主回头用缓推镜头。这些景别和运镜信息,后面会直接翻译成绘图提示词和图生视频的运动控制。分镜表完成后,顺手让大模型根据分镜内容生成一批绘图提示词,但我一般只把AI生成的提示词当底稿,因为AI容易把画面描述得过于饱满(元素堆太多),反而影响后期图生视频的动态效果。后面我会讲提示词的删减原则。3.2 第二步:人物设定和一致性控制的几种方案AI漫剧最怕的就是角色变脸,上一秒男主还是剑眉星目,下一秒变成路人甲,观众直接出戏。控制人物一致性,我按难度从低到高有四种方案:方案一:固定参考图法(最简单)。先在即梦或Midjourney里生成一张你满意的角色全身或半身立绘,把它作为后续所有分镜图的参考图,每次生图时以图生图方式上传,配合保持人物特征不变,改变构图和表情的提示词。这个方案能保证七八成相似度,适合新手。方案二:Midjourney的--cref参数。MJ较新版本支持角色参考,在同一角色ID下生成多张不同姿态和场景的图片,相似度很高。用法是在提示词末尾加上--cref [图片链接],可以再加--cw 100控制相似度权重。这个方案我强烈推荐,适合日漫、韩漫风格的漫剧。方案三:训练SD的LoRA模型。如果你要用Stable Diffusion精细控制人物,就要准备同一角色不同角度和表情的20到30张训练图,用kohya或秋叶包训练一个专属LoRA。训练完成后,任何基于SD的界面都能通过触发词稳定生成同一角色。这套方案上限最高,但学习成本也最高。方案四:用可灵或即梦的角色参考功能做图生视频时锁定角色。这个方案适合动态镜头比较多的情况,因为先生成视频,再用视频中的某一帧反推成图,可以减少跨工具的误差。无论用哪种方案,我都强烈建议在第一步做一份角色设定表,包括姓名、性别、年龄、发型、发色、瞳色、服装颜色和款式、配饰、气质关键词。这张表既给AI提示词使用,也给甲方审核用,还能在你手忙脚乱时防止人设漂移。3.3 第三步:生成高质量分镜图的关键参数与提示词模板分镜图生成是整个流程里最影响观感的一环。我总结了一条可复用的提示词公式:画风 内容主体 环境背景 镜头景别 光影氛围 画质词 负面提示词以古风漫剧第一镜为例,我当时的提示词是这样的:国漫唯美厚涂风格,一位身着白衣的古装男子站在竹林深处,背影侧身回眸,墨色长发,眼神凌厉,背景是青色竹影和雾气,全景镜头,电影级光影,细节精致,8k画质负面提示词统一为:模糊、低清、多余手指、畸形手、变形脸、多余肢体、噪点、水印、文字。在即梦里,我会把画风提示词固定成一段风格描述复制到每个画面,保证整体统一。在Midjourney中,我会用--style raw降低默认美化过度的问题,再用--v 6或更新版本保证质量,最后统一--ar 9:16。这里提醒几个我踩过的坑:不要在分镜图里写中文字,AI生成文字经常会变成乱码,后期需要字幕的话用剪辑工具叠加就行。画面里元素别塞太满。AI会把所有提示词都画进去,如果你同时要竹林、云雾、白衣、古琴、月光、飘落的花瓣,最后画面可能乱成一锅粥。留白越多,图生视频的动态效果越舒服。人脸特写要控制数量。AI生成半身和特写时人脸崩坏概率低,但全身照的辨识度会下降。我常用的策略是:交代环境用全景,情绪表达用特写,对话场景用中景,情怀画面用背影或侧脸。3.4 第四步:图生视频,让静态图动起来拿到满意的分镜图后,进入图生视频环节。这里要明确一个概念:AI图生视频不是万能动画生成器,它更适合做小幅度的镜头运动、人物局部动作、衣物和头发飘动、光影变化。大幅度的跑跳、复杂的交互动作,目前很容易出现物理不合理和角色变形。所以制作分镜时就要有意识地为动态留好接口。比如人物站在风中的画面,头发和衣摆有飘动空间;人物回眸的画面,头部转动幅度小但情绪足;镜头推近的场景,主体在画面中间,避免边缘变形。具体到工具操作,我以即梦的图生视频功能为例:上传分镜图后,设置视频时长3到5秒,运动幅度选择中,输入动作提示词,比如人物慢慢转头,竹林轻微摇动,镜头缓慢推进。等到生成结果后先检查物体变形情况,如果不满意可以微调运动幅度重新生成,或者裁剪视频首尾。可灵的操作类似,但它对提示词的响应更细,可以根据人物动作添加人物的手缓缓伸向前方,眼神凝视镜头这类描述。不过可灵目前有时长和分辨率限制,生成前注意看任务配置。另外图生视频我通常不会只生成一次,而是同一镜头生成2到3个备选,最后在剪辑时挑选最自然的那个。这一步比较费时间,但效果差距很大。3.5 第五步:配音、字幕、BGM与剪辑导出配音我现在的习惯是:旁白优先用剪映的解说类音色,质感稳定;角色对白根据人物性格选不同音色,让每个角色有辨识度。同步方式很简单,先根据分镜表里的旁白对白文案,在剪映文本朗读里逐条生成音频,再拖到时间轴对应位置。如果看到某一句话的时长超出画面,就手动删减文案或者拖动音频对齐。音效和BGM我通常在剪映曲库里搜关键词,比如悬疑古风打斗紧张温馨,先铺一层低音量BGM,再在关键节点添加音效(打斗声、风声、脚步声、环境音)。BGM音量我一般压到对白音量的20%到30%,不然容易盖住人声。字幕可以用剪映的智能字幕一键识别,但AI识别偶尔有错别字,导出前一定要整体过一遍。片名、集数、作者信息用文字模板加上,比较省事。导出参数这块,平台发布我一般选1080P、30帧、码率自动或拉高一点,格式MP4。如果你要接商单交付,记得多导出一份无字幕纯净版,方便甲方自己加字幕或二创。4. 跑通一个完整案例:从脚本到成片的详细记录光说不练假把式,这里我完整复盘一个真实做过的案例,帮你把每个环节串起来看。4.1 案例需求:古风玄幻漫剧第一集选题是我和一个做短剧MCN的朋友聊出来的,风格参考国漫《眷思量》和《斗破苍穹》的高质感方向,受众是18到30岁喜欢玄幻题材的短视频用户。第一集的目标是3分钟以内,开场抓人,结尾留钩子。我在DeepSeek里输入前面那个编剧模板,题材填穿越重生复仇打脸,让它输出完整脚本。初稿出来后,我手动把前5个分镜改成了更快的节奏:第一镜直接给男主角满脸伤痕被扔下悬崖的画面,第二个分镜切换到女主角发现信物,第三个分镜插入三年前被羞辱的闪回,第四个分镜才进入主线,这样开头10秒就有冲突和悬念。分镜脚本部分,我列出了12个镜头,并且为每个镜头填写了:场景描述、景别、画面关键词、旁白或对白、预期时长。有了这个表,你就可以进入绘图阶段。4.2 绘图与人物一致性实操记录我先用Midjourney生成了男主角的设定图。提示词大概长这样:young man, ancient Chinese fantasy style, white and blue hanfu, long black hair, sharp eyes, cold expression, upper body, character concept art, 9:16生成后我挑了最符合角色气质的一张,加上--cref角色参考参数,生成同一个角色在不同角度和情绪下的图。这一步大概生成了20张,选出5张满意的高质量表情和姿态图,作为后面分镜绘制的参考底图。女主角同样操作,最后把两人都固化在角色设定表里。这是整套流程里最值得花时间的环节,因为一旦角色稳定了,后面所有分镜图都可以快速批量产出。接下来我按分镜表逐一生成画面。比如第4镜(男主角站在山崖边,风吹起衣袍,背影):提示词使用国漫玄幻风格,白色古装男子,墨色长发,山崖边,云海翻涌,背影,镜头从侧面45度拍摄,风吹衣袍,电影感光影,超高细节。生成后不满意重新抽卡,直到画面构图和角色风格统一。12个镜头我大概花了两小时,出图50多张,最终录用20张左右,每个镜头还留了备选。4.3 图生视频和剪辑合成记录把选定的分镜图导入即梦,逐镜生成3到5秒视频。比如那个山崖背影镜头,我输入的动作提示词是人物袍子被风吹动,云海缓慢流动,镜头缓慢推进,运动幅度选中,生成3个备选,挑了一个衣袍飘动最自然的。每一镜的视频生成都要重新审视一下是否出现人物变形。如果变形严重,我的第一反应是降低运动幅度,或者裁剪画面,让人物面部不出现在画面中心位置。如果画面有轻微闪烁,后期用剪映的闪帧消除或者重新取样能缓解。音频环节,我用剪映朗读生成了旁白和男主角的一句对白,用魔音工坊生成了女主角的两句对白,音色区分明显。BGM选了古风悬疑类,音量压到很低,在打斗镜头和结尾钩子处加了两个音效。剪辑时我先按旁白的节奏铺视频画面,再用对白补充细节,最后加字幕、调色、按需加速或减速画面。这样一集2分50秒的漫剧,从脚本到导出前后一共用了两天,其中大部分时间是等渲染和出图。4.4 接单交付时要留意的细节如果你学完后要接单,有几个交付细节比创作本身还重要:明确交付物格式:通常需要MP4成片、无字幕纯净版、字幕文件、分镜表、角色设定稿、项目源文件。提前和甲方确认,避免交付时扯皮。版权和商用授权:如果你用的是付费AI工具,要确认生成内容是否允许商用;如果是接外包,建议在合同里写明成品版权归甲方,模型工具风险由乙方规避。改稿次数:商单一般含2到3轮修改,超出部分额外计费。别在开工前没说清,否则改稿会改到怀疑人生。参考风格:接单时让甲方提供参考片,不只是画风参考,还包括节奏、旁白风格、配音风格。这样比你自己闷头猜要精准得多。5. 高频翻车现场,排查方法全记录我做了几十条AI漫剧,踩过的坑真不少。这里挑最典型的几个,按问题→原因→解决的顺序写清楚。5.1 人物五官漂移、变脸严重这是AI漫剧最大的痛点。排查思路:先确认是不是分镜图本身就不一致;如果分镜图稳定,再检查图生视频阶段。多数情况下,解决方案是退回到分镜图环节,用--cref或角色参考图统一角色特征,图生视频时优先选择面部不出现在剧烈运动区域的镜头。如果你用的是SD系工具,建议直接训练LoRA,一劳永逸。5.2 手部崩坏和肢体畸形AI生成图片和视频时,手是最容易崩的。解决思路有三条:提示词里加负面词畸形手,多余手指,手指错位;画面构图时优先选半身或特写,减少手部出现的概率;实在避不开,后期裁剪或用AI修复工具局部重绘。我现在的习惯是凡是涉及手的镜头,必须人工检查一遍再进入视频环节。5.3 图生视频画面变形扭曲特别是运动幅度大的镜头,人物脸部会像果冻一样扭曲。我的经验是:运动幅度设置成低或中,不要贪高;把主人物放在画面中心,四周留够安全区域;视频生成后及时检查第一帧和最后一帧,如果扭曲无法接受就重新生成;长镜头可以切成多个短镜头拼接,不要指望一条生成超过5秒的丝滑视频。5.4 字幕错别字、时间轴对不上剪映的智能字幕识别偶尔把冷冽识别成冷列这种错别字,密集台词时时间轴还可能偏移。解决方法是导出前完整看一遍字幕,重点检查人名、关键词、époque用词。涉及多角色对白时,手动分段比智能匹配更稳。5.5 画面有文字乱码或水印刚才说过不要在分镜图里生成中文文字,英文单词也会乱码。如果你确实需要画面中包含文字,用后期叠加或重绘,不要在AI绘画时让模型自己写。另外部分AI工具生成图片自带水印,商用前要确认订阅计划是否包含商用授权,否则接单时容易被投诉。5.6 常见问题速查表问题常见原因快速解决方案角色变脸分镜图不一致使用角色参考/--cref/LoRA肢体畸形手部或全身图生成不稳定加负面词,多抽卡,半身构图视频扭曲运动幅度过大调低运动幅度,短镜头拆分字幕错别字语音识别误差导出前人工校对画质模糊模型分辨率低/导出码率低高清重绘,导出码率拉高配音感情平淡音色或语速设置不当换音色,调语速,分段生成BGM盖过人声音量比例不对BGM压到人声的20%-30%接单交付反复改稿需求没对齐先定风格参考和改稿次数写在最后我最初做AI漫剧时低估了流程思维的重要性,以为掌握了某个AI工具就能一键出片,真正上手才发现,出片效率取决于你对整条工作流的理解,单点工具再强也只是其中一个环节。现在每次开工前,我都会现在纸上把分镜表、角色设定、工具清单过一遍,这个习惯让我的制作时间至少省了一半。最后分享一个实用技巧:建立你自己的素材资产库。每次做完一集,把满意的分镜图、提示词、角色设定、音效BGM分类存好,下次做新项目时直接调用,连绘图抽卡都不用从头折腾。做得越多,你的资产库越值钱,接单时的底气也就越足。