最新推荐文章于 2026-09-05 16:33:54 发布 原创 于 2026-09-05 13:34:03 发布 · 316 阅读 AI漫剧并不是一条只能由专业团队完成的工业化链路,核心要素是把文本、图像、视频、音频四个环节串成一条可循环的内容生产线。新手第一次听到“从0到1独立完成AI漫剧”时,通常会误以为需要先学会写剧本、再学会画画、然后还要掌握完整视频剪辑能力。实际上,在文生图、图生视频和TTS配音工具足够成熟之后,一个人完全可以在几周内完成一条60到90秒的AI漫剧短片。这篇文章会沿着剧本、分镜脚本、资产生成、文生图、图生视频、配音、剪辑、成片的顺序,把每个环节的输入、输出、检查点和常见坑梳理清楚,并给出可以直接套用的表格、提示词模板和排查清单。
1. 先理清AI漫剧创作的完整链路和各环节产物
1.1 AI漫剧和传统短剧的区别 传统短剧之所以制作门槛高,是因为它依赖演员、场地、摄影、灯光、服化道和拍摄团队。演员状态不稳定,场地费用高,拍摄周期长,任何一个环节出问题都会影响成片质量。AI漫剧用生成模型替代了“物理拍摄”这一环节,但它并没有替代“创作决策”。谁来决定角色长什么样、镜头怎么运动、节奏快慢、情绪如何表达,仍然依赖创作者。 换句话说,AI漫剧降低了“实现画面”的门槛,但提高了“描述画面”和“控制生成结果”的要求。新手从0到1完成一部作品,真正要训练的不是某个单一软件的操作技巧,而是把创意拆解成可执行镜头、再把镜头准确翻译成提示词 、最后通过工具调度形成成片的能力。 这条链路的优势在于一个人可以独立完成全部环节,且不需要等待外部资源。缺点是每个环节都可能出现失控,比如角色不一致、运动变形、配音平淡、镜头之间跳变。因此,理解每个环节的输入、输出和检查点,比追求某个工具跑通更重要。 1.2 全流程节点、输入输出和核心工具 AI漫剧创作的完整链路通常包含剧本、分镜脚本、资产生成、文生图、图生视频、配音、剪辑、成片八个节点。每个节点都有明确的输入、输出和检查标准。 流程节点 输入 输出 常见工具/模型 关键检查点 剧本 创意、人物设定、一句话故事 分场景文本 LLM(ChatGPT、Claude、通义千问等) 核心冲突是否清晰、角色数量是否可控 分镜脚本 剧本 镜头表格 表格工具、LLM辅助拆分 每个镜头是否可画面化、台词是否短 资产生成 角色文字设定 角色参考图、道具图、背景图 Midjourney、Stable Diffusion、即梦 角色特征是否稳定、风格是否统一 文生图 分镜表格、人设提示词 每个镜头的关键帧图片 Midjourney、Stable Diffusion、ComfyUI 构图、比例、光影、角色一致性 图生视频 关键帧图片、运动提示词 短视频片段 可灵、即梦、Runway、ComfyUI+Wan2.2 运动幅度、首尾帧、是否变形 配音 台词文本、角色音色设置 对白音频、旁白音频 ElevenLabs、GPT-SoVITS、剪映配音 语速、情感、断句是否自然 剪辑 视频片段、音频、字幕文案 时间线工程 剪映、Premiere Pro、达芬奇 画面衔接、配音对齐、节奏 成片 时间线、BGM、音效、字幕 MP4成片 剪映、Premiere Pro、达芬奇 分辨率、字幕、音量比例 实际项目中,并不需要每个工具都选择最强配置,而是要先跑通一条“最小链路”。比如第一版可以使用在线文生图工具生成关键帧,使用短视频平台内置的图生视频能力生成动态镜头,使用剪映完成配音和剪辑。先确保流程通顺,再逐步把某个环节更换为更可控的本地模型。
2. 环境准备:先确定工具组合,再统一文件规范
2.1 创作前先确定一条“最小链路” 很多新手失败不是因为工具不好用,而是因为同时学太多工具,最后所有环节都只做了“测试图”和“测试视频”,没有形成成片。建议先确定一条不需要复杂硬件也能跑通的最小链路: 使用任意一款成熟LLM写剧本和分镜。 使用在线文生图工具生成角色参考图和关键帧。 使用图生视频工具把关键帧转化为短视频片段。 使用剪辑软件自带的TTS配音或独立TTS生成对白。 使用剪映完成时间线、字幕和导出。 这条链路适合学习环境。优点是零部署、快出结果、不依赖显卡。缺点是可控性较差,尤其是角色一致性和镜头运动控制。后续如果希望更精细控制,可以再加入Stable Diffusion和ComfyUI本地工作流。 本地环境要求取决于使用的模型。以现阶段常见模型为例,如果使用ComfyUI做文生图,建议至少准备8GB显存,16GB显存会更流畅;如果继续跑图生视频模型,显存需求会明显上升,通常需要更高配置,或者使用云端GPU服务。不要在没有确认模型要求前直接下载最大参数版本,先在官方或模型页面确认所需显存、驱动和依赖。 2.2 文件目录和命名规范 一个人创作时很容易忽略文件管理,但AI漫剧涉及几十张图片和几十段视频,如果不提前规划目录结构,后期找文件会非常痛苦。推荐按流程节点建立目录: ai_comic_drama/ ├── 01_script/ │ ├── script_v1.md │ └── storyboard_v1.xlsx ├── 02_assets/ │ ├── character_main_v1.png │ ├── character_side_v1.png │ └── style_ref/ ├── 03_images/ │ ├── S01_E01_Sh01_key_001.png │ ├── S01_E01_Sh01_key_002.png │ └── S01_E01_Sh02_key_001.png ├── 04_videos/ │ ├── S01_E01_Sh01_clip_001.mp4 │ └── S01_E01_Sh02_clip_001.mp4 ├── 05_audio/ │ ├── dialog/ │ ├── voiceover/ │ └── bgm/ ├── 06_edit/ │ └── comic_drama_v1.prproj ├── 07_output/ │ └── comic_drama_v1.mp4 └── 08_logs/ ├── image_generation_log.csv └── video_generation_log.csv 命名建议使用“集数序号_镜头序号_内容类型_版本号”的结构。例如 S01_E01_Sh01_key_001.png 表示第1季第1集第1个镜头关键帧第1版。这样做的原因是,生成工具通常会在文件名中附带长串随机字符,如果直接使用默认文件名,后续无法快速判断这个文件属于哪个环节、哪个镜头。 2.3 每次生成都要记录提示词和种子 图片和视频生成具有随机性。如果只保存结果文件,不保存提示词、参数、种子,后续想要微调或复现就会很困难。建议使用一张简单的生成记录表,每次生成后立即补充记录。 记录项 示例 文件编号 S01_E01_Sh01_key_001 目标镜头 天台远景 正向提示词 1girl, silver hair, black coat, rooftop, cinematic lighting 负面提示词 lowres, bad hands, watermark, text 模型 示例模型名称 Seed 123456 参数 steps=30, cfg=7.0, sampler=... 使用工具 ComfyUI / 在线平台 备注 手部轻微变形,下版重抽 这样做的核心原因是,AI生成结果需要“比较式改进”,没有记录就无法知道上一版和当前版到底差在哪里,也无法快速回退到可用版本。
3. 从剧本到分镜脚本:不是写小说,而是写镜头
3.1 剧本结构设计:短剧只需要一个核心冲突 AI漫剧不适合像长篇小说一样铺陈大量背景。60到90秒的内容,观众只能接受一个明确的核心冲突和一个情绪转折。新手最容易犯的错误是在第一版剧本里塞入过多角色和过多情节,导致每个镜头都是信息堆叠,最终画面生成时完全失控。 推荐一个适合新手的分段结构: 开场钩子:0到10秒,快速让观众知道主角处境。 铺垫:10到30秒,交代场景和情绪。 转折:30到55秒,出现冲突或目标。 高潮:55到75秒,情绪最强烈的画面。 定格/收尾:75到90秒,给出可停留在结局或悬念点。 角色数量尽量控制在1到2个。如果出现第二个角色,建议只在结尾惊鸿一瞥或作为声音存在,不要让他参与复杂互动。因为AI文生图和图生视频当前阶段对多角色互动的控制能力有限,画面很容易出现肢体融合、表情异常等问题。 3.2 使用LLM辅助生成剧本和分镜 LLM可以降低从创意到文本的写作成本,但直接让它输出“完整剧本”往往不够好用。更好的方式是把需求拆成结构化指令。 以下是一个可用于生成分镜提示词的示例: 你是一名AI漫剧编剧,熟悉镜头语言。请把下面的故事扩写成时长60秒、共6个镜头的漫剧剧本。
要求:
1. 每个镜头包含:镜号、景别、画面内容、角色动作、台词、情绪、推荐时长。
2. 台词控制在15个汉字以内。
3. 所有画面内容必须是“可画出来的具体动作”,不要写心理状态或抽象概念。
4. 避免出现多个角色复杂互动的场景。
5. 镜头之间要有清晰逻辑,推荐使用“远景建立环境→中近景表现情绪→特写强调关键动作”的顺序。
故事:一个女孩收到一封来自十年前的信,决定前往天台上寻找写信的人。 使用这种提示词时,LLM会输出更接近分镜表格的内容。但要注意,LLM生成的结果仍需要人工审查,因为模型可能写出“她的心情像风一样自由”这种无法直接生成画面的描述,必须手动改成“她站在天台边缘,风吹起头发,目光看向远处”。 3.3 分镜脚本表格化:让每个镜头可执行 分镜脚本不是给观众看的,而是给生成工具和剪辑者看的。它的核心价值是让每个镜头都有明确的生成目标。推荐使用表格记录分镜: 镜号 景别 画面内容 台词 情绪/动作 时长 首帧要求 视频运动提示词 01 远景 女孩站在天台,城市夜景 旁白:十年前的信…… 孤独/风吹 6s 全身,灰蓝色调 镜头缓慢推近,头发飘动 02 中景 女孩低头看信 无 沉默/手指微动 5s 手持信,脸清晰 手指缓慢收紧 03 近景 女孩抬头,目光坚定 主:他来了吗 期待/轻声 4s 眼神清晰 头部缓慢抬起 04 特写 信封上的字迹 旁白:字迹还是和以前一样 回忆/温暖 5s 文字清楚 镜头缓慢拉远 05 中近景 女孩微微笑 主:我知道你会来 释然/微笑 6s 脸部正面 嘴角微动,眼睑低垂 06 远景 楼梯口出现一个模糊人影 无 悬念/定格 4s 剪影 背景轻微晃动,人物静止 分镜表格中最重要的字段是“画面内容”和“首帧要求”。画面内容决定文生图的构图,首帧要求决定图生视频的输入图是否需要调整。台词尽量单独一列,方便后续配音和字幕导出。 新手在拆分镜头时最容易忽略三件事:转场逻辑、首尾帧匹配、口型问题。图生视频通常不会生成高质量口型,因此不要让角色长时间做正面特写讲话。更稳妥的做法是,角色说话时画面切到背影、侧面、远景或插入其他物体特写,配音作为旁白继续推进叙事。
4. 资产生成与文生图:角色一致性是核心难点
4.1 什么是“资产生成”,为什么要先于镜头生成 资产生成是指在一个项目正式开始出图之前,先把可复用的角色、道具、背景和风格参考图准备好。它的价值在于减少每个镜头的重复试错。如果没有统一的角色设定,每个镜头都从零写提示词,结果就会是同一个角色在不同镜头里长得完全不像。 资产生成阶段主要做三件事: 生成角色正面立绘,确认五官、发型、服装。 生成角色侧面或背面参考图,方便后续更多角度。 确定整体画面风格,比如赛博朋克、古风、现代都市、梦幻治愈。 生成的时候可以把角色设定卡写清楚,作为后续每个镜头提示词的基础。推荐记录在表格中: 项目 内容 角色名 林小满 性别/年龄 女/17岁 发型 银色长发,齐刘海 服装 黑色长风衣,内搭白色高领 配饰 戴着一枚旧怀表 风格 二次元,电影感光影,冷色调 固定关键词 1girl, silver long hair, black trench coat 负面关键词 bad hands, extra fingers, blurry, watermark 参考图 character_main_v1.png Seed 固定一个可用值 4.2 文生图的提示词模板和实操步骤 文生图是AI漫剧中最容易上手但最难稳定的环节。下面给出一个通用提示词模板,具体使用时需要根据模型支持的语言、版本和风格偏好调整。 正向提示词: 1girl, silver long hair, black trench coat, white turtleneck, standing on rooftop, city night lights background, looking at viewer, gentle expression, cinematic lighting, depth of field, anime style, masterpiece, best quality, full body, front view
反向提示词: lowres, bad anatomy, bad hands, extra fingers, missing fingers, blurry, watermark, text, logo, ugly, deformed, worst quality 关键点有三个。第一,正向提示词中不需要把所有细节都堆进去,要突出“这个角色是谁”和“这个镜头发生在哪”;第二,负面提示词要结合具体模型,不同模型对手部、文字、水印的处理能力差别很大;第三,固定风格关键词可以有效减少画面风格漂移,比如“cinematic lighting, anime style”如果每一次都保持一致,不同镜头之间的观感会更接近。 实操步骤建议按下面的顺序: 先生成20到40张角色基础立绘,挑选2到3张作为候选参考图。 用固定提示词和seed微调,直到角色脸部基本稳定。 将角色参考图保存到 02_assets 目录。 后续每个镜头的关键帧,都从参考图基础上重新生成,而不是重新写一套全新提示词。 检查手指、比例、面部对称性,不合格的直接重新抽卡。 4.3 保持人物一致性的几种方案对比 不同项目对一致性的要求不同,选择方案时不能只看“效果最好”,还要看“学习成本”和“生成效率”。 方案 原理 适用场景 难度 一致性效果 固定种子+固定提示词 通过相同随机种子减少风格漂移 单人短镜头 低 一般 角色参考图+参考权重 把角色图作为条件输入给模型 单集短剧 中 较好 IP-Adapter 将参考图特征注入生成过程 ComfyUI工作流 中高 较好 LoRA训练 训练专属角色的轻量模型 多集长剧、IP化创作 高 最稳 新手不要在一开始就训练LoRA,因为它需要准备数据集、标定参数、反复训练和测试,过程繁琐且容易受素材质量影响。建议先使用参考图功能。很多在线文生图工具已经支持上传参考图并设置相似权重,这足以完成一个单人角色的漫剧项目。 4.4 文生图阶段最常见的三个坑 第一个坑是角色特征写得太模糊。只写“一个漂亮女孩”会导致每次生成的人不同,必须固定发型、发色、服装和配饰。 第二个坑是把风格关键词和角色关键词混在一起。风格词应该单独维护,不要每张图临时想,否则画面背景氛围可能忽冷忽暖。 第三个坑是忽略图片分辨率。图生视频通常对输入图分辨率有要求,如果文生图输出的是竖构图且分辨率过低,后续视频生成会放大模糊或变形。建议按目标平台比例生成,通常短剧常用9:16竖屏,关键帧分辨率至少超过模型的最低要求,常见建议为512x768或576x1024,具体以实际模型要求为准。
5. 图生视频:从静态图到动态镜头
5.1 图生视频为什么比文生视频更利于控制 文生视频直接输入一句话生成视频,虽然方便,但很难精确控制角色长相、服装、场景和构图。图生视频则不同,它把一张静态图作为首帧,模型在保持画面主体基本稳定的前提下,为画面增加运动。这种机制天然适合AI漫剧,因为漫剧的画面通常是先定构图,再让角色和镜头动起来。 理解图生视频的重点是:模型并不是真的“理解”了这个故事,而是在尽力保持首帧的语义特征,同时根据运动提示词预测下一帧变化。因此,输入图的质量几乎决定了视频的上限。如果首帧构图混乱、主体不清晰、物体比例奇怪,生成的视频大概率会在这些位置继续放大问题。 5.2 运动提示词的写法:一次只做一件事 运动提示词是图生视频中最关键的文本输入。很多人习惯写“角色做很多动作”,结果画面剧烈变形。推荐的方法是控制运动幅度,一个镜头只让一个主体发生一个主要动作,镜头运动单独描述。 示例对比: 错误写法:角色的情绪很激动,不停说话,头发乱动,镜头不断切换,背景疯狂变化。
推荐写法:女孩站在天台,风吹动她的长发,她缓缓抬头看向远处,镜头缓慢推近。 英文运动提示词在某些模型中更稳定,可以写成: The girl stands on the rooftop, her silver hair blowing in the wind, she slowly lifts her head, camera slowly pushes in, night city background. 运动提示词可以按“主体+动作+镜头运动+背景动态+情绪氛围”的顺序组织。主体决定谁来动,动作决定如何动,镜头运动决定观众视角变化,背景动态负责增加真实感,情绪氛围帮助模型选择更合适的画面质感。 5.3 使用ComfyUI跑通图生视频工作流 如果选择本地ComfyUI方案,图生视频工作流通常由以下几个核心节点组成,不同版本的节点名称会有差异,但整体思路一致: 节点类型 作用 关键设置 Load Image 加载输入首帧 选择PNG/JPG图片 Text Encode 编码运动提示词和负向提示词 正向写运动描述 VAE Encode 将图像编码到潜空间 一般使用模型自带VAE KSampler 采样去噪 steps 20-50,cfg 5-7 Video Decode 解码视频帧序列 输出帧率、分辨率 Save Video 保存视频文件 mp4/webm格式 以Wan2.2图生视频为例,常见的工作流逻辑是:先加载一张首帧图片,将图片通过VAE编码到潜空间,同时将运动提示词通过文本编码器编码,之后送入采样器进行多帧连续生成,最后经过VAE解码输出视频。这里的采样器相当于在每两帧之间补偿运动信息,因此步数和CFG的影响非常明显。 参数设置建议: steps:步数过少会出现闪烁和不稳定,过多会明显降低生成速度。建议从20到30开始测试。 CFG:太低画面可能不贴合提示词,太高容易导致颜色过饱和或主体变形。建议保持在中低范围。 分辨率:按模型支持的最大分辨率生成,不要随意拉伸。 种子:固定种子可以在修正提示词时保持运动趋势基本一致。 如果是学习环境,建议先在云端Notebook或在线图生视频平台测试,等确认模型效果后再决定是否部署本地。 5.4 生成视频后必须做的抽帧检查 视频生成完成后不能直接拖进剪辑软件。AI生成的视频时长通常只有几秒,且可能在中途出现手部变形、身体穿模、画面闪烁等问题。推荐用ffmpeg抽帧检查: ffmpeg -i S01_E01_Sh01_clip_001.mp4 -vf fps=2 frame_%03d.png 检查重点是每段视频的首帧、中段和末帧。首帧要承接前一个镜头的结尾,末帧不能出现人物突然消失或镜头剧烈切换。如果发现中段有严重变形,优先重新生成,而不是幻想后期可以修复。剪辑阶段的修复成本远高于生成阶段的抽卡成本。
6. 配音、音效和剪辑:让成片像“剧”
6.1 TTS 配音与情绪控制 很多新手把配音放在最后,导致画面生成完之后不知道对白应该放在哪里、应该多长。更推荐的做法是在分镜脚本阶段就确定台词,然后在图生视频时尽量避免角色长时间正面讲话,最后用TTS把台词生成音频,再根据音频时长微调视频片段。 TTS工具通常会提供音色、语速、音量、停顿、情感标签等参数。使用时可参考以下设置: 角色:林小满 音色:年轻女声,偏温柔 语速:0.9倍 情感:轻声、略带期待 停顿:每句台词后增加300ms停顿 格式:要求输出WAV或MP3,采样率44100Hz 生成对白时,文案中要保留符号。逗号、句号、省略号会影响停顿。更精细的控制可以写在文本标记中,不同TTS工具支持不同标记语法,例如部分工具支持
7. 常见问题排查与质量提升清单
7.1 根据现象倒推原因,而不是反复重抽 AI漫剧创作中遇到问题,第一步不是重抽几十张图,而是判断问题出在哪个环节。下面是一张常用排查表。 问题现象 可能原因 检查方式 处理建议 角色脸每镜都变 提示词不固定、没有使用参考图 对比生成记录中的提示词和seed 使用角色参考图,固定特征关键词 图生视频人物扭曲 输入图分辨率不足或运动幅度过大 查看首帧质量和运动提示词 降低运动描述幅度,重新生成首帧 视频闪烁严重 步数过低、CFG不合适 查看生成参数 提高步数,调整CFG,固定seed 镜头之间跳变 相邻镜头首尾帧不一致 抽帧检查 用前一段末帧作为后一段首帧参考 配音和画面不匹配 台词没有按分镜分段 查看波形和片段长度 按镜头切割音频,重新对齐 画面出现乱码文字 模型不擅长生成文字 检查画面是否有长文字 构图中避免文字,后期用字幕替代 生成速度极慢或爆显存 模型过大、分辨率过高 查看任务管理器或日志 降低分辨率、减少步数,或改用云端 这个表的核心逻辑是:先确认问题发生在“输入描述层”还是“模型生成层”。如果提示词本身逻辑不清,调再多的采样参数也没有意义。 7.2 成片前自检清单 发布前建议按下面的清单逐项检查,每项都通过后再导出最终版本。 剧本:核心冲突是否清楚,角色数量是否在1到2个以内,总...