搜狐城市-镇江 2026-01-06 17:24 零基础小白,如何快速上手用AI从0-1创作出一部完整的动画? 先说整个制作流程: 故事脚本→角色设计→脚本分镜→参考生视频→台词配音→剪辑 此次演示所涉及到的工具: ChatGPT/Gemini Midjourney Vidu AI ElevenLabs Suno 话不多说,直接开整: 1.故事脚本 只要有想法和灵感,就可以把你的故事大致轮廓与ChatGPT、Gemini聊,聊的过程把脚本逐步细化出来。 如果你实在没有想法,也可以把你喜欢的小说/影视剧/电影等故事进行改编、二创。 比如,我让Gemini给我改编安徒生《拇指姑娘》童话故事。 如果想要一个让自己满意的脚本,整个过程会比较久,需要反复打磨。 2.角色设计 脚本打磨好后,不要马上去生视频。 建议先把故事角色形象设计好。 因为把角色形象设计好,可以帮我们把整部动画的艺术风格确定下来。同时,有了角色主体,可以直接用“多参”生视频,不必再有生图的过程。 角色形象设计建议用 Midjourney,我认为Midjourney在艺术风格和图片质感上,目前是最厉害的。当然你也可以直接在Gemini、ChatGPT生成,但是效果没那么好。 具体做法: 2.1 把整个脚本直接提供给ChatGPT、Gemini 指令提示词如下: 你是一名专业角色设计师与AI出图提示词专家。 根据我提供的【故事脚本】,为每个主要角色设计外观(风格、相貌、发型、服装、体型、气质、关键装饰),并将其转化为可直接用于 Midjourney 的中英文提示词。 所有角色需要纯白背景,最终仅输出一段按角色分类的“剧情角色形象”的Midjourney提示词(中文一段、英文一段),不需要其他说明。 让大模型根据故事脚本人物性格,梳理出一个个性化的角色外貌特征、风格等中英文提示词: 2.2 依次把各个角色的英文提示复制,拿到Midjourney里去生成 你需要打开设置,设定好图的比例。 2.3 风格参考、灵感参考 Midjourney 里面有一个 Styles 的风格探索功能,可以在风格库里找你喜欢的风格图参考。 比如,在右上角直接搜关键词 Animation ,找到你要参考的风格图,点击 Try Style 。点击生成,就会把参考图和提示词一同送出,生成同样风格的人物形象。 同理,还有一个Images 的图片库,把你想要参考的图片风格,直接拖拽到提示词框的 Style Reference。 我最终生成的人物角色: 这里建议额外多做一步:提高图片像素 点击你想要的图片,在右边栏的 Upscale 点击 Subtle 以生成更高解析的图片,方便下一步的生成高清的人物视角图。 2.4 生成纯白人物多视角图 这一步很重要。需要生成角色的多个视角图,以便让AI更理解你的人物特征,最后生成的视频主体结果更稳定。 角色的多视图生成效果最好用的不是Midjourney,而是Nano Banana 模型。 具体操作: 在Gemini 或 Google AI Studio 切换Nano Banana 模型 把2.3步骤生好的多个高清角色图+提示词依次扔给Nano Banana 模型,你就能得到包括脸部特写、全身正面、全身侧面、全身背面的四视图。 根据我提供的图片,给我生成一张角色概念图,包含脸部特写、全身正面、全身侧面、全身背面,以2×2格式拼接,纯白背景。 3.脚本分镜 角色设计好后,需要把故事脚本生成分镜脚本——相当于把整个故事拆分成多个场景镜头,最后组合成一部连贯完整的动画。 3.1 分镜脚本生成 同样把故事脚本+提示词给ChatGPT或Gemini,让它生成 提示词: 你是一位专业的分镜设计师,请根据我提供给你的【故事情节】分解成一个完整连贯的分镜表。 输出格式如下: 「分镜1、分镜2、…」:[镜头类型镜],在[时间],[取景范围、构图、视角]在【@场景描述】中,【@角色变量A - ([取景范围、构图、视角]) ]】和【@角色变量B - ([取景范围、构图、视角])】[正在做什么动作或互动]。镜头聚焦于[某个细节/角度,[构图描述,如:从某场景内部向外拍摄/位于画面左侧/形成对角线构图等]。合理运镜。 3.2 场景图设计 我们拿到了分镜脚本,接下来就需要把场景图给设计好。有了场景图,才有角色交互发生的环境。 我们看到分镜脚本有的地点是一样的,只是拍摄角度不一样。如果逐一用Midjourney生成,难以保证风格一致性。 所以做法与 2.4的人物多视图逻辑一样: 需要先用Midjourney生成一张满意的场景图,再借助Nano Banana 模型给出不同视角的场景图。 具体操作: 1.让ChatGPT或Gemini编写 Midjourney 场景提示词 提示词指令: 将我提供的分镜脚本中的「地点」部分改写成一个Midjourney的中英文提示词。 要求: 忽略人物主体 忽略分镜脚本中的动态指示 生成的提示词如下: 2.Midjourney 生成高清场景图 把英文提示词复制到Midjourney去生成高清图(注意一代要做Subtle去提高图片质量)
3. Nano Banana 模型生成不同拍摄视角的场景图
提示词: 给我这张图片的不同拍摄视角,包括正面、侧面、背面、空拍的视角,以2×2格式拼接。 4.参考生视频 经过前面的3大步骤,重要来到生视频的准备环节了。 目前主流的生视频有三种方式:image to Video 、Text to Video、Video to Video 「Video to Video」,提供一段已有的视频和参考图,让AI分析视频里面人物的行为动作,并映射到参考图的角色。节省了一笔动态捕捉设备的费用。熟知的平台比如:Runway。 「image to Video」,通过提供原始图片来生成视频,适合已经准备好了首/尾帧静态图,对视频画面控制度要求高的使用者。熟知的平台比如:即梦。 「Text to Video」,直接通过文字描述来生成视频,可以极大发挥视频模型的能力,但是对画面控制力也是最弱的。熟知的模型比如:Veo3、Sora 。 本文只聊「Text to Video」这个方式,我认为「Text to Video」可能才是AI在影像领域的主要发展方向。 而「Text to Video」里有一个流派——「参考生视频」 所谓「参考生视频」,就是在「Text to Video」的基础上,多了一个“万物参考”,即你可以提前上传角色、场景、甚至特定动作模板作为“核心指令”参考。 这样做的目的是为了保持特定人物、场景一致性。如果人物和场景没办法保持一致,就无法用AI做长视频动画。 目前「参考生视频」做得最好的我认为是Vidu的Q2模型(这里不是广告),具体使用方法: 4.1 主体库上传 进入首页(www.vidu.cn),选择参考生视频。 点击”主体库“ 点击+上传我们在第2、3步准备好的多视觉角色图、场景图。 设置好姓名、标签和音色。姓名和标签,方便自己记忆管理即可。音色建议关闭。 点击下一步,你可以看到它对这幅图的文字描述。这里的描述如果你觉得和图片的不是很符合,务必要进行修正。然后点击确认。 为啥?这里要敲黑板—— 因为我上面说过,参考生视频实际上就是文生视频。 所以,这里“风格”、“描述”提示词,实际上是AI对你上传的图片进行的反推分析。 等到生视频的时候,AI主要遵循文字参考指令(”描述”文字的参考权重更高,其次是“风格”文字,最后才是图片)。 换句话说,你即便上传与这个人物毫不相关的图片,只要“描述”和“风格”词不变,依然可以生成类似的人物角色,只不过没那么精准。 下面我会演示这个原理。 4.2 生视频 把角色和场景都在主体库设置好后,我们就可以生视频了。 生视频的提示词可以直接用3.1生成的脚本提示词,然后在特定角色和场景处,额外@主体库主体进行主体参考,设置好Q2模型、视频时长、清晰度等设置,就能生成视频了。 通过这种参考生视频方法,很快就可以生成完所有分镜视频,且保证了主体一致性。 细心的朋友可能发现了:我这里面的“拇指姑娘”角色是一朵花,其实是我随便上传的图片。但风格、描述依然还是人物角色的提示词。 最后呈现的效果就是,除了人物外貌不够精准外,其他比如服饰、风格都还是一致的。 所以可以验证了我前面说的:主体库里面参考权重更高的是描述词,然后才是图片。 5.角色台词配音与动画配乐 视频动画不可避免的需要角色配音,但是这一块目前找到一个比较好用动画的对口型配音AI工具。视频平台生成的画面+人声配音效果还是差强人意。 所以要么自己配音,要么直接用AI生成人物台词配音,然后通过后期剪辑合成。 目前AI生成人物台词配音表现最好的推荐 ElevenLabs。 以为这个脚本主角“拇指姑娘”配音为例,具体操作: 5.1 设计角色音色和台词语调 我们可以让Gemini/ChatGPT为我们根据人物性格设置特有的声音。 提示词: 我要使用ElevenLabs.io配音,为我设计脚本里每个角色的通用音色的提示词。然后把角色各自的台词全部列出来,并同时为台词注明情绪标签,比如:"We... are not[unflinchingly] useless."。 5.2 创建台词配音 进入 ElevenLabs 首页,进入Voices 页面,你可以直接在音色库里面查找符合角色特征的免费音色。 但如果有积分,可以直接独一无二的音色,且更省时间。 点击Create or Clone a Voice 点击 Voice Design,然后我们复制刚刚生成的通用音色提示词,点击生成,会一次性生成3个音频(需要350积分),供你3选一,当然也免不了会抽卡。 选择后,就可以把带有情绪标签的台词生成配音了。 注意:目前只有eleven v3 才可以识别情绪标签。Eleven Flash v2.5目前还只能通过控制参数来调整语音语调。 5.3 配乐 配乐也很简单。同样让大模型给你设计一个专属故事脚本的配乐提示词。 把配乐提示词复制下来,直接到Suno AI作曲网站生成配乐。可以设计曲风(比如Disney-style pop ballad),还可以选择主唱是男生或女生。 Suno有免费的40多积分,可以生成2个可供免费下载的配乐。 6.剪辑 以上5个步骤完成,后面就到剪辑了。把分镜、配音等素材都拖到剪辑工具(比如Pr、剪映)里面,最终拼接成一个视频。 剪辑这块省略不赘述了。市面上有很多成熟的剪辑教程。 来源:吴同学用AI 责任编辑:搜狐镇江
本文作者:搜狐城市-镇江