AI视频生成 提示词工程 结构化描述 于 2026-07-07 15:51:18 修改 在实际使用 AI 视频生成工具时,很多开发者或创作者会遇到一个共同的问题:为什么我生成的视频和我想象的完全不一样?画面混乱、主体不清晰、运动诡异,甚至风格跑偏。这往往不是模型能力的问题,而是输入的“提示词”质量不佳。提示词是连接人类创意与 AI 理解的核心桥梁,写得好,事半功倍;写得差,事倍功半。本文将深入剖析提示词的结构化写作方法,通过两个典型案例,带你从零掌握如何撰写高质量、高可控性的 AI 视频生成提示词。无论你是希望将 AI 视频能力集成到应用中的开发者,还是直接使用生成工具的内容创作者,理解并掌握提示词工程,都是提升产出质量的关键一步。

1. 理解提示词:从“关键词堆砌”到“结构化描述”

在 AI 视频生成领域,提示词远不止是几个关键词的简单组合。它是一份详细的“导演脚本”,需要清晰、结构化地告诉 AI:谁(主体)、在哪里 (场景)、做什么(运动)、看起来怎么样(风格与美学)。一个有效的提示词,需要将模糊的创意转化为机器可执行的、无歧义的指令。 1.1 基础公式:构建视频的骨架 对于初学者或希望快速获得创意灵感的场景,一个简单但有效的公式是:提示词 = 主体 + 场景 + 运动。 主体:视频的核心表现对象。它必须明确且具体。例如,“一只猫”是模糊的,“一只毛茸茸的、橘白色的英国短毛猫”则是具体的。 场景:主体所处的环境。它定义了视频的背景和氛围。“在房间里”是模糊的,“在一个洒满午后阳光、铺着木质地板、散落着毛线球的客厅里”则是具体的。 运动:主体或场景元素的动态变化。这是视频区别于静态图片的关键。“在玩”是模糊的,“用前爪笨拙地拨弄一个毛线球,偶尔扑空后疑惑地歪头”则是具体的。 这个公式确保了视频的基本要素齐全,避免了生成内容空洞或主体缺失的问题。 1.2 进阶公式:注入灵魂与质感 当需要生成更具故事性、电影感或特定风格的视频时,就需要使用进阶公式:提示词 = 主体(主体描述)+ 场景(场景描述)+ 运动(运动描述)+ 美学控制 + 风格化。 主体/场景/运动描述:在基础元素上增加丰富的细节形容词和短句,让画面更生动。 美学控制:这是专业级控制的核心,相当于影视拍摄中的“镜头语言”。它包括: 光源:日光、月光、霓虹灯光、烛光。 光线:柔光、硬光、侧光、逆光、顶光。 景别:特写、近景、中景、全景、远景。 视角/机位:俯拍、仰拍、过肩镜头、航拍。 运镜:镜头推进、拉远、平移、环绕。 色调:暖色调、冷色调、低饱和度、高对比度。 风格化:定义视频的整体艺术风格。例如:“赛博朋克风格”、“水墨画风格”、“黏土动画风格”、“3D 卡通渲染”。 下表对比了基础描述与加入美学控制后的差异: 描述类型 基础描述示例 加入美学控制与风格化后的示例 主体与场景 一个女孩在森林里。 特写镜头,逆光,柔光。 一位身着白色长裙的少女,栗色长发被微风轻轻吹起,站在清晨雾气缭绕的魔法森林中,阳光透过树叶形成丁达尔效应。 运动 她向前走。 她赤足缓缓前行,每一步都轻盈地踩在铺满苔藓和落叶的地面上,镜头从低角度跟随她的脚步缓慢推进。 整体效果 一个普通行走视频。 一个具有电影感、氛围宁静而神秘的森林漫步镜头。 1.3 声音公式:实现声画同步 对于支持音频生成的模型(如阿里云万相2.5及以上版本),提示词还需要包含声音描述,以实现精准的声画同步。公式为:提示词 = 主体 + 场景 + 运动 + 声音描述(人声/音效/背景音乐)。 人声 = 角色说话的内容 + 情绪 + 语调 + 语速 + 音色 + 口音 示例:一个男人在讲脱口秀,他说道:“好好学习,天天向上”,语气轻松,语速适中,声音清亮,美式英文。 音效 = 音源材质 + 行为 + 环境音 示例:一个玻璃小球从桌面掉在木质地面上,发出“砰”的声音,室内安静环境。 背景音乐 = 背景音乐/配乐 + 风格 示例:雨夜,阴森窄小的走廊,尽头有一扇窗户,配有悬疑风格背景音乐。 通过结构化地组合这些元素,你可以像导演一样,精确控制生成视频的视觉和听觉效果。

2. 案例一:从零构建一个“冬日小猫玩雪”场景

让我们通过一个完整的案例,实践如何将一个简单的想法“小猫在雪地里玩雪球”,扩展成一份高质量的生成提示词。我们将使用进阶公式,并最终为其添加声音。 2.1 需求分析与元素拆解 首先,明确我们想要什么: 主体:一只可爱的小猫。 核心动作:玩雪球。 氛围:温馨、童趣、冬日。 风格:写实或略带风格化的动画。 声音:希望有环境音和可爱的音效。 2.2 分步构建结构化提示词

第一步:丰富主体与场景描述 不要只写“小猫”和“雪地”。

主体描述:一只毛茸茸的、眼睛圆溜溜的小奶猫,毛色是橘白相间的。 场景描述:冬日清晨的雪地,银装素裹的宁静庭院,积雪厚实而松软,周围有挂着冰霜的灌木丛和远处一个戴着帽子和围巾的小雪人。

第二步:细化运动过程 将“玩雪球”分解为一系列连贯、有趣的动作。

运动描述:小猫好奇地用鼻子碰了碰一个雪球,然后用前爪尝试滚动它。雪球越滚越大,小猫兴奋地跟着小跑。突然,雪球撞到树根裂开,小猫惊得向后跳了一下,随后又试探性地凑近,打了个小喷嚏,最后开心地在碎雪上打了个滚。

第三步:加入美学控制(镜头语言) 决定我们想用什么样的镜头来呈现。

美学控制:中景镜头,微俯视角,柔和的晨光(侧光),暖色调以突出温馨感,景深较浅以模糊背景突出小猫。

第四步:选择风格化 根据需求,我们可以选择:

风格化:“3D卡通风格,材质细腻有毛绒感”。(如果追求写实,则可以不写或写“摄影写实风格”)。

第五步:添加声音描述 让画面“活”起来。

声音描述: 人声:无。 音效:小猫爪子踩在雪地上发出“咯吱咯吱”的轻响;雪球滚动时有“沙沙”声;雪球破裂是“噗”的一声闷响;小猫打喷嚏是清脆的“阿嚏!”;翻滚时有积雪掉落的“簌簌”声。 背景音乐:轻快、温馨的八音盒风格配乐,节奏活泼,营造冬日童趣氛围。 2.3 最终提示词与代码调用示例 将以上所有部分流畅地组合成一段完整的描述性文本: TEXT 一只毛茸茸的橘白色小奶猫,在冬日清晨银装素裹的宁静庭院里玩耍。它先用鼻子好奇地碰了碰雪球,然后用前爪笨拙地滚动雪球,雪球越滚越大,它兴奋地跟着小跑。雪球撞到树根裂开,小猫惊得向后跳开,又试探性凑近,打了个小喷嚏后,开心地在碎雪上打滚。采用中景微俯视角,柔和的晨光侧光,暖色调,浅景深,3D卡通风格且材质有毛绒感。音效包括爪子踩雪的“咯吱”声、雪球滚动的“沙沙”声、破裂的“噗”声、小猫“阿嚏!”的喷嚏声和积雪掉落的“簌簲”声,背景是轻快温馨的八音盒风格配乐。 在实际调用生成API时,这段文本就是 prompt 参数的值。以下是一个使用 Python 调用阿里云百炼平台 API 的示例代码框架: PYTHON import os from openai import OpenAI # 初始化客户端,请替换为你的API Key和Endpoint client = OpenAI( api_key=os.getenv("DASHSCOPE_API_KEY" ), # 从环境变量获取,或直接替换为 "sk-xxx" base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", # 以北京地域为例 # 构建请求 completion = client.chat.completions.create( model="qwen3.6-plus", # 使用大语言模型优化提示词 messages=[ "role" : "system", "content" : "你是一个专业的AI视频提示词优化助手。请根据用户简单描述,运用‘主体+场景+运动+美学控制+风格化+声音描述’的结构,生成一段丰富、详细、适合视频生成的提示词。" "role" : "user", "content" : "将‘小猫在雪地里玩雪球’优化为一段详细的视频生成提示词,要求温馨可爱,有音效。" optimized_prompt = completion.choices[0].message.content print ("优化后的提示词:" , optimized_prompt) # 假设 optimized_prompt 是上面我们手动构建的那段文本 # 接下来可以将 optimized_prompt 用于视频生成API调用 # 注意:视频生成是另一个API,此处仅展示提示词优化步骤。 通过这个案例,你可以看到,从一句话想法到可执行的提示词,是一个不断添加细节、明确指令的过程。好的提示词本身就是一幅用文字绘制的动态分镜。

3. 案例二:控制多镜头与复杂叙事——“教室里的鼓励”

单镜头视频适用于展示简单动作或美景。但当我们需要讲述一个简短故事时,就需要多镜头叙事。本案例将演示如何为一个校园短剧“教室里的鼓励”编写多镜头提示词。 3.1 多镜头提示词公式 支持多镜头的模型(如万相2.6/2.7)有其特定的公式: 提示词 = 总体描述 + 镜头序号 + 时间戳 + 分镜内容 总体描述:概述整个视频的故事主题、风格和情感基调。 镜头序号:如“镜头1”、“镜头2”。 时间戳:标明该镜头的时间范围,如“[0-3秒]”。 分镜内容:对每个镜头的详细描述,写法可参考单镜头提示词。 3.2 编写多镜头提示词 故事梗概:一个男孩因考试失利在教室沮丧,一个女孩走过来安慰并鼓励他。

第一步:撰写总体描述 这是一个温暖的校园短剧,采用电影感纪实风格,讲述关于挫折与鼓励的故事,整体氛围从低沉转向明亮。

第二步:分解镜头并详细描述 我们将故事分解为3个镜头,并为每个镜头指定时间、景别和内容。

TEXT 镜头1[0-4秒]:中景,固定机位,冷色调。下午空旷的教室,阳光斜射。一个男孩独自坐在靠窗的课桌前,低着头,面前是一张被揉皱的试卷。他用手撑着头,表情失落。窗外传来隐约的喧闹声。 镜头2[4-7秒]:特写,缓慢推进。镜头聚焦在男孩紧握的拳头和试卷上的红色分数上。他的手指微微颤抖。背景虚化,突出情绪的压抑。 镜头3[7-12秒]:过肩镜头,色调逐渐转暖。一个女孩走入画面,将一瓶水轻轻放在男孩桌上。她微笑着说了些什么(无具体台词,口型自然)。男孩缓缓抬起头,眼神中闪过一丝惊讶和缓和。镜头最终定格在两人对视的瞬间,窗外阳光洒在女孩侧脸,形成柔和的轮廓光。

第三步:组合成完整提示词 将总体描述和分镜描述组合起来,就是给模型的多镜头指令。

TEXT 这是一个温暖的校园短剧,采用电影感纪实风格,讲述关于挫折与鼓励的故事,整体氛围从低沉转向明亮。 镜头1[0-4秒]:中景,固定机位,冷色调。下午空旷的教室,阳光斜射。一个男孩独自坐在靠窗的课桌前,低着头,面前是一张被揉皱的试卷。他用手撑着头,表情失落。窗外传来隐约的喧闹声。 镜头2[4-7秒]:特写,缓慢推进。镜头聚焦在男孩紧握的拳头和试卷上的红色分数上。他的手指微微颤抖。背景虚化,突出情绪的压抑。 镜头3[7-12秒]:过肩镜头,色调逐渐转暖。一个女孩走入画面,将一瓶水轻轻放在男孩桌上。她微笑着说了些什么(无具体台词,口型自然)。男孩缓缓抬起头,眼神中闪过一丝惊讶和缓和。镜头最终定格在两人对视的瞬间,窗外阳光洒在女孩侧脸,形成柔和的轮廓光。 3.3 关键技巧与注意事项 时间戳规划:总时长需符合模型限制(通常为几秒到十几秒)。合理分配每个镜头的时长,动作复杂的镜头给更多时间。 镜头间连贯性:确保主体(男孩、女孩)的外貌、服装在镜头间保持一致。在总体描述中强调“同一个男孩”、“同一个女孩”有助于模型理解。 转场暗示:可以在分镜描述中加入“硬切转场”、“淡入淡出”等词汇,但模型理解能力有限,更可靠的是通过时间戳和内容变化来暗示转场。 控制变量:如果想生成固定人物,需要使用“图生视频”或“参考生视频”功能,上传人物参考图,并在提示词中用“图1”指代。 多镜头提示词的核心在于分镜思维,将时间线、视觉焦点和叙事节奏用文字清晰地规划出来。

4. 提示词优化技巧与高级控制

掌握了基础结构和案例后,我们还需要了解一些提升提示词效果和实现高级控制的技巧。 4.1 利用大语言模型自动优化 对于简短或模糊的初始想法,可以借助另一个大语言模型(如通义千问、GPT等)进行优化。这正是案例一中代码示例所做的事情。你可以将前面提到的结构化公式作为 system 指令,让 LLM 扮演提示词优化专家的角色。 优化前的模糊提示:“城市夜景,车流。” LLM优化后的提示:“延时摄影,鸟瞰视角。夜幕下的都市核心区,暖色调的街道灯光与冷色调的玻璃幕墙蓝光交织。密集的车流在立交桥和高架路上形成红色的尾灯光轨与白色的前灯光轨,如同流动的血管。镜头缓慢旋转推进,展现城市的动态与繁华。背景音乐是富有节奏感的电子音乐。” 4.2 使用否定提示词 大多数AI视频生成模型也支持“否定提示词”,用于告诉模型不希望出现什么。这能有效避免常见瑕疵。 常用否定词:ugly, blurry, low resolution, bad anatomy, extra limbs, deformed hands, distorted face, text, watermark, signature(丑陋,模糊,低分辨率,结构错误,多余肢体,畸形的手,扭曲的脸,文字,水印,签名)。 用法:在API调用或工具界面中,通常有独立的 negative_prompt 参数填入这些内容。 4.3 参数协同控制 提示词是首要控制手段,但通常还需配合其他生成参数: 种子:固定种子值可以保证在提示词和其他参数不变时,生成结果具有可复现性。对于调试和微调至关重要。 尺寸与时长:根据平台要求设置视频分辨率和时长。 引导强度:控制模型遵循提示词的程度。过高可能导致画面过饱和、不自然;过低则可能偏离提示。 运动强度:控制视频中动态幅度的大小。 4.4 常见问题排查清单 当生成结果不理想时,可以按以下清单检查你的提示词: 问题现象 可能原因 检查与优化方向 主体不清晰或出现多个主体 主体描述太模糊或混杂。 1. 确保主语明确单一。2. 用细节强化主体特征(如“戴红帽子的男孩”)。3. 使用“聚焦于”、“特写”等词汇。 动作不符合预期或扭曲 运动描述存在歧义或物理上不可能。 1. 分解动作,使其更符合物理规律。2. 避免过于复杂或高速的连续动作。3. 使用“缓慢地”、“轻柔地”等副词控制速度。 画面混乱,元素杂乱 场景描述包含过多无关细节。 1. 遵循“少即是多”原则,突出核心元素。2. 移除与主题无关的形容词。3. 使用否定提示词排除不想要的元素。 风格不一致或跑偏 风格化词汇冲突或权重被覆盖。 1. 将核心风格词放在提示词靠前或靠后位置。2. 避免使用相互冲突的风格(如“水墨画”和“赛博朋克”)。3. 使用“in the style of ...”句式强化风格。 视频闪烁、抖动剧烈 可能由于场景或主体变化过于剧烈。 1. 确保多镜头间有逻辑连贯性。2. 尝试降低运动强度参数。3. 对于单镜头,避免描述瞬间突变。 没有生成声音或声画不同步 未使用支持音频的模型,或声音描述不够具体。 1. 确认模型版本支持音频生成。2. 将声音描述精确到具体事件和物体(如“踩在落叶上的咔嚓声”)。3. 为人声指定情绪和语调。

5. 最佳实践与扩展方向

5.1 提示词写作最佳实践 先写草稿再精修:不要期望一次写出完美提示词。先按公式搭好骨架,再反复迭代,添加细节。 使用具体名词和强动词:用“柯基犬”代替“狗”,用“蹒跚学步”代替“走路”。 注意描述的顺序:通常模型对提示词前部分和后部分权重更高。将最重要的元素(主体、核心动作、风格)放在开头或结尾。 借鉴而非照搬:多分析优秀的生成案例和其提示词,理解其结构,而不是直接复制。结合自己的需求进行改编。 建立自己的提示词库:将测试成功的、效果好的提示词分门别类保存下来,作为未来创作的素材库和灵感来源。 5.2 工程化与扩展方向 对于开发者而言,提示词工程可以更进一步: 模板化与变量替换:为常见场景(如产品展示、新闻播报、教育解说)创建提示词模板,将其中可变的元素(产品名、新闻内容、知识点)设计为变量,通过程序动态替换,实现批量生成。 A/B测试:对于重要的生成任务,可以准备多个不同侧重点的提示词变体进行生成,然后选择最优结果。这可以通过编写简单的脚本自动化完成。 与工作流集成:将提示词生成作为创意工作流的一环。例如,用户输入一个关键词,先用LLM生成一段详细描述,再发送给视频生成模型,最后将结果返回。 迭代优化循环:建立“生成 -> 评估 -> 修改提示词 -> 再生成”的循环。可以人工评估,也可以尝试用视觉描述模型对生成结果进行打分,辅助优化。 掌握提示词写作,本质上是掌握了与新一代生成式AI协作的语言。它要求我们将感性的、模糊的创意,转化为理性的、结构化的指令。这个过程充满挑战,但也极具创造力。从今天介绍的两个案例和结构出发,不断实践、分析和迭代,你将能越来越精准地驾驭AI视频生成能力,将其转化为项目落地或内容创作的高效工具。