AI视频生成 提示词 Prompt工程 于 2026-07-07 15:51:10 修改 你是不是也遇到过这种情况:想用 AI 生成一个视频,输入了“一只猫在玩”,结果出来的要么是静态图片,要么是动作僵硬、不知所云的片段。或者,你精心构思了一个复杂的场景描述,AI 却只理解了其中一小部分,生成的视频和你脑海中的画面相去甚远。 问题出在哪里?答案往往不在模型本身,而在于你给它的“指令”——提示词(Prompt)。 很多人把 AI 视频生成想得太简单,以为像聊天一样随便说两句就行。实际上,从“文生图”到“文生视频”,指令的复杂度是指数级上升的。图片是静态的,描述一个瞬间即可;而视频是动态的,需要描述时间线上的变化、镜头运动、声音配合,甚至多角色互动。一个模糊的提示词,就像给一个顶级厨师一张写着“做点好吃的”的纸条,结果可想而知。 今天,我们不谈空洞的理论,直接通过两个实战案例,手把手拆解如何写出能让 AI 精准“听懂”并执行的视频提示词。我们将以阿里云百炼平台的“万相”AI视频模型为例,因为其官方文档提供了目前最系统、最落地的提示词公式,极具参考价值。无论你使用的是 Sora、Runway、Pika 还是其他工具,这些结构化思维和技巧都是通用的。 读完本文,你将掌握: 结构化提示词公式:从“主体+场景+运动”的基础三要素,到包含声音、多镜头、参考生视频的进阶公式。 两个深度案例拆解:从零开始,一步步构建一个温馨的“冬日小猫玩雪”场景和一个复杂的“多镜头叙事短剧”。 可复制的代码与工作流:如何利用大语言模型(如通义千问)自动优化和扩写你的提示词。 避坑指南与最佳实践:避开新手常犯的错误,写出高质量、高可控性的视频提示词。

1. 为什么你的AI视频提示词总是不奏效?

在深入案例之前,我们必须先建立一个核心认知:AI视频生成不是魔法,而是基于概率的预测。 你给的提示词越清晰、越结构化,模型预测出的下一帧画面就越符合你的预期。 常见的失败提示词有以下几类: 过于笼统:“一个美丽的风景”。(模型:什么样的风景?山?海?草原?动态呢?) 缺乏时序:“一个人在跳舞”。(模型:从哪开始跳?跳什么舞?镜头怎么动?) 逻辑矛盾:“在寂静的图书馆里大声唱歌”。(模型:到底要安静还是喧闹?) 忽略运镜:“两个人对话”。(模型:是特写还是全景?镜头切换吗?) 阿里云万相模型的官方指南揭示了一个关键:高质量的AI视频生成,本质上是将导演思维翻译成机器语言。 你需要告诉AI:谁(主体)、在哪(场景)、做什么(运动)、怎么看(镜头/运镜/风格)、听什么(声音)。这就是结构化提示词的起点。

2. 核心公式拆解:从“拍脑袋”到“写剧本”

根据官方文档,我们可以将提示词写作归纳为几个层层递进的公式。理解这些公式,是写出有效提示词的基础。 2.1 基础公式:确保视频“有东西可看” TEXT 提示词 = 主体 + 场景 + 运动 主体:视频的核心表现对象。可以是人、动物、物体,甚至是抽象概念(如“一团能量”)。 场景:主体所处的环境。包括背景、前景、时间、天气等。 运动:主体或环境的动态变化。这是视频区别于图片的核心。 示例对比: 差:一只猫 (只有主体) 中:一只猫在雪地里 (主体+场景) 好:一只毛茸茸的小奶猫在冬日清晨的雪地庭院里玩雪球 (主体+细节场景+具体运动) 这个公式能保证生成一个内容完整、动态合理的短视频,适合快速测试和灵感激发。 2.2 进阶公式:提升视频的“质感”与“故事性” TEXT 提示词 = 主体(主体描述) + 场景(场景描述) + 运动(运动描述) + 美学控制 + 风格化 在基础三要素上,增加了对画面质量和艺术风格的精细控制。 主体/场景/运动描述:增加形容词和细节。例如,“身着少数民族服饰的黑发苗族少女”、“破旧却华丽的服饰”、“猛烈地摇摆”。 美学控制:相当于摄影指导。包括: 光源:日光、火光、霓虹灯光。 光线类型:柔光、硬光、侧光、逆光。 景别:特写、近景、中景、全景。 视角/机位:俯拍、仰拍、过肩镜头、航拍。 运镜:镜头推进、拉远、平移、环绕。 风格化:定义视觉艺术风格。如“赛博朋克”、“水墨画风”、“黏土动画风格”、“8-bit像素风”。 这个公式让你能像导演一样,精确控制画面的视觉呈现。 2.3 声音公式:实现“声画同步” (适用于万相2.5/2.6/2.7等支持音频的版本) TEXT 提示词 = 主体 + 场景 + 运动 + 声音描述(人声/音效/背景音乐) 视频是视听艺术。声音公式让你能描述音频元素,实现更沉浸的体验。 人声 = 角色说话的内容 + 情绪 + 语调 + 语速 + 音色 + 口音 示例:一个男人在讲脱口秀,他说道:“好好学习,天天向上”,语气轻松,语速适中,声音清亮,美式英文。 音效 = 音源材质 + 行为 + 环境音 示例:一个玻璃小球从桌面掉在木质地面上,发出“砰”的声音,室内安静环境。 背景音乐 = 背景音乐/配乐 + 风格 示例:雨夜,阴森窄小的走廊,尽头有一扇窗户,配有悬疑风格背景音乐。 2.4 多镜头公式:创作“叙事短片” (适用于万相2.6/2.7等版本) TEXT 提示词 = 总体描述 + 镜头序号 + 时间戳 + 分镜内容 这是创作故事性短视频的利器。你可以规划镜头序列,控制节奏和转场。 总体描述:概述视频主题和风格。 镜头序号:镜头1 , 镜头2 ... 时间戳:[0-3秒] , [3-6秒] , 确保内容与时长匹配。 分镜内容:为每个镜头单独撰写提示词,可包含上述所有元素。 2.5 参考生视频公式:实现角色/风格一致性 (适用于万相2.6/2.7等版本) 当你有一张人物肖像、一个卡通形象或一个特定场景的图片,想让它“动起来”或融入新场景时,就需要这个公式。 万相2.7公式:提示词 = 参考指代 + 动作 + 场景 + 台词(可选)+ 背景音乐(可选) 示例:视频2抱着图3在咖啡厅里弹奏一支舒缓的美式乡村民谣,视频1笑着看着视频2。(其中“视频2”、“图3”、“视频1”指代你上传的参考素材)。 万相2.6公式:提示词 = 主角 + 动作 + 台词 + 场景 示例:character1在草地上蹦跳着玩耍,character2在旁边的一颗苹果树下弹奏钢琴,一颗苹果掉到了character2的头上,character1开心地指着character2说:“你要变成科学家了!”。(其中character1 、character2 指代参考视频中的角色)。

3. 案例一:从“一句话”到“一部短片”——冬日小猫玩雪

目标:将一句简单的“小猫在雪地里玩雪球”,扩展成一个充满细节、声画俱佳的5-10秒短视频。 3.1 原始想法与问题诊断 我们最初的念头是:小猫在雪地里玩雪球 。 问题:过于简单。猫是什么品种?多大?雪地是什么样?玩的具体动作是什么?有声音吗?画面风格是什么? 结果预测:AI自由发挥,可能生成一只普通猫在模糊雪景中做不明动作的普通视频。 3.2 应用进阶公式进行扩写 我们按照 主体+场景+运动+美学控制+风格化 的结构来丰富它。 主体描述:一只毛茸茸的、眼睛圆溜溜的布偶猫幼崽 。(确定了品种、年龄、外貌特征) 场景描述:冬日清晨,一个铺满厚厚积雪的日式庭院,屋檐下挂着冰凌,远处有一个堆好的小雪人,几株松树上覆盖着白雪。(确定了时间、地点、环境细节) 运动描述:小猫先用鼻子好奇地碰了碰雪球,然后用前爪尝试滚动雪球,雪球越滚越大,小猫兴奋地跳起来扑向雪球,结果摔了个屁墩儿,甩甩头又继续玩。(描述了连贯、有因果的动作序列) 美学控制:柔和的晨光,侧光,微距特写与中景切换,镜头缓缓跟随小猫运动。 (控制了光线、景别和运镜) 风格化:吉卜力动画风格,色彩温暖清新。 (定义了整体艺术风格) 组合后的提示词: TEXT 一只毛茸茸的、眼睛圆溜溜的布偶猫幼崽,在冬日清晨一个铺满厚厚积雪的日式庭院里(屋檐有冰凌,远处有雪人)玩雪球。它先用鼻子好奇地碰雪球,然后用前爪滚动雪球,雪球变大后兴奋地跳扑,结果摔了个屁墩儿,甩甩头继续玩。柔和的晨光侧射,采用微距特写与中景切换,镜头缓缓跟随。吉卜力动画风格,色彩温暖清新。 3.3 应用声音公式增添氛围 视频如果只有画面,感染力减半。我们加上声音描述。 人声:无(小猫不会说话)。 音效: 小猫爪子踩在雪地上的“咯吱”声。 雪球滚动时的“沙沙”声。 小猫扑空摔在雪地里的闷响。 它甩头时雪花飞溅的细微声响。 远处偶尔传来的清脆鸟鸣。 背景音乐:轻快、温馨的钢琴音乐,带有灵动的音乐盒音色,节奏活泼。 最终完整提示词: TEXT 一只毛茸茸的、眼睛圆溜溜的布偶猫幼崽,在冬日清晨一个铺满厚厚积雪的日式庭院里(屋檐有冰凌,远处有雪人)玩雪球。它先用鼻子好奇地碰雪球,然后用前爪滚动雪球,雪球变大后兴奋地跳扑,结果摔了个屁墩儿,甩甩头继续玩。柔和的晨光侧射,采用微距特写与中景切换,镜头缓缓跟随。吉卜力动画风格,色彩温暖清新。 音效:爪子踩雪的“咯吱”声,雪球滚动的“沙沙”声,摔在雪地的闷响,甩头时雪花飞溅声,远处清脆鸟鸣。 背景音乐:轻快温馨的钢琴曲,带有音乐盒般灵动的音色。 效果对比:从一句模糊的话,变成了一个导演脚本。AI 能理解的信息量增加了十倍,生成视频的质感、趣味性和一致性会大幅提升。

4. 案例二:多镜头叙事短片——少年的午后邂逅

目标:创作一个15秒左右,包含三个镜头,有简单情节和情绪变化的叙事短片。 4.1 故事梗概与分镜设计 主题:夏日午后,一个在书店看书的少年,与一个匆匆跑过的女孩短暂对视,女孩遗落了一本书,少年拾起后望向她离开的方向。 情绪:宁静 -> 偶然 -> 怅然若失。 镜头设计:3个镜头。 4.2 应用多镜头公式撰写提示词 我们使用公式:总体描述 + 镜头序号 + 时间戳 + 分镜内容 。 TEXT 这是一个关于夏日午后偶然邂逅的短剧,风格是日本青春电影风格,色调清新,带有一点淡淡的忧郁感。 镜头1[0-5秒]:夏日午后,阳光透过梧桐树叶洒下斑驳光影。一家安静的街角书店内,一个穿着白色衬衫的少年坐在靠窗的木桌前,专注地阅读一本厚书。手边放着一杯冰咖啡,水珠缓缓滑落。镜头从中景缓缓推至少年阅读时的面部特写,他神情宁静。环境音是书店里轻柔的爵士乐和翻书声。 镜头2[5-10秒]:硬切转场。书店玻璃门外,一个穿着碎花连衣裙、头戴草帽的女孩抱着几本书匆匆跑过,仿佛在赶时间。经过窗前时,她不经意间转头,与窗内抬头的少年视线相遇,时间仿佛静止了一秒。女孩微微一愣,随即抱歉地浅笑一下,继续跑开。镜头采用过肩视角,跟随女孩运动,背景虚化。音效是突然清晰的脚步声和短暂的安静。 镜头3[10-15秒]:镜头切回少年视角(POV镜头)。少年望向窗外,发现地上躺着一本女孩遗落的书(一本《小王子》)。他起身,走出书店门,俯身捡起书。他拿着书,望向街道尽头女孩消失的方向,眼神有些许迷茫和怅然。风吹过,书页轻轻翻动。镜头缓缓拉远,变成书店门口的远景,少年小小的身影立在午后的阳光中。背景音乐转为一段孤单的钢琴旋律。 公式解析: 总体描述:这是一个关于夏日午后偶然邂逅的短剧,风格是日本青春电影风格,色调清新,带有一点淡淡的忧郁感。 (设定了基调和审美) 镜头1:明确了时间、地点、人物、动作、景别变化(中景->特写)、运镜(推进)、声音(环境音)。 镜头2:明确了转场方式(硬切)、人物动作、关键情节(对视)、视角(过肩)、声音变化。 镜头3:明确了视角(POV)、关键道具(书)、人物情绪、运镜(拉远)、音乐变化。 这个提示词已经具备了初级电影脚本的雏形,给予了AI非常明确的叙事指令,大大提高了生成视频故事连贯性的概率。

5. 自动化技巧:用大模型帮你优化提示词

手动构思如此详细的提示词费时费力。好消息是,我们可以用另一个大语言模型(LLM)作为“提示词工程师助理”。阿里云文档也给出了示例。 核心思路:将我们前面总结的结构化公式作为 system 指令(系统角色)喂给 LLM,让它根据我们简单的初始想法,生成符合公式的、丰富的提示词。 以下是一个使用阿里云百炼平台(兼容OpenAI API)的通义千问模型(qwen-plus或qwen-max)进行提示词优化的Python示例: PYTHON import os from openai import OpenAI # 初始化客户端,使用阿里云百炼的API # 请替换为你的真实API Key,可从阿里云百炼控制台获取 client = OpenAI( api_key=os.getenv("DASHSCOPE_API_KEY" ), # 建议将API Key设置为环境变量 base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", # 阿里云百炼API端点 def optimize_video_prompt (user_prompt: str, style: str = "detailed") -> str : 使用大模型优化视频生成提示词。 Args: user_prompt: 用户简单的初始提示词,如“小猫在雪地里玩雪球” style: 优化风格,可选 'detailed'(详细), 'cinematic'(电影感), 'simple'(简洁) Returns: 优化后的完整提示词字符串 # 定义系统角色,即“提示词优化助手”的指令 # 这里我们融合了基础公式和声音公式 system_content = """你是一个专业的AI视频提示词优化助手。请根据以下结构化公式,将用户简单的想法扩展成丰富、详细、可直接用于AI视频生成的提示词。 核心公式:提示词 = 主体(细节描述) + 场景(细节描述) + 运动(细节描述) + 美学控制(光源/光线/景别/运镜) + 风格化 + 声音描述(人声/音效/BGM) 请按以下结构组织你的回复:

1. 【主体】...

2. 【场景】...

3. 【运动】...

4. 【美学控制】...

5. 【风格化】...

6. 【声音描述】...

7. 【完整提示词】:将以上所有部分流畅地组合成一个段落。

要求: • 描述具体,使用生动的形容词和名词。 • 运动描述要有时间顺序和因果逻辑。 • 美学控制要符合场景氛围。 • 声音描述要贴合画面动作。 • 最终输出的【完整提示词】段落要自然流畅,可直接使用。 # 根据风格微调用户指令 if style == "cinematic": user_content = f"请以电影感、富有镜头语言的方式优化以下视频创意:{user_prompt}" elif style == "simple": user_content = f"请优化以下视频创意,保持简洁但关键细节完整:{user_prompt}" else : # detailed user_content = f"请详细地优化以下视频创意,补充所有可能的细节:{user_prompt}" try : response = client.chat.completions.create( model="qwen-plus", # 或使用 "qwen-max" 获得更强能力 messages=[ {"role" : "system", "content": system_content}, {"role" : "user", "content": user_content} temperature=0.7, # 控制创造性,0.7比较平衡 max_tokens=1500, optimized_prompt = response.choices[0 ].message.content return optimized_prompt except Exception as e: print (f"调用API出错: {e}" ) return None if __name__ == "__main__": # 测试用例1:优化“小猫玩雪” simple_prompt = "小猫在雪地里玩雪球" result = optimize_video_prompt(simple_prompt, style="detailed") if result: print ("=== 优化后的提示词 ===") print (result) # 测试用例2:优化一个故事场景 print ("\n" + "=" * 50 + "\n" ) story_prompt = "一个宇航员在月球上发现了一朵花" result2 = optimize_video_prompt(story_prompt, style="cinematic") if result2: print ("=== 优化后的提示词(电影感) ===") print (result2) 运行环境准备: 安装必要库:pip install openai 获取API Key:前往阿里云百炼控制台,创建API Key。 设置环境变量(推荐):在终端执行 export DASHSCOPE_API_KEY='你的sk-xxx' (Linux/macOS)或在系统设置中添加。 运行脚本:python optimize_prompt.py 预期输出示例(节选): TEXT === 优化后的提示词 ===

1. 【主体】一只毛茸茸的、约三个月大的金渐层小奶猫,拥有琥珀色的大眼睛和粉嫩的鼻头。

2. 【场景】冬日晴朗的清晨,一个被厚厚白雪覆盖的古典欧式庭院。晶莹的冰柱悬挂在石雕栏杆上,远处有一个戴着胡萝卜鼻子和石子眼睛的雪人,几棵落光叶子的橡树枝头积着雪。

3. 【运动】小猫先是小心翼翼地用前爪试探性地拍了拍一个拳头大小的雪球,然后开始用两只前爪交替推动雪球,雪球在滚动中逐渐变大。小猫玩得兴起,试图用整个身体抱住大雪球,结果失去平衡向后仰倒,在雪地上留下一个猫形印记,它迅速翻身,甩掉脸上的雪,对着雪球发出“喵呜”的好奇叫声。

4. 【美学控制】柔和的晨间侧逆光,凸显小猫毛发边缘的金色光泽和雪地的质感。景别从雪球的微距特写拉开到小猫玩耍的中景,镜头带有轻微的呼吸感晃动,模拟手持拍摄的亲切感。

5. 【风格化】迪士尼皮克斯风格的3D动画,渲染真实,毛发和雪地质感细腻,色彩明亮温暖。

6. 【声音描述】人声:无。音效:爪子踩雪的“咯吱”声、雪球滚动的“沙沙”声、小猫摔倒的闷响、甩头的“噗噗”声、好奇的“喵呜”声、远处偶尔的鸟鸣。背景音乐:轻快、温馨的弦乐与钢琴交织的短曲,节奏活泼可爱。

7. 【完整提示词】:一只毛茸茸的金渐层小奶猫,在冬日清晨一个白雪皑皑的古典庭院里玩雪球。它先用爪子拍打雪球,然后推动雪球变大,试图拥抱时仰面摔倒,又迅速翻身好奇地打量。柔和的侧逆光下,镜头从特写拉至中景,带有轻微呼吸感。采用迪士尼皮克斯3D动画风格。音效包括踩雪声、滚动声、摔倒声、猫叫和鸟鸣,背景是轻快温馨的弦乐钢琴曲。

通过这个自动化流程,你可以将任何简单的灵感火花,快速转化为专业级的视频生成指令,极大提升创作效率。

6. 常见问题(FAQ)与排查指南

在实践过程中,你可能会遇到以下问题。这里提供排查思路和解决方案。 问题现象 可能原因 排查方式 解决方案 生成的视频完全偏离主题 提示词语义模糊,存在歧义。 检查提示词中的核心名词(主体)是否明确。避免使用“东西”、“地方”等代词。 将“一个东西在动”改为“一只红色的无人机在夜空中盘旋”。 视频动作僵硬或不符合物理规律 运动描述过于简单或逻辑矛盾。 检查运动描述是否连贯。例如,“跳起来然后坐下”是连贯的,“飞起来然后游泳”在普通场景下是矛盾的。 将“人物在运动”改为“人物从楼梯上快步跑下,在最后两级台阶时轻盈跃下,稳稳落地”。 画面闪烁、主体突变 提示词中不同描述冲突,或AI对时序理解混乱。 检查提示词中是否有相互冲突的风格或状态描述。在多镜头提示中,检查时间戳是否重叠或逻辑跳跃。 确保风格一致(如不要同时写“赛博朋克”和“水墨画”)。在多镜头中,确保镜头间动作衔接自然。 无法生成声音或声画不同步 1. 模型版本不支持音频。

2. 声音描述与画面动作时间不匹配。 1. 确认使用的模型(如万相2.5+)支持音频生成。

2. 检查音效描述是否对应了画面中的具体动作。 1. 切换到支持音频的模型。

2. 将“有音乐”改为“当他按下琴键时,响起一段清脆的钢琴旋律”。

参考生视频中角色形象变化大 1. 参考图质量不高(模糊、多主体)。

2. 提示词中动作描述与参考图姿态差异极大。 1. 检查参考图是否清晰、主体突出。

2. 检查动作描述是否在参考图姿态基础上进行合理延伸。 1. 使用高清、单一主体、姿态清晰的图片作为参考。

2. 动作描述从参考图姿态自然过渡,如“图1中的人物从站立变为缓缓坐下”。

提示词过长导致报错或忽略部分内容 模型有token长度限制,过长的提示词后半部分可能被截断。 简化提示词,优先保留核心指令(主体、关键运动、核心风格)。 使用“分阶段生成”策略。先用一个简短提示词生成大致视频,再用图生视频功能,以生成视频为参考,用新提示词细化调整。

7. 最佳实践与高级技巧

掌握了基础方法和案例后,以下技巧能帮助你更稳定地产出高质量视频: 先写“剧本”,再写“提示词”:不要边想边写。先用几句话写下你想讲的故事或看到的画面,然后再将其拆解成结构化提示词要素。 善用“负面提示词”:许多AI视频工具支持负面提示词(Negative Prompt),用于告诉模型不要什么。例如,可以加上“low quality, blurry, distorted face, extra limbs, bad anatomy”来规避常见低质量或畸形问题。 迭代优化,而非一次成功:将第一次生成的结果作为“草稿”。如果画面满意但动作不对,可以将其作为“图生视频”的参考图,在新提示词中只修改运动描述。这种工作流效率更高。 控制视频长度与节奏:目前多数AI视频生成长度有限(如4秒、10秒)。对于更长的叙事,可以分段生成多个短视频,后期剪辑拼接。在提示词中用“slow motion ”(慢动作)、“fast paced ”(快节奏)来控制时间感。 融合多种公式:一个提示词可以同时包含风格化、运镜和声音描述。例如:[电影感运镜] + [赛博朋克风格] + [具体场景动作] + [ synthwave背景音乐]。 建立你的提示词库:将效果好的“美学控制”词汇(如“cinematic lighting, anamorphic lens flare, shallow depth of field”)和“风格化”词汇(如“Studio Ghibli style, cyberpunk, oil painting ”)收集起来,方便后续组合使用。

8. 总结:从“描述者”到“导演”

AI视频生成的门槛,正在从“会不会用工具”迅速转移到“会不会下指令”。通过本文两个案例的拆解,我们可以看到,写出好提示词的关键在于思维的转变: 从“描述画面”到“设计镜头”:不仅要告诉AI“有什么”,还要告诉它“怎么看”——用什么景别、什么角度、镜头怎么运动。 从“列举元素”到“构建叙事”:特别是对于多镜头视频,要有起承转合的时间线意识,用提示词控制节奏和情绪。 从“依赖模型”到“驾驭模型”:通过结构化公式和自动化工具...