LongCat-Video提示词工程完全指南:7个核心技巧让AI视频质量飞跃 原创 于 2026-10-06 17:41:38 发布 · 17 阅读 · LongCat-Video提示词工程完全指南:7个核心技巧让AI视频质量飞跃 【免费下载链接】LongCat-Video 项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video LongCat-Video 是美团开源的 13.6B 参数 AI 视频生成模型,支持文生视频、图生视频、长视频续写和音频驱动数字人等任务。在实际使用中,提示词(Prompt)写得是否到位,直接决定了生成视频质量的上限。本文从官方示例代码和技术报告中提炼出 7 个核心提示词技巧,帮助新手快速写出高命中率的 LongCat-Video 提示词 🎬。 提示词如何影响视频生成 LongCat-Video 的文本编码器(UMT5)会把你的提示词转化为语义信号,再与 guidance_scale (默认 4.0)共同控制"画面服从文字的紧密程度"。核心流程封装在 longcat_video/pipeline_longcat_video.py,你只需把提示词写对,模型就能稳定发挥。 技巧1:在提示词开头明确视频风格 官方提示词增强器的规则第一条就是"必须在描述开头指定视频风格": 不指定时 → 默认 真实摄影风格(realistic filming style) 指定动画 → 默认按 3D动画风格 处理 指定 2D → 按 2D动漫风格 处理 realistic filming style, a person wearing a dark helmet rides a skateboard along a winding mountain road... 风格词放在句首,可以避免生成结果风格漂移、前后色调突变。 技巧2:外观环境写详细,动作描述写简洁 这是 LongCat-Video 官方改写规则中最关键的一条: 描述对象 写法要求 人物/物体外观 详细:年纪、穿着、发型、颜色、材质、新旧 环境背景 详细:光线、场景、空间关系 动作过程 简洁、用常规动词,但要完整描述整个动作过程 参考 run_demo_text_to_video.py 中的官方示例提示词: "A white boy around seven or eight years old sits on a park bench, wearing a light blue T-shirt... Smiling, the boy offers the ice cream to the dog, who eagerly licks it with its tongue. The sun is shining brightly..." 外观(蓝T恤、牛仔短裤)+ 环境(阳光、草坪、树木)都交代清楚,动作则用"递出冰淇淋—狗舔食"这样一条完整链条表达。 技巧3:善用标准负向提示词 所有官方 Demo 都配了同一套"防翻车"负向提示词,位于 run_demo_text_to_video.py: Bright tones, overexposed, static, blurred details, subtitles... worst quality, low quality, JPEG compression residue, extra fingers, poorly drawn hands, deformed... 新手可直接整段复用。⚠️ 注意一个细节:启用蒸馏加速(distill)模式时不需要负向提示词, run_streamlit.py 中该输入框在蒸馏模式下是禁用状态。 技巧4:用内置 Prompt 增强器自动扩写 如果你不擅长长句写作,项目内置了提示词增强模块 longcat_video/utils/prompt_enhancer.py,它会自动完成: T2V 模式:把简短输入扩写为 80~250 字的完整描述(英文 100~150 词),自动补全风格、人物特征与环境细节 I2V 模式:结合参考图内容补充动作描述,输出 50~80 字的精简提示词 例如输入"一杯分层饮料,勺子舀起泡沫",增强器会补全"勺子伸入泡沫→接触表面→逐渐舀出→泡沫形成小土堆"的完整动作链。它同时支持中英文输入,会自动识别语言并匹配对应改写规则。 技巧5:图生视频只描述动作,别复述外观 图生视频(I2V)时,画面外观已由参考图决定,官方增强规则明确要求"重点描述主体和动作,不必描述外观细节"。run_demo_image_to_video.py 中的示例就是标准写法: "A woman sits at a wooden table by the window... She reaches out with her right hand, picks up the white coffee cup... brings it to her lips to take a sip. After drinking, she places the cup back and looks out the window..." 一个动作接一个动作地"分镜式"推进,画面自然流畅。 技巧6:数字人(Avatar)提示词要加"说话"动作提示 LongCat-Video-Avatar 支持单人/多人音频驱动视频,官方用户提示给出两条关键经验: 提示词中加入明确的言语动作线索,如 "speaking"、"talking",口型会更自然 提示词越长越详细越好——包含人物外貌、动作、场景上下文,一致性更高 单人音频驱动示例(assets/avatar/single_example_1.json): "A western man stands on stage under dramatic lighting, holding a microphone close to their mouth. Wearing a vibrant red jacket with gold embroidery, the singer is speaking while smoke swirls around them..." 多人对唱场景(assets/avatar/multi_example_1.json)开头还加了 "Static camera"(固定机位),并详细刻画了两人的互动细节: "Static camera, In a professional recording studio, two people stand facing each other, both wearing large headphones. They are speaking clearly into a large condenser microphone..." 多人"介绍"场景同样适用该写法,参考 assets/avatar/multi_example_2.json 与运行脚本 run_demo_avatar_single_audio_to_video.py、run_demo_avatar_multi_audio_to_video.py : 技巧7:长视频与交互式生成要"分段写提示词" 生成分钟级长视频时,提示词不是写一段,而是每个片段写一句,且首段负责铺陈场景,后续片段只写"下一步动作"。官方交互式示例 run_demo_interactive_video.py 是教科书级写法: 首段:明亮的厨房 + 白橱柜 + 木台面 + 碎花围裙女士……完整场景铺陈 "The woman puts down the knife, reaches for the carton of milk and pours it into the glass." "The woman puts down the milk carton." "The woman picks up the glass of milk and takes a sip." 后续片段保持人物称呼与主语一致(始终用 "The woman"),是长视频人物不"变脸"的关键。纯长视频续写可参考 run_demo_long_video.py ——同一条详细提示词驱动 11 个片段,全程无色彩漂移。 快速上手路径 先用 run_streamlit.py 启动 Web 界面,在 "Positive Prompt" 输入框中按本文 7 个技巧写作 普通模式:详细提示词 + 标准负向提示词,50 步、guidance_scale 4.0 蒸馏加速模式:提示词同上,但省略负向提示词,16 步出片 不放心质量时,用 longcat_video/utils/prompt_enhancer.py 先自动扩写再提交 总结 场景 提示词要点 文生视频 风格开头 + 外观环境详细 + 动作完整链 + 标准负向提示词 图生视频 只写动作分镜,不复述外观 数字人 加入 speaking/talking 线索,提示词求长求全 长视频 首段铺场景,后续片段短句推进,主语保持一致 把提示词当作"分镜脚本"来写,而不是"一句话需求",是 LongCat-Video 出片质量飞跃的核心心法 ✨。 【免费下载链接】LongCat-Video 项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video