AI视频生成提示词实战:从基础公式到多镜头叙事
你是不是也遇到过这种情况:想用 AI 生成一个视频,输入了“一只猫在玩”,结果出来的要么是静态图片,要么是动作僵硬、不知所云的片段。或者,你精心构思了一个复杂的场景描述,AI 却只理解了其中一小部分,生成的视频和你脑海中的画面相去甚远。
问题出在哪里?答案往往不在模型本身,而在于你给它的“指令”——提示词(Prompt)。
很多人把 AI 视频生成想得太简单,以为像聊天一样随便说两句就行。实际上,从“文生图”到“文生视频”,指令的复杂度是指数级上升的。图片是静态的,描述一个瞬间即可;而视频是动态的,需要描述时间线上的变化、镜头运动、声音配合,甚至多角色互动。一个模糊的提示词,就像给一个顶级厨师一张写着“做点好吃的”的纸条,结果可想而知。
今天,我们不谈空洞的理论,直接通过两个实战案例,手把手拆解如何写出能让 AI 精准“听懂”并执行的视频提示词。我们将以阿里云百炼平台的“万相”AI视频模型为例,因为其官方文档提供了目前最系统、最落地的提示词公式,极具参考价值。无论你使用的是 Sora、Runway、Pika 还是其他工具,这些结构化思维和技巧都是通用的。
读完本文,你将掌握:
- 结构化提示词公式:从“主体+场景+运动”的基础三要素,到包含声音、多镜头、参考生视频的进阶公式。
- 两个深度案例拆解:从零开始,一步步构建一个温馨的“冬日小猫玩雪”场景和一个复杂的“多镜头叙事短剧”。
- 可复制的代码与工作流:如何利用大语言模型(如通义千问)自动优化和扩写你的提示词。
- 避坑指南与最佳实践:避开新手常犯的错误,写出高质量、高可控性的视频提示词。
1. 为什么你的AI视频提示词总是不奏效?
在深入案例之前,我们必须先建立一个核心认知:AI视频生成不是魔法,而是基于概率的预测。 你给的提示词越清晰、越结构化,模型预测出的下一帧画面就越符合你的预期。
常见的失败提示词有以下几类:
- 过于笼统:“一个美丽的风景”。(模型:什么样的风景?山?海?草原?动态呢?)
- 缺乏时序:“一个人在跳舞”。(模型:从哪开始跳?跳什么舞?镜头怎么动?)
- 逻辑矛盾:“在寂静的图书馆里大声唱歌”。(模型:到底要安静还是喧闹?)
- 忽略运镜:“两个人对话”。(模型:是特写还是全景?镜头切换吗?)
阿里云万相模型的官方指南揭示了一个关键:高质量的AI视频生成,本质上是将导演思维翻译成机器语言。 你需要告诉AI:谁(主体)、在哪(场景)、做什么(运动)、怎么看(镜头/运镜/风格)、听什么(声音)。这就是结构化提示词的起点。
2. 核心公式拆解:从“拍脑袋”到“写剧本”
根据官方文档,我们可以将提示词写作归纳为几个层层递进的公式。理解这些公式,是写出有效提示词的基础。
2.1 基础公式:确保视频“有东西可看”
- 主体:视频的核心表现对象。可以是人、动物、物体,甚至是抽象概念(如“一团能量”)。
- 场景:主体所处的环境。包括背景、前景、时间、天气等。
- 运动:主体或环境的动态变化。这是视频区别于图片的核心。
示例对比:
- 差:
一只猫(只有主体) - 中:
一只猫在雪地里(主体+场景) - 好:
一只毛茸茸的小奶猫在冬日清晨的雪地庭院里玩雪球(主体+细节场景+具体运动)
这个公式能保证生成一个内容完整、动态合理的短视频,适合快速测试和灵感激发。
2.2 进阶公式:提升视频的“质感”与“故事性”
在基础三要素上,增加了对画面质量和艺术风格的精细控制。
- 主体/场景/运动描述:增加形容词和细节。例如,“身着少数民族服饰的黑发苗族少女”、“破旧却华丽的服饰”、“猛烈地摇摆”。
- 美学控制:相当于摄影指导。包括:
- 光源:日光、火光、霓虹灯光。
- 光线类型:柔光、硬光、侧光、逆光。
- 景别:特写、近景、中景、全景。
- 视角/机位:俯拍、仰拍、过肩镜头、航拍。
- 运镜:镜头推进、拉远、平移、环绕。
- 风格化:定义视觉艺术风格。如“赛博朋克”、“水墨画风”、“黏土动画风格”、“8-bit像素风”。
这个公式让你能像导演一样,精确控制画面的视觉呈现。
2.3 声音公式:实现“声画同步”
(适用于万相2.5/2.6/2.7等支持音频的版本)
视频是视听艺术。声音公式让你能描述音频元素,实现更沉浸的体验。
- 人声 = 角色说话的内容 + 情绪 + 语调 + 语速 + 音色 + 口音
- 示例:
一个男人在讲脱口秀,他说道:“好好学习,天天向上”,语气轻松,语速适中,声音清亮,美式英文。
- 示例:
- 音效 = 音源材质 + 行为 + 环境音
- 示例:
一个玻璃小球从桌面掉在木质地面上,发出“砰”的声音,室内安静环境。
- 示例:
- 背景音乐 = 背景音乐/配乐 + 风格
- 示例:
雨夜,阴森窄小的走廊,尽头有一扇窗户,配有悬疑风格背景音乐。
- 示例:
2.4 多镜头公式:创作“叙事短片”
(适用于万相2.6/2.7等版本)
这是创作故事性短视频的利器。你可以规划镜头序列,控制节奏和转场。
- 总体描述:概述视频主题和风格。
- 镜头序号:
镜头1,镜头2... - 时间戳:
[0-3秒],[3-6秒], 确保内容与时长匹配。 - 分镜内容:为每个镜头单独撰写提示词,可包含上述所有元素。
2.5 参考生视频公式:实现角色/风格一致性
(适用于万相2.6/2.7等版本) 当你有一张人物肖像、一个卡通形象或一个特定场景的图片,想让它“动起来”或融入新场景时,就需要这个公式。
- 万相2.7公式:
提示词 = 参考指代 + 动作 + 场景 + 台词(可选)+ 背景音乐(可选)- 示例:
视频2抱着图3在咖啡厅里弹奏一支舒缓的美式乡村民谣,视频1笑着看着视频2。(其中“视频2”、“图3”、“视频1”指代你上传的参考素材)。
- 示例:
- 万相2.6公式:
提示词 = 主角 + 动作 + 台词 + 场景- 示例:
character1在草地上蹦跳着玩耍,character2在旁边的一颗苹果树下弹奏钢琴,一颗苹果掉到了character2的头上,character1开心地指着character2说:“你要变成科学家了!”。(其中character1、character2指代参考视频中的角色)。
- 示例:
3. 案例一:从“一句话”到“一部短片”——冬日小猫玩雪
目标:将一句简单的“小猫在雪地里玩雪球”,扩展成一个充满细节、声画俱佳的5-10秒短视频。
3.1 原始想法与问题诊断
我们最初的念头是:小猫在雪地里玩雪球。
- 问题:过于简单。猫是什么品种?多大?雪地是什么样?玩的具体动作是什么?有声音吗?画面风格是什么?
- 结果预测:AI自由发挥,可能生成一只普通猫在模糊雪景中做不明动作的普通视频。
3.2 应用进阶公式进行扩写
我们按照 主体+场景+运动+美学控制+风格化 的结构来丰富它。
- 主体描述:
一只毛茸茸的、眼睛圆溜溜的布偶猫幼崽。(确定了品种、年龄、外貌特征) - 场景描述:
冬日清晨,一个铺满厚厚积雪的日式庭院,屋檐下挂着冰凌,远处有一个堆好的小雪人,几株松树上覆盖着白雪。(确定了时间、地点、环境细节) - 运动描述:
小猫先用鼻子好奇地碰了碰雪球,然后用前爪尝试滚动雪球,雪球越滚越大,小猫兴奋地跳起来扑向雪球,结果摔了个屁墩儿,甩甩头又继续玩。(描述了连贯、有因果的动作序列) - 美学控制:
柔和的晨光,侧光,微距特写与中景切换,镜头缓缓跟随小猫运动。(控制了光线、景别和运镜) - 风格化:
吉卜力动画风格,色彩温暖清新。(定义了整体艺术风格)
组合后的提示词:
3.3 应用声音公式增添氛围
视频如果只有画面,感染力减半。我们加上声音描述。
- 人声:无(小猫不会说话)。
- 音效:
小猫爪子踩在雪地上的“咯吱”声。雪球滚动时的“沙沙”声。小猫扑空摔在雪地里的闷响。它甩头时雪花飞溅的细微声响。远处偶尔传来的清脆鸟鸣。
- 背景音乐:
轻快、温馨的钢琴音乐,带有灵动的音乐盒音色,节奏活泼。
最终完整提示词:
效果对比:从一句模糊的话,变成了一个导演脚本。AI 能理解的信息量增加了十倍,生成视频的质感、趣味性和一致性会大幅提升。
4. 案例二:多镜头叙事短片——少年的午后邂逅
目标:创作一个15秒左右,包含三个镜头,有简单情节和情绪变化的叙事短片。
4.1 故事梗概与分镜设计
- 主题:夏日午后,一个在书店看书的少年,与一个匆匆跑过的女孩短暂对视,女孩遗落了一本书,少年拾起后望向她离开的方向。
- 情绪:宁静 -> 偶然 -> 怅然若失。
- 镜头设计:3个镜头。
4.2 应用多镜头公式撰写提示词
我们使用公式:总体描述 + 镜头序号 + 时间戳 + 分镜内容。
公式解析:
- 总体描述:
这是一个关于夏日午后偶然邂逅的短剧,风格是日本青春电影风格,色调清新,带有一点淡淡的忧郁感。(设定了基调和审美) - 镜头1:明确了时间、地点、人物、动作、景别变化(中景->特写)、运镜(推进)、声音(环境音)。
- 镜头2:明确了转场方式(硬切)、人物动作、关键情节(对视)、视角(过肩)、声音变化。
- 镜头3:明确了视角(POV)、关键道具(书)、人物情绪、运镜(拉远)、音乐变化。
这个提示词已经具备了初级电影脚本的雏形,给予了AI非常明确的叙事指令,大大提高了生成视频故事连贯性的概率。
5. 自动化技巧:用大模型帮你优化提示词
手动构思如此详细的提示词费时费力。好消息是,我们可以用另一个大语言模型(LLM)作为“提示词工程师助理”。阿里云文档也给出了示例。
核心思路:将我们前面总结的结构化公式作为 system 指令(系统角色)喂给 LLM,让它根据我们简单的初始想法,生成符合公式的、丰富的提示词。
以下是一个使用阿里云百炼平台(兼容OpenAI API)的通义千问模型(qwen-plus或qwen-max)进行提示词优化的Python示例:
运行环境准备:
- 安装必要库:
pip install openai - 获取API Key:前往阿里云百炼控制台,创建API Key。
- 设置环境变量(推荐):在终端执行
export DASHSCOPE_API_KEY='你的sk-xxx'(Linux/macOS)或在系统设置中添加。 - 运行脚本:
python optimize_prompt.py
预期输出示例(节选):
通过这个自动化流程,你可以将任何简单的灵感火花,快速转化为专业级的视频生成指令,极大提升创作效率。
6. 常见问题(FAQ)与排查指南
在实践过程中,你可能会遇到以下问题。这里提供排查思路和解决方案。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 生成的视频完全偏离主题 | 提示词语义模糊,存在歧义。 | 检查提示词中的核心名词(主体)是否明确。避免使用“东西”、“地方”等代词。 | 将“一个东西在动”改为“一只红色的无人机在夜空中盘旋”。 |
| 视频动作僵硬或不符合物理规律 | 运动描述过于简单或逻辑矛盾。 | 检查运动描述是否连贯。例如,“跳起来然后坐下”是连贯的,“飞起来然后游泳”在普通场景下是矛盾的。 | 将“人物在运动”改为“人物从楼梯上快步跑下,在最后两级台阶时轻盈跃下,稳稳落地”。 |
| 画面闪烁、主体突变 | 提示词中不同描述冲突,或AI对时序理解混乱。 | 检查提示词中是否有相互冲突的风格或状态描述。在多镜头提示中,检查时间戳是否重叠或逻辑跳跃。 | 确保风格一致(如不要同时写“赛博朋克”和“水墨画”)。在多镜头中,确保镜头间动作衔接自然。 |
| 无法生成声音或声画不同步 | 1. 模型版本不支持音频。 2. 声音描述与画面动作时间不匹配。 |
1. 确认使用的模型(如万相2.5+)支持音频生成。 2. 检查音效描述是否对应了画面中的具体动作。 |
1. 切换到支持音频的模型。 2. 将“有音乐”改为“当他按下琴键时,响起一段清脆的钢琴旋律”。 |
| 参考生视频中角色形象变化大 | 1. 参考图质量不高(模糊、多主体)。 2. 提示词中动作描述与参考图姿态差异极大。 |
1. 检查参考图是否清晰、主体突出。 2. 检查动作描述是否在参考图姿态基础上进行合理延伸。 |
1. 使用高清、单一主体、姿态清晰的图片作为参考。 2. 动作描述从参考图姿态自然过渡,如“图1中的人物从站立变为缓缓坐下”。 |
| 提示词过长导致报错或忽略部分内容 | 模型有token长度限制,过长的提示词后半部分可能被截断。 | 简化提示词,优先保留核心指令(主体、关键运动、核心风格)。 | 使用“分阶段生成”策略。先用一个简短提示词生成大致视频,再用图生视频功能,以生成视频为参考,用新提示词细化调整。 |
7. 最佳实践与高级技巧
掌握了基础方法和案例后,以下技巧能帮助你更稳定地产出高质量视频:
- 先写“剧本”,再写“提示词”:不要边想边写。先用几句话写下你想讲的故事或看到的画面,然后再将其拆解成结构化提示词要素。
- 善用“负面提示词”:许多AI视频工具支持负面提示词(Negative Prompt),用于告诉模型不要什么。例如,可以加上“
low quality, blurry, distorted face, extra limbs, bad anatomy”来规避常见低质量或畸形问题。 - 迭代优化,而非一次成功:将第一次生成的结果作为“草稿”。如果画面满意但动作不对,可以将其作为“图生视频”的参考图,在新提示词中只修改运动描述。这种工作流效率更高。
- 控制视频长度与节奏:目前多数AI视频生成长度有限(如4秒、10秒)。对于更长的叙事,可以分段生成多个短视频,后期剪辑拼接。在提示词中用“
slow motion”(慢动作)、“fast paced”(快节奏)来控制时间感。 - 融合多种公式:一个提示词可以同时包含风格化、运镜和声音描述。例如:
[电影感运镜] + [赛博朋克风格] + [具体场景动作] + [ synthwave背景音乐]。 - 建立你的提示词库:将效果好的“美学控制”词汇(如“
cinematic lighting, anamorphic lens flare, shallow depth of field”)和“风格化”词汇(如“Studio Ghibli style, cyberpunk, oil painting”)收集起来,方便后续组合使用。
8. 总结:从“描述者”到“导演”
AI视频生成的门槛,正在从“会不会用工具”迅速转移到“会不会下指令”。通过本文两个案例的拆解,我们可以看到,写出好提示词的关键在于思维的转变:
- 从“描述画面”到“设计镜头”:不仅要告诉AI“有什么”,还要告诉它“怎么看”——用什么景别、什么角度、镜头怎么运动。
- 从“列举元素”到“构建叙事”:特别是对于多镜头视频,要有起承转合的时间线意识,用提示词控制节奏和情绪。
- 从“依赖模型”到“驾驭模型”:通过结构化公式和自动化工具(LLM优化),将模糊的创意转化为模型可精准执行的、低歧义的指令。
提示词工程是AI时代最重要的元技能之一。它不仅是与机器沟通的语言,更是将人类创意具象化的桥梁。现在,就打开你的AI视频工具,用今天学到的公式,从一个简单的想法开始,尝试导演你的第一部AI短片吧。记住,最好的学习方式是实践,然后迭代。