如何编写真正有效的AI视频提示词:一个五维框架
- 是什么让 AI 视频提示词奏效?
- AI 视频提示词的五个维度
- 辅助控制:时长、格式、音频与连续性
- 文生视频与图生视频的提示词有所不同
- 真实的 AI 视频示例及其启示
- 可直接复制的 AI 视频提示词模板
- 常见的 AI 视频提示词错误与实用修复方法
- 如何修改失败的生成结果
- 大多数 AI 视频提示词指南遗漏了什么
- 适合初学者的简单练习计划
- 生成前的最终清单
- 常见问题解答
- 结论
AI 视频生成器可以将简短的描述转化为动态场景,但模糊的提示词通常只会产生模糊的结果。主体在第一帧中可能看起来很正常,然后却变形了;镜头可能会保持静止,或者几个动作会融合成一个令人困惑的杂乱运动。
解决这个问题的办法不是在提示词中塞满更多的形容词。更好的方法是编写一个精炼的镜头简介:明确画面中有什么、什么在发生变化、镜头如何观察它,以及哪些细节必须保持稳定。本指南将通过五维度框架、真实视频示例、可直接复制的模板以及一个简单的修改工作流,讲解如何为 AI 视频生成编写提示词。
是什么让 AI 视频提示词奏效?
一个实用的 AI 视频提示词能给模型一个清晰的视觉任务。它会识别出主要主体、描述一个可见的动作、将该动作置于特定的环境中、引导镜头运动,并定义镜头的视觉外观。
弱提示词:
一位美丽的女人走在电影感十足的城市中。
这留下了几个有待确定的重要决策。这个女人长什么样?她是走向镜头还是背对镜头?镜头是静止的还是运动的?模型应该使用哪个城市、什么时间和光照?
更强的提示词:
一位留着短黑发、穿黑色皮夹克和深色长裤的年轻女子,缓缓走过被雨水打湿的东京街道,随后转身面向镜头。中景侧面跟拍,镜头轻柔地向前推进。湿润的路面倒映着蓝色和粉色霓虹,空气中弥漫着淡淡的雾气。逼真的 35 毫米胶片质感,低饱和度色彩,柔和的霓虹侧光,时长 8 秒。

第二个版本为生成器提供了主体、动作、背景、镜头方向、视觉处理和时长。它不能保证产生完美的结果,但它减少了所需的猜测成分。
AI 视频提示词的五个维度
请使用以下顺序作为起点:
[主体] + [动作] + [环境] + [镜头] + [风格与光照]

对于准备用于制作的提示词,请在后面添加输出控制项:
[时长] + [宽高比] + [音频] + [连续性规则]
这五个维度描述了镜头的创意内容。时长、格式、声音和连续性则是辅助约束,有助于使结果更易于使用。
1. 主体:定义观众应该看到什么
从人物、产品、动物或主要物体开始。使用对镜头重要的细节,而不是去描述你能想象到的一切。
对于人物,有用的细节可能包括:
- 大致年龄;
- 发型、服装和配饰;
- 身体姿势或面部表情;
- 应保持一致的身份细节。
对于产品,请描述:
- 形状和材质;
- 颜色和表面处理;
- 标签或包装的位置;
- 应该从哪个角度进行展示。
对比以下两个描述:
一个女人
一位留着短发、穿炭灰色羊毛大衣、戴奶油色围巾和棕色皮手套的女人
第二个版本为模型提供了一个可以在后续镜头中重复使用的视觉身份。对于反复出现的角色,请在各个提示词中逐字复制关键描述,而不是每次都用新的同义词重写。
2. 动作:描述随时间推移发生的一个主要变化
视频需要动词。静态图片的提示词可以描述主体站在房间里,但视频提示词应该解释在短片播放期间发生了什么变化。
好的动作是具象且可见的:
- 将咖啡倒入陶瓷杯中;
- 缓缓转身面向窗户;
- 将一只纸船放到水面上;
- 打开笔记本电脑并轻敲一个键;
- 穿过飘落的雪花。
避免将完整的故事塞进一个短短的剪辑中。“她打开门,跑过街道,上车并开走”包含了多个镜头。如果工具支持更长的序列,请将其拆分为单独的提示词或使用带时间轴的故事板。
你可以添加一个小型的次要动作,让镜头充满活力:
女人沿着码头缓缓走着,围巾在风中轻轻摆动。
主要动作是走路。围巾的运动起到辅助作用,而不会分散观众的注意力。
3. 背景:为动作提供一个可信的场所
“一个办公室”或“一片森林”往往过于宽泛。添加能影响氛围和构图的细节:
- 地点;
- 一天中的时间;
- 天气;
- 前景和背景元素;
- 可见的质感;
- 背景运动。
示例:
黎明时分安静的陶艺工作室,里面有木制架子、浅色陶碗、一扇朝北的大窗户,以及在阳光中缓缓飘浮的细小尘埃。
你不需要描述房间里的每一个物体。选择那些能帮助模型理解地点、且观众实际上能看到的细节。
4. 镜头:解释镜头的拍摄方式
镜头语言将一个场景转化为导演镜头。当它们很重要时,请包含景别、角度、运动和速度。
常见的景别术语:
- 极特写;
- 特写;
- 中景;
- 全景;
- 俯拍;
- 航拍。
常见的运动术语:
- 固定不动镜头;
- 缓慢推进;
- 拉远;
- 从左到右摇镜头;
- 跟随镜头;
- 环绕镜头;
- 升降机向上;
- 手持跟随。
每个短片使用一个主要的镜头运动。例如:
微距特写,镜头缓慢推近玻璃瓶上逐渐形成的水珠。
这比“让产品镜头动起来”更具实操性。如果主体也在运动,请分别描述这两种运动:
骑行者从左向右移动,镜头以稳定的速度在侧面同步跟拍。
5. 风格与光照:定义视觉处理方式
风格告诉模型素材应该呈现什么外观。光照则告诉模型场景应该如何被照亮。这两者息息相关,但并不是同一个指令。
有用的风格方向包括:
- 逼真的纪录片素材;
- 干净整洁的产品商业广告;
- 手工纸艺动画;
- 柔和的 35 毫米胶片外观;
- 定格动画;
- 赛璐珞渲染动漫;
- 手机拍摄的 UGC 素材。
有用的光照方向包括:
- 温暖的早晨窗户光;
- 凉爽的阴天日光;
- 日落时的强烈逆光;
- 柔和的霓虹侧光;
- 单个头顶聚光灯;
- 伴有深邃阴影的烛光。
用具象的特质替换抽象的短语。不要用“高端电影氛围”,而是尝试“柔和的逆光、克制的镜头运动、浅景深以及柔和的暖色调”。
辅助控制:时长、格式、音频与连续性
这五个维度构建了镜头。以下控制项则有助于让镜头适配实际的项目。
时长与宽高比
当模型接受时,请说明预期的时长,并选择与目标匹配的宽高比:
- 16:9 适合宽屏视频和电影级风景;
- 9:16 适合垂直方向的社交视频;
- 1:1 适合正方形社交帖子。
如果工具将时长和宽高比作为单独的控件提供,请先使用这些控件,并让提示词专注于创意方向。
音频与对白
如果模型支持原生音频,请描述你实际想要的声音:
自然的咖啡馆环境声,轻柔的杯子和勺子碰撞声,远处的人声交谈,不要音乐。
对于对白,请用引号写出确切的词语并标明说话者。保持台词简短,以适合剪辑片段。如果你不想要语音或字幕,仅在模型支持这些约束时进行说明。
连续性规则
当某个角色或产品出现在多个镜头中时,重复那些不能改变的细节:
在整个片段中保持相同的脸部、发型、奶油色卫衣、产品形状、标签位置和暖色调配色。
对于图生视频,请集中精力关注什么应该动、什么应该保持固定。源图像已经提供了大部分构图,因此提示词通常不需要重复每个视觉细节。
文生视频与图生视频的提示词有所不同
文生视频要求模型根据文字构建场景。需包含主体、背景、动作、镜头、光照和风格。
图生视频从现有的视觉参考开始。重点关注运动、镜头行为和稳定性:
让提供的产品图片产生动画,镜头缓慢推近。添加一束在玻璃表面移动的细微高光,以及轻微的背景视差。保持瓶子形状、标签、颜色和位置不变。避免出现多余产品、包装变形和无法辨认的文字。

“让这张图片动起来”这个短语通常过于模糊。要告诉模型什么会改变,什么不会改变。
真实的 AI 视频示例及其启示
以下示例基于精选的 GoEnhance 提示词库案例。其中附带了视频,方便你将书面指导与生成的运动效果进行对比。实时源页面和视频网址已于 2026 年 8 月 26 日核实;源页面可能会随时间而更改。
有关更多特定模型的示例,请浏览 Seedance 2.0 提示词、Grok Imagine 提示词以及更广泛的视频提示词集合。
示例 1:低保真乡村 Vlog
用例: 纪录片风格的生活方式视频。
Seedance 2.0 生活流 Vlog,时长 15 秒,画面比例 16:9。保持这位女性的脸部、发型、肤色和身体比例一致。她穿着宽松的橄榄绿色亚麻衬衫、灰暗酒红色阔腿裤、棕色凉鞋,戴着小巧的金色圆环耳饰。将视频设置在真实自然的韩国乡村,画面中有长满苔藓的墙壁、韩屋屋顶、陶罐、公鸡、做饭时升起的炊烟和杂草丛生的小路。使用 2000 年代后期翻盖摄像机的画面质感:明显的手持抖动、不完美的重新构图、自动对焦反复调整、曝光变化、滚动快门、运动模糊、褪色且浑浊的色彩、数字噪点和压缩伪影。她先走路、用水拍打脸部、喂一只流浪狗、从锡杯中小口喝水,最后挥手,录像随即中断。不要摆拍、过度美化、画面稳定、音乐或现代调色。加入鸟叫声、公鸡打鸣、脚步声、风声、水声和乡村环境声。
这个提示词刻意指出了视觉年代、镜头瑕疵、服装、环境、动作序列和声音。它表明“逼真”并不总是意味着干净或精致;当期望的镜头语言包含瑕疵且这些瑕疵是风格的一部分时,也可以将其写明。
示例 2:科幻发现镜头
用例: 电影级科幻叙事。
制作一段电影感科幻短片,整体氛围孤独而沉思,并逐渐转变为安静的惊奇。一台受损的探索机器人穿过一片低饱和度的外星景观,周围是尘土和灰色岩石,天空被阴云笼罩。机器人的胸口保留一处发光的蓝色细节。先从布满划痕的金属表面和缓慢机械运动的微距特写开始,随后从机器人身后跟拍,展现它在一座坍塌的研究站内发现一株微小的活植物。镜头缓慢推进,尘埃在光束中飘浮。使用 35 毫米电影摄影风格,克制的镜头运动,逼真的表面质感,柔和的氛围雾气和安静的电子配乐。最后定格在机器人伸手靠近植物的画面。不要喜剧元素、快速剪辑、多余角色或闪烁。
重要的经验是情感的演变。提示词不仅罗列了物体;它还解释了镜头如何从孤立转变为惊叹,并为模型提供了一个清晰的结局。
示例 3:食品商业广告
用例: 产品广告和美食内容。
制作一段高品质食品广告,展示放在深色木桌上的新鲜烤汉堡。先用微距特写展现融化的奶酪和爽脆的生菜,随后在汉堡周围缓慢环绕拍摄,同时让烘烤后的面包顶部升起热气。温暖的侧光在食材上形成柔和高光,使用浅景深和浓郁但自然的色彩处理。加入细微的餐厅环境声和轻柔的滋滋声。最后以汉堡居中的干净主视觉镜头收尾,并在右侧留出放置简短行动呼吁的空白区域。保持汉堡形状和食材层次一致。不要出现多余汉堡、变形食物、无法辨认的文字或突然剪切。
这个例子增加了一个最终的构图,而不是让剪辑随机停止。这在广告中很重要,因为在剪辑过程中,最后一帧通常需要支持标志、产品名称或行动呼吁 (CTA)。
示例 4:具有受控运动的产品镜头
用例: 科技或生活方式产品营销。
制作一段简洁利落的赛博朋克产品广告,展示放在反光金属表面上的哑光黑色无线耳机和打开的充电盒。镜头缓慢环绕移动,同时让蓝色和紫色的细光带掠过充电盒表面。使用微距特写、浅景深、清晰的材质纹理、受控的反射效果和深色未来感配色。充电盒打开时加入安静的电子脉冲声和轻柔的机械咔哒声。最后以耳机居中的干净主视觉构图收尾。保持充电盒形状、耳机位置和品牌元素一致。避免出现多余产品、扭曲的反射和虚构文字。
产品依然是重中之重。移动的光线增加了活力,但提示词并没有要求产品同时旋转、打开、变形和飞行。
可直接复制的 AI 视频提示词模板
将这些模板作为起点。替换括号中的字段,并删除不适用于你所拍镜头的任何指令。
模板 1:电影级角色场景
制作一段时长为 [时长]、画面比例为 [宽高比]、视觉风格为 [视觉风格] 的视频,主体是 [主体描述]。场景发生在 [地点],时间和天气为 [时间和天气]。[主体] 完成 [一个主要动作]。使用 [景别],并搭配 [镜头运动和速度]。添加 [光照、配色和纹理]。如有需要,加入 [声音或对白]。最后以 [最终画面] 收尾。保持 [身份、服装和重要道具] 一致。避免 [具体失败模式]。
模板 2:产品商业广告
制作一段时长为 [时长] 的 [产品] 商业广告。以 [开场镜头] 开始,展现 [材质、纹理或功能]。接着通过 [镜头运动] 展示 [一个产品动作或使用场景]。使用 [光照、色彩和视觉风格]。最后以 [产品] 的干净主视觉构图收尾,并为 [标志或行动呼吁] 留出空间。保持产品形状、颜色、标签和品牌元素一致。避免出现 [多余物体、变形包装或虚构文字]。
模板 3:图生视频动画
使用 [镜头运动] 让提供的图片产生动画。让 [具体主体或环境元素] 缓慢而自然地移动。添加 [风、光线、蒸汽或水等次要运动]。保持 [脸部、服装、产品形状、标签、构图和颜色] 不变。使用 [风格和光照]。时长:[时长]。避免出现 [变形、闪烁、多余物体和不需要的文字]。
模板 4:社交 UGC 视频
制作一段自然的 [时长] 竖屏用户生成内容视频,展示 [创作者] 在 [地点] 中的表现。0–[x] 秒:[开场吸引点]。[x]–[y] 秒:[演示或转变]。[y]–[结束] 秒:[反应和行动呼吁]。使用手机摄像机的手持运动、真实的光照、自然的说话方式和真实的环境声。保持 [产品、服装和创作者身份] 一致。避免刻意表演、过度棚拍质感、随机字幕和标签变化。
模板 5:动画变形
制作一段时长为 [时长]、风格为 [动画风格] 的变形视频。以 [起始物体或场景] 开始,通过 [具体可见步骤] 将其逐渐变为 [最终物体或场景]。保持变形过程居中且连续。使用 [镜头运动]、[纹理]、[光照] 和 [声音]。最后定格在 [最终姿势、产品或标志] 上。避免突然剪切、随机出现的角色、闪烁和风格变化。
常见的 AI 视频提示词错误与实用修复方法
错误 1:堆砌形容词而非指导镜头
“美丽”、“史诗感”和“高品质”之类的词并没有告诉模型要在运动中放入什么。请用关于景别、运动、光线和质感的视觉决策来替换它们。
错误 2:要求几个不相关的动作
将序列拆分为多个镜头。当一个六秒钟的剪辑只有一个清晰的节奏(例如“女人转向窗户”),而不是整个早晨的日常流程时,它会更容易控制。
错误 3:忘记了镜头
如果镜头很重要,请明确指定。静态固定镜头可以是一种刻意的选择,但对镜头保持沉默会让模型替你做出选择。
错误 4:只描述主体,不描述变化
“公园里的一只狗”描述的是一帧画面。“一只金毛寻回犬在湿漉漉的草地上奔跑,而镜头在旁边同步跟拍”描述的才是一个视频。
错误 5:使用模糊的否定指令
“别把它搞砸了”没有什么用。说出你想避免的问题:“保持标签清晰可读,瓶子形状不变。”某些模型对于积极的期望状态(例如“平稳稳定的镜头运动”而非“无镜头抖动”)响应更好。请在你使用的模型上测试这些措辞。
错误 6:指望提示词文本控制所有技术设置
分辨率、时长、宽高比、随机种子 (seed) 和镜头控件可能会在工具界面中提供。请尽可能使用这些设置,并使编写的提示词专注于视觉方向。
如何修改失败的生成结果
将第一次生成视为诊断阶段。找出最重要的失败之处,然后更改一个变量。
- 如果主体发生变化,请重复其视觉身份并移除不必要的细节。
- 如果动作不清晰,请将剪辑缩减为一个主要动词。
- 如果镜头感觉很平淡,请添加特定的运动和速度。
- 如果背景杂乱,请移除次要物体并简化背景。
- 如果产品形状发生变化,请添加连续性规则,并在可能的情况下使用图像参考。
- 如果情绪不对,请调整光照和颜色描述,而不是重写整个提示词。
- 如果结尾无法使用,请明确描述最后的构图。
每次只更改一个变量,可以更容易地了解模型稳定遵循的是哪些指令。将最佳版本保留为新的基础提示词,而不是在每次尝试后重新开始。
大多数 AI 视频提示词指南遗漏了什么
公式很有用,但可重复的工作流比一长串关键词更有价值。当你想要更一致的结果时,请使用以下实践:
- 展示失败版本和修改后的版本,以便让人理解所做的更改。
- 区分主体运动、镜头运动和环境运动。
- 将一个提示词视为一个镜头,然后在剪辑过程中将多个镜头连接起来。
- 在相关的提示词中重复角色、服装、产品和颜色细节。
- 使提示词与目的相匹配:产品广告需要稳定的包装,而低保真 vlog 可能需要刻意的手持瑕疵。
- 在商业和社交剪辑的结尾使用可用的构图,而不是随机剪切。
- 维护一个小型提示词日志,记录模型、设置、成功的措辞以及你纠正的失败。
这些实践使提示词更易于审查和重用。它们还可以防止一个常见的错误:当真正的问题是镜头包含太多相互冲突的指令时,却盲目地添加更多文字。
适合初学者的简单练习计划
你不需要从复杂的故事情节开始。通过简短、易于判断的镜头来练习这个框架。
练习 1:主体和动作
使用相同的结构编写五个提示词:
[主体] 完成 [一个可见动作]。
只改变主体和动作。这有助于你观察模型是否理解该动词。
练习 2:添加背景和镜头
保持动作不变,然后测试三个地点和三种镜头运动。比较哪些组合能产生最清晰的运动效果。
练习 3:添加微运动和连续性
添加一个环境运动,例如风、蒸汽、水或飘浮的尘埃。然后为面部、服装、产品或道具添加一条连续性规则。
练习 4:修改一个变量
生成同一提示词的两个版本。仅更改镜头、光照或动作。记下哪些地方得到了改善、哪些地方变得不太稳定。
生成前的最终清单
在进行下一次渲染之前,请问自己这些问题:
- 主体是否足够具体以便识别?
- 提示词是否包含一个清晰的主要动作?
- 背景是否可见且具体?
- 镜头是否有清晰的景别或运动指令?
- 光照和视觉风格是具象的还是泛泛而谈的?
- 你是否在需要的地方设置了时长和宽高比?
- 你是否仅在音频或对白重要时才将其包含在内?
- 你是否说明了什么必须保持一致?
- 最后的时刻是否有用作构图的空间?
- 如果提示词失败,你知道接下来要更改哪个单一变量吗?
常见问题解答
AI 视频提示词应该有多长?
长到足以清晰描述镜头,短到足以保持指令专注。相比于一大堆不相关的形容词,一个精炼的段落或一组结构化的句子通常更容易修改。
一个 AI 视频提示词应该包含几个动作?
对于一个短片,请使用一个主要动作。如果主体必须完成几个重大动作,请将该构想拆分为多个镜头,或者先创建一个定时场景计划。
AI 视频提示词应该用英文编写吗?
这取决于模型。许多工具支持多种语言,但最重要的因素是具体的名词、可见的动词、清晰的镜头指令以及稳定的结构。请测试能在你选择的工具中带来最具可预测结果的语言。
AI 视频生成是否必须使用负面提示词?
它们可以帮助应对特定的失败模式,但其效果因模型而异。首先要清晰地描述期望的结果,然后在工具支持该指令时,添加具体的约束,例如保持产品标签不变或避免出现多余的物体。
我可以在每个 AI 视频工具中使用相同的提示词吗?
五维度的框架可以很好地迁移,但各个模型对镜头术语、音频指令、时长和负面约束的解释可能会有所不同。将跨平台的提示词视为起点,并在测试后进行调整。
更长的提示词总是更好吗?
不是。只有当额外的细节能阐明对镜头可见或重要的事情时,它们才会有所帮助。如果提示词同时要求太多的主体、动作、风格和镜头运动,这些指令可能会相互冲突。
结论
编写 AI 视频生成提示词最可靠的方法,是像撰写简短镜头简介的导演那样去思考。定义主体、一个清晰的动作、背景、镜头和视觉处理。然后仅添加项目实际需要的时长、格式、声音和连续性规则。
从一个镜头开始,检查结果,每次更改一个变量。清晰的视觉逻辑比一堆通用的关键词更有用,而且一个经过测试的小型提示词库会随着每一次生成而变得更有价值。



