如何編寫真正有效的AI影片提示詞:五維度框架

漢娜

AI 影片生成器可以將簡短的描述轉化為動態場景,但模糊的提示詞通常只會產生模糊的結果。主體在第一格畫面中看起來可能很正常,隨後卻改變了形狀;相機可能會保持靜止,或者多個動作可能會交織成一個令人困惑的動作。

解決方法不是在提示詞中塞滿更多形容詞,更好的方法是寫出一份精簡的鏡頭簡報:定義畫面上有什麼、什麼在改變、相機如何觀察它,以及哪些細節必須保持穩定。本指南將說明如何運用五維框架、真實影片範例、可直接複製的範本以及簡單的修改工作流程來撰寫 AI 影片生成的提示詞。

是什麼讓 AI 影片提示詞發揮作用?

一個實用的 AI 影片提示詞能為模型指派清晰的視覺任務。它能識別主要主體、描述一個清晰可見的動作、將該動作置於特定的環境中、指導相機運鏡,並定義鏡頭的外觀。

弱的提示詞:

一位美麗的女人走在電影感十足的城市中。

這留下了幾個重要的決定沒有明確定義。這個長相如何?她是朝著相機走來,還是背對著相機?相機是靜止的還是移動的?模型應該使用哪個城市、什麼時間以及什麼光線?

更強的提示詞:

一位留著短黑髮、穿著黑色皮夾克和深色長褲的年輕女子,緩緩走過被雨水打濕的東京街道,隨後轉身面向相機。中景側面跟拍,相機輕柔地向前推進。濕潤的路面倒映著藍色和粉色霓虹,空氣中瀰漫著淡淡的霧氣。逼真的 35 毫米膠片質感、低飽和度色彩、柔和的霓虹側光,持續 8 秒。

如何編寫 AI 影片提示詞

第二個版本為生成器提供了主體、動作、場景、相機運鏡、視覺處理和持續時間。它雖然不能保證產生完美的结果,但可以減少所需的猜測成份。

AI 影片提示詞的五個維度

以以下順序作為起點:

[主體] + [動作] + [場景] + [相機] + [風格與燈光]

AI 影片生成提示詞

對於可直接用於製作的提示詞,請在後面加上輸出控制項:

[持續時間] + [外觀比例] + [音訊] + [連貫性規則]

這五個維度描述了鏡頭的創意內容。持續時間、格式、聲音和連貫性是輔助限制條件,有助於讓生成結果更易於使用。

1. 主體:定義觀看者應該看到什麼

從人物、產品、動物或主要物件開始。使用對鏡頭至關重要的細節,而不是描述你所能想像的一切。

對於人物,有用的細節可能包括:

  • 大致年齡;
  • 頭髮、服裝和配件;
  • 身體姿勢或面部表情;
  • 應保持一致的身分細節。

對於產品,請描述:

  • 形狀與材質;
  • 顏色與表面處理;
  • 標籤或包裝位置;
  • 應從哪個角度進行展示。

比較這兩個描述:

一個女人
一位留著短髮、穿著炭灰色羊毛大衣、戴著奶油色圍巾和棕色皮手套的女人

第二個版本為模型提供了可在後續鏡頭中重複使用的視覺身分。對於重複出現的角色,請在各個提示詞中逐字複製關鍵描述,而不是每次都用新的同義詞來重寫。

2. 動作:描述隨時間推移的一個主要變化

影片需要動詞。靜態圖片的提示詞可以描述主體站在房間裡,但影片提示詞應該解釋短片進行期間發生了什麼變化。

好的動作是具體且可見的:

  • 將咖啡倒入陶瓷杯中;
  • 緩慢轉身面向窗戶;
  • 將紙船放到水面上;
  • 打開筆記型電腦並輕敲一個按鍵;
  • 穿過紛飛的雪花。

避免將完整的故事塞進單一的短片中。「她打開門,跑過街道,上車並開走」包含了好幾個鏡頭。如果工具支援較長的序列,請將其拆分為獨立的提示詞或使用計時分鏡腳本。

你可以加入一個小的次要動作,讓鏡頭感覺充滿生氣:

女人沿著碼頭緩緩走著,圍巾在風中輕輕擺動。

主要動作是走路。圍巾的移動支援了這個動作,而不會搶走注意力。

3. 場景:為動作賦予一個可信的場所

「一個辦公室」或「一片森林」通常過於廣泛。請加入影響氣氛和構圖的細節:

  • 地點;
  • 一天中的時間;
  • 天氣;
  • 前景與背景元素;
  • 可見的質地;
  • 背景動態。

範例:

黎明時分安靜的陶藝工作室,裡面有木製架子、淺色陶碗、一扇朝北的大窗戶,以及在陽光中緩緩飄浮的細小塵埃。

你不需要描述房間裡的每個物件。請選擇有助於模型理解該場所且觀看者實際上能看到的細節。

4. 相機:解釋鏡頭是如何拍攝的

相機語言將一個場景轉化為有導演指導的鏡頭。在有需要時,請納入取景、角度、運鏡和速度。

常見的取景術語:

  • 極特寫;
  • 特寫;
  • 中景;
  • 遠景;
  • 俯拍;
  • 航拍。

常見的運鏡術語:

  • 靜止鎖定鏡頭;
  • 緩慢推進;
  • 拉遠;
  • 由左至右搖鏡;
  • 跟蹤鏡頭;
  • 環繞鏡頭;
  • 升降鏡頭向上;
  • 手持跟隨。

每個短片使用一個主要的相機運鏡。例如:

微距特寫,相機緩慢推近玻璃瓶上逐漸形成的水珠。

這比「讓產品鏡頭充滿動感」更具可操作性。如果主體也在移動,請分別描述這兩種移動:

騎行者從左向右移動,相機以穩定的速度在側面同步跟拍。

5. 風格與燈光:定義視覺處理

風格告訴模型素材應該看起來像什麼。燈光告訴模型場景應該如何被照亮。這些是有關聯的,但並不是相同的指令。

實用的風格方向包括:

  • 真實紀錄片素材;
  • 乾淨的產品廣告;
  • 手工剪紙動畫;
  • 柔和的 35 毫米膠片質感;
  • 定格動畫;
  • 賽璐珞著色動漫;
  • 手機相機使用者生成內容素材。

實用的燈光方向包括:

  • 溫暖的早晨窗光;
  • 陰涼的陰天日光;
  • 日落時分的強烈逆光;
  • 柔和的霓虹側光;
  • 單一頂光聚光燈;
  • 帶有深邃陰影的燭光。

用可見的特質取代抽象的片語。與其使用「高端電影氛圍」,不如嘗試「柔和的逆光、克制的相機運鏡、淺景深以及柔和溫暖的色彩」。

輔助控制項:持續時間、格式、聲音與連貫性

這五個維度建構了鏡頭。以下的控制項有助於讓鏡頭契合真實的專案。

持續時間與外觀比例

在模型接受的情況下聲明預期的持續時間,並選擇與目的地相匹配的外觀比例:

  • 用於寬銀幕影片和電影級風景的 16:9;
  • 用於垂直社群影片的 9:16;
  • 用於方形社群貼文的 1:1。

如果工具將持續時間和外觀比例作為獨立的控制項提供,請先使用這些控制項,並將提示詞的重點保持在創意方向上。

聲音與對話

如果模型支援原生音訊,請描述你實際想要的聲音:

自然的咖啡館環境聲、輕柔的杯子和湯匙碰撞聲、遠處的人聲交談,不要音樂。

對於對話,請將確切的字句放在引號內並標明說話者。保持台詞足夠短以契合短片。如果你不想要語音或字幕,請僅在模型支援這些限制條件時提出。

連貫性規則

當某個角色或產品出現在多個鏡頭中時,請重複那些不能改變的細節:

在整個片段中保持相同的臉部、髮型、奶油色衛衣、產品形狀、標籤位置和暖色調配色。

對於圖片轉影片,請專注於什麼應該移動、什麼應該保持固定。來源圖像已經提供了大部分的構圖,因此提示詞通常不需要重複每一個視覺細節。

文字轉影片與圖片轉影片的提示詞有所不同

文字轉影片要求模型從文字建構場景。請納入主體、場景、動作、相機、燈光和風格。

圖片轉影片從現有的視覺參考開始。請專注於動態、相機行為和穩定性:

讓提供的產品圖片產生動畫,相機緩慢推近。加入一束在玻璃表面移動的細微高光,以及輕微的背景視差。保持瓶子形狀、標籤、顏色和位置不變。避免出現多餘產品、包裝變形和無法辨認的文字。

如何編寫圖片轉影片與文字轉影片提示詞

「讓這張圖片動起來」這個片語通常太模糊了。請告訴模型什麼在改變、什麼沒有改變。

真實 AI 影片範例及其教導事項

以下範例基於精選的 GoEnhance 提示詞庫案例。影片包含在內是為了讓你能將書面指導與產生的動態進行對比。線上來源頁面與影片網址已於 2026 年 8 月 26 日進行檢查;來源頁面可能會隨時間而有所更改。

如需更多模型專屬的範例,請瀏覽 Seedance 2.0 提示詞Grok Imagine 提示詞,以及更廣泛的影片提示詞收藏。

範例 1:低保真農村生活 Vlog

使用情境: 紀錄片風格的生活風格影片。

Seedance 2.0 生活流 Vlog,持續 15 秒,外觀比例 16:9。保持這位女性的臉部、髮型、膚色和身體比例一致。她穿著寬鬆的橄欖綠亞麻襯衫、灰暗酒紅色寬腿褲、棕色涼鞋,戴著小巧的金色圓環耳飾。將影片設定在真實自然的韓國鄉村,畫面中有長滿苔蘚的牆壁、韓屋屋頂、陶罐、公雞、做飯時升起的炊煙和雜草叢生的小路。使用 2000 年代後期翻蓋相機的畫面質感:明顯的手持抖動、不完美的重新構圖、自動對焦反覆調整、曝光變化、滾動快門、動態模糊、褪色且渾濁的色彩、數位噪點和壓縮偽影。她先走路、用水拍打臉部、餵一隻流浪狗、從錫杯中小口喝水,最後揮手,錄影隨即中斷。不要擺拍、過度美化、畫面穩定、音樂或現代調色。加入鳥叫聲、公雞打鳴、腳步聲、風聲、水聲和鄉村環境聲。

這個提示詞刻意具體地描述了視覺年代、相機瑕疵、服裝、環境、動作序列和聲音。它表明「真實」並不總是意味著乾淨或精緻;當這些瑕疵是風格的一部分時,所需的相機語言可以包含瑕疵。

範例 2:科幻發現鏡頭

使用情境: 電影級科幻故事敘述。

製作一段電影感科幻短片,整體氛圍孤獨而沉思,並逐漸轉變為安靜的驚奇。一台受損的探索機器人穿過一片低飽和度的外星景觀,周圍是塵土和灰色岩石,天空被陰雲籠罩。機器人的胸口保留一處發光的藍色細節。先從布滿刮痕的金屬表面和緩慢的機械運動微距特寫開始,隨後從機器人身後跟拍,展現它在一座坍塌的研究站內發現一株微小的活植物。相機緩慢推近,塵埃在光束中飄浮。使用 35 毫米電影攝影風格、克制的相機運動、逼真的表面質感、柔和的氛圍霧氣和安靜的電子配樂。最後定格在機器人伸手靠近植物的畫面。不要喜劇元素、快速剪輯、多餘角色或閃爍。

重要的教訓是情感的遞進。提示詞不只是列出物件;它解釋了鏡頭如何從孤獨轉變為驚奇,並為模型提供了一個清晰的結局。

範例 3:食品廣告

使用情境: 產品廣告與食品內容。

製作一段高品質食品廣告,展示放在深色木桌上的新鮮烤漢堡。先用微距特寫展現融化的起司和爽脆的生菜,隨後在漢堡周圍緩慢環繞拍攝,同時讓烘烤後的麵包頂部升起熱氣。溫暖的側光在食材上形成柔和高光,使用淺景深和濃郁但自然的色彩處理。加入細微的餐廳環境聲和輕柔的滋滋聲。最後以漢堡居中的乾淨主視覺鏡頭收尾,並在右側留出放置簡短行動呼籲的空白區域。保持漢堡形狀和食材層次一致。不要出現多餘漢堡、變形食物、無法辨認的文字或突然剪切。

這個範例新增了一個最終構圖,而不是讓短片隨機停止。這在廣告中很重要,因為最後一格畫面通常需要在剪輯期間支援標誌、產品名稱或行動呼籲。

範例 4:具有受控動態的產品鏡頭

使用情境: 科技或生活風格產品行銷。

製作一段簡潔俐落的賽博朋克產品廣告,展示放在反光金屬表面上的霧黑色無線耳機和打開的充電盒。相機緩慢環繞移動,同時讓藍色和紫色的細光帶掠過充電盒表面。使用微距特寫、淺景深、清晰的材質紋理、受控的反射效果和深色未來感配色。充電盒打開時加入安靜的電子脈衝聲和輕柔的機械喀噠聲。最後以耳機居中的乾淨主視覺構圖收尾。保持充電盒形狀、耳機位置和品牌元素一致。避免出現多餘產品、扭曲的反射和虛構文字。

產品依然是首要任務。移動的燈光增加了活力,但提示詞並沒有要求產品同時旋轉、打開、變形和飛翔。

可直接複製的 AI 影片提示詞範本

將這些範本作為起點。替換括號中的欄位,並刪除任何不適用於你鏡頭的指令。

範本 1:電影級角色場景

製作一段持續時間為 [持續時間]、外觀比例為 [外觀比例]、視覺風格為 [視覺風格] 的影片,主體是 [主體描述]。場景發生在 [地點],時間和天氣為 [時間和天氣]。[主體] 完成 [一個主要動作]。使用 [取景],並搭配 [相機運動和速度]。加入 [燈光、配色和紋理]。如有需要,加入 [聲音或對話]。最後以 [最終畫面] 收尾。保持 [身分、服裝和重要道具] 一致。避免 [具體失敗模式]。

範本 2:產品廣告

製作一段持續時間為 [持續時間] 的 [產品] 商業廣告。以 [開場鏡頭] 開始,展現 [材質、紋理或功能]。接著透過 [相機運動] 展示 [一個產品動作或使用情境]。使用 [燈光、色彩和視覺風格]。最後以 [產品] 的乾淨主視覺構圖收尾,並為 [標誌或行動呼籲] 留出空間。保持產品形狀、顏色、標籤和品牌元素一致。避免出現 [多餘物體、變形包裝或虛構文字]。

範本 3:圖片轉影片動畫

使用 [相機運動] 讓提供的圖片產生動畫。讓 [具體主體或環境元素] 緩慢而自然地移動。加入 [風、光線、蒸氣或水等次要動態]。保持 [臉部、服裝、產品形狀、標籤、構圖和顏色] 不變。使用 [風格和燈光]。持續時間:[持續時間]。避免出現 [變形、閃爍、多餘物體和不需要的文字]。

範本 4:社群使用者生成內容影片

製作一段自然的 [持續時間] 直式使用者生成內容影片,展示 [創作者] 在 [地點] 中的表現。0–[x] 秒:[開場吸引點]。[x]–[y] 秒:[示範或轉變]。[y]–[結束] 秒:[反應和行動呼籲]。使用手機相機的手持運動、真實的燈光、自然的說話方式和真實的環境聲。保持 [產品、服裝和創作者身分] 一致。避免刻意表演、過度棚拍質感、隨機字幕和標籤變化。

範本 5:動畫變形

製作一段持續時間為 [持續時間]、風格為 [動畫風格] 的變形影片。以 [起始物體或場景] 開始,透過 [具體可見步驟] 將其逐漸變為 [最終物體或場景]。保持變形過程居中且連續。使用 [相機運動]、[紋理]、[燈光] 和 [聲音]。最後定格在 [最終姿勢、產品或標誌] 上。避免突然剪切、隨機出現的角色、閃爍和風格變化。

常見的 AI 影片提示詞錯誤與實用修正方法

錯誤 1:堆疊形容詞而不是指導鏡頭

諸如「美麗的」、「史詩級的」和「高品質的」這類字詞並不能告訴模型該把什麼投入運作。請用關於取景、運鏡、光線和質地的具體可見決定來取代它們。

錯誤 2:要求多個不相關的動作

將序列拆分為鏡頭。當一個六秒的短片只有一個清晰的節拍(例如「女人轉身面向窗戶」)而不是一整套早晨日常時,它會更容易控制。

錯誤 3:忘記了相機

如果相機很重要,請將其明確指定。靜止鎖定鏡頭可以是一個刻意的選擇,但對相機保持沉默會讓模型為你做決定。

錯誤 4:只描述主體,不描述變化

「公園裡的一隻狗」描述的是一格畫面。「一隻黃金獵犬跑過濕漉漉的草地,而相機在旁邊跟拍」描述的是一條影片。

錯誤 5:使用模糊的負面指令

「不要把它弄砸了」是沒有用的。請說出你想要避免的問題:「保持標籤清晰可讀且瓶子形狀不變。」有些模型對於正面期望狀態的反應也更好,例如「平穩穩定的相機運鏡」而不是「沒有相機晃動」。請使用你正在使用的模型來測試措辭。

錯誤 6:期望提示詞文字控制每個技術設定

工具介面中可能會提供解析度、持續時間、外觀比例、隨機種子和相機控制項。請在可能的情況下使用這些設定,並將書面提示詞的重點保持在視覺指導上。

如何修改失敗的生成結果

將第一次生成視為診斷階段。找出最嚴重的失敗之處,然後改變一個變數。

  1. 如果主體改變了,請重複其視覺身分並移除不必要的細節。
  2. 如果動作不清晰,請將短片簡化為一個主要動詞。
  3. 如果相機感覺扁平,請加入特定的運鏡和速度。
  4. 如果背景混亂,請移除次要物件並簡化場景。
  5. 如果產品形狀改變了,請加入連貫性規則,並在可用時使用圖片參考。
  6. 如果情緒不對,請調整燈光和顏色描述,而不是重寫整個提示詞。
  7. 如果結局無法使用,請明確描述最終構圖。

每次只改變一個變數,可以讓人更容易了解模型能可靠遵循哪些指令。將最佳版本保留為你的新基礎提示詞,而不是在每次嘗試後重新開始。

多數 AI 影片提示詞指南所遺漏的内容

公式很有用,但可重複的工作流程比一長串關鍵字更有價值。當你想要更一致的結果時,請採用這些做法:

  • 顯示失敗的版本和修改後的版本,以便理解所做的更改。
  • 分離主體動態、相機動態和環境動態。
  • 將一個提示詞視為一個鏡頭,然後在剪輯期間連接多個鏡頭。
  • 在相關提示詞中重複角色、服裝、產品和顏色細節。
  • 讓提示詞契合目的:產品廣告需要穩定的包裝,而低保真 Vlog 可能需要刻意的手持瑕疵。
  • 以可用構圖而非意外剪輯來結束商業和社群短片。
  • 保留一個小型提示詞日誌,記錄模型、設定、成功的措辭以及你所修正的失敗之處。

這些做法讓提示詞更容易審查和重複使用。它們還可以防止一個常見的錯誤:當真正的問題是鏡頭包含太多互相衝突的指令時,卻加入了更多文字。

給初學者的簡單練習計畫

你不需要從複雜的故事開始。透過短小、易於評判的鏡頭來練習框架。

練習 1:主體與動作

使用相同的結構寫五個提示詞:

[主體] 完成 [一個可見動作]。

只改變主體和動作。這有助於你觀察模型是否理解該動詞。

練習 2:加入場景與相機

保持相同的動作,然後測試三個地點和三個相機運鏡。比較哪些組合產生的動態最清晰。

練習 3:加入微動態與連貫性

加入一個環境動態,例如風、蒸氣、水或飄動的灰塵。然後為臉部、服裝、產品或道具加入一條連貫性規則。

練習 4:修改一個變數

為同一個提示詞生成兩個版本。只改變相機、燈光或動作。記錄關於什麼獲得了改善、什麼變得較不穩定的筆記。

生成前的最後檢查清單

在花費另一次渲染之前,先問問自己這些問題:

  1. 主要主體具體到足以辨認嗎?
  2. 提示詞是否包含一個清晰的主要動作?
  3. 場景是可見且具體的嗎?
  4. 相機是否有清晰的取景或運鏡指令?
  5. 燈光和視覺風格是具體的而不是通用的嗎?
  6. 你是否在需要的地方設定了持續時間和外觀比例?
  7. 你是否僅在聲音或對話重要時才將其納入?
  8. 你是否說明了什麼必須保持一致?
  9. 最後一刻是否有實用的構圖?
  10. 如果提示詞失敗了,你知道接下來要改變哪一個單一變數嗎?

常見問答

AI 影片提示詞應該有多長?

長到足以清晰描述鏡頭,但短到足以保持指令的專門性。一個精簡的段落或一組結構化的句子通常比一大塊不相關的形容詞更容易修改。

一個 AI 影片提示詞應該包含多少個動作?

對於短片,請使用一個主要動作。如果主體必須完成多個主要動作,請將想法拆分為多個鏡頭,或先建立一個計時場景計畫。

AI 影片提示詞應該用英文寫嗎?

這取決於模型。許多工具接受多種語言,但最重要的因素是特定的名詞、可見的動詞、清晰的相機指令以及穩定的結構。請在你的選擇工具中測試能給你帶來最多可預測結果的語言。

負面提示詞對於 AI 影片生成是必要的嗎?

它們有助於應對特定的失敗模式,但其效果因模型而異。請先清晰描述所需的結果,然後在工具支援該指令時,加入具體的限制條件,例如保持產品標籤不變或避免多餘的物件。

我可以在每個 AI 影片工具中使用相同的提示詞嗎?

五維框架可以很好地轉移,但個別模型對相機術語、音訊指令、持續時間和負面限制的解釋可能會有所不同。請將跨平台的提示詞視為起點,並在測試後進行調整。

更長的提示詞總是更好嗎?

不是的。額外的細節只有在它闡明了鏡頭中可見或重要的東西時才有幫助。如果提示詞同時要求太多主體、動作、風格和相機運鏡,指令可能會互相衝突。

結論

撰寫 AI 影片生成提示詞最可靠的方法是像一位撰寫短鏡頭簡報的導演一樣思考。定義主體、一個清晰的動作、場景、相機以及視覺處理。然後,只加入專案實際需要的持續時間、格式、聲音和連貫性規則。

從一個鏡頭開始,審查結果,並且每次只改變一個變數。清晰的視覺邏輯比一堆通用的關鍵字更有用,而一個經過測試的小型提示詞庫將隨著每一次生成而變得更有價值。