假設你跟攝影師說:
「拍一個很帥的逃跑畫面。」
他還是不知道怎麼拍。
誰在逃?往哪裡跑?鏡頭跟著跑還是站著不動?先拍全景還是臉部?五秒裡只跳一次,還是連續穿過三個場景?
這就是影片 Prompt 和圖片 Prompt 最大的差別。
Lesson 014:圖片 Prompt 已經講過:圖片 Prompt 像一份拍攝企劃,要把主體、場景、構圖、鏡頭與光線說清楚。
而 Lesson 016:AI 影片生成 的一句話 recap 是:影片比圖片多了時間維度,前後人物、物件、動作與鏡頭還要接得起來。
所以影片 Prompt 要再多回答一個問題:
事情怎麼沿著時間發生?
先記一個六格框架
一個實用的影片 Prompt,可以先拆成:
主體 → 動作 → 鏡頭 → 場景 → 光線 → 時間
不是每次都要照順序寫,但這六格可以幫你快速找出漏掉什麼。
1. 主體:誰是這個鏡頭的重點?
例如:
「一名穿黑色長外套、短髮的女性。」
如果角色外觀已經在前面的參考圖固定,就不用每次重新寫整本人物設定。
如果你忘了為什麼參考圖有用,可以回看 Lesson 015:角色一致性。一句話 recap:文字只能描述像什麼樣的人,參考影像才更像把同一位演員帶進下一個鏡頭。
2. 動作:不要只說「很有動感」
「有動感」不是動作。
比較清楚的是:
「她衝向屋頂邊緣,跨過一個水坑,最後在邊緣前停下。」
或:
「她慢慢轉頭,看向身後的腳步聲。」
模型需要知道主體到底發生了什麼變化。
3. 鏡頭:觀眾從哪裡看?
影片最常見的失控之一,是你想讓人物動,結果連鏡頭也一起亂飛。
因此可以明確指定:
- 固定鏡頭
- 鏡頭緩慢靠近
- 從左往右橫移
- 跟著人物向前奔跑
- 從高處往下拍
前一篇提過的跟拍(Tracking Shot),一句話 recap:鏡頭跟著主體一起移動,讓觀眾保持在動作旁邊。
如果不知道正式電影術語,直接寫自然語言就好。
4. 場景:背景也會跟著時間變
「在城市裡」太寬。
可以改成:
「雨後的高樓屋頂,遠處有霓虹招牌和濕亮的柏油地面。」
場景越清楚,模型越知道哪些東西應該在整段影片裡持續存在。
5. 光線:先決定這支片子的情緒
例如:
「黃昏自然光」和「深夜藍紫霓虹」會讓同一個動作完全不同。
不要只寫「電影感」。
如果你真正想要的是低光、逆光、霧氣、冷暖對比,就直接說。
6. 時間:幾秒裡到底要發生什麼?
這是影片 Prompt 最值得加上的資訊。
假設影片長 8 秒,你可以這樣寫:
0–2 秒: 人物站在屋頂邊緣,鏡頭從背後慢慢靠近。
2–5 秒: 她突然開始向前奔跑,鏡頭從側後方跟拍。
5–8 秒: 她跳過屋頂間隙,落地後繼續往前跑。
這不是保證模型一定精確在第 5.000 秒切換動作。
它的作用比較像給導演一個節奏規劃:先做什麼,再做什麼。
一個弱 Prompt 怎麼改?
原本:
一個女生在城市屋頂逃跑,cinematic。
改成:
雨後黃昏的高樓屋頂。一名穿黑色長外套的短髮女性快速往前奔跑,外套被風吹起。鏡頭從人物右後方低角度跟拍,保持人物全身可見,遠處城市燈光與濕地面反光。0–3 秒她衝向屋頂邊緣;3–6 秒她跳過兩棟建築之間的間隙;6–8 秒落地後向前翻滾並起身。動作自然連續,鏡頭不要突然切換位置。
你會發現,這裡沒有堆很多「史詩、震撼、8K、masterpiece」。
真正增加控制力的是:誰、做什麼、怎麼拍、在哪裡、什麼光、什麼時候發生。
一個鏡頭不要塞太多故事
如果八秒裡要求人物:
跑下樓、開車、追逐、撞車、跳海、再游上岸,
那其實不是一個鏡頭,是半支預告片。
更穩定的做法通常是把它拆成多個 Shot。
**鏡頭(Shot)**可以先理解成「從一次開始拍到這次停止拍之間的一段連續畫面」。
例如:
Shot 1:屋頂奔跑。
Shot 2:跳躍。
Shot 3:落地。
最後再剪在一起。
要不要每次都寫秒數?
不用。
如果只是「風吹動窗簾,人物慢慢喝一口咖啡」,一句自然描述可能就夠。
秒數與分段最有用的時候,是:
- 有多個連續動作
- 鏡頭要明確移動
- 你希望有前後節奏
- 要做一組可剪輯的鏡頭
工具越能接受結構化描述,時間規劃通常越有價值。
今天只要記住一句話
影片 Prompt 不只是描述畫面,而是在描述一小段時間:誰在動、鏡頭怎麼走、場景怎麼維持、事情按什麼順序發生。
接下來我們從生成內容跨到工程世界:API 到底是什麼?為什麼做 AI App 的人不需要一直手動打開聊天網頁?
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。