先想像一件事。
如果我要你畫一張「女生在屋頂奔跑」的圖片,你只需要把某一個瞬間畫好。
但如果我要你做五秒影片,問題立刻變多。
第一秒,她是短黑髮。
第二秒不能突然變長髮。
第三秒右手拿著手機,第四秒手機不能無故消失。
背景的高樓、衣服、光線、人物位置,也都要隨著動作合理變化。
所以 AI 影片最難的地方,不只是「每一張畫面都漂亮」,而是前一刻和下一刻要接得起來。
如果你忘了前面的基礎,Lesson 013:AI 圖片生成 的一句話 recap 是:圖片模型根據條件生成新的畫面,而不是單純搜尋現成圖片。
影片則是在這個問題上再加一個很重要的維度:時間。
影片其實是很多影格組成的
影片裡的一張單獨畫面叫做影格(Frame)。
當很多影格按照時間順序快速播放,人眼就會看到連續動作。
你有時會看到 fps,它是每秒影格數(Frames Per Second, fps),意思是一秒鐘播放多少張影格。
例如 24 fps 可以先理解成:一秒影片裡大約有 24 個連續畫面。
但 AI 影片模型內部不一定真的用「一張一張獨立畫完再拼起來」這麼簡單的方式工作。
對新手最重要的直覺是:模型必須同時處理畫面內容和時間上的變化。
什麼是文字生成影片?
當你只提供文字,例如:
「一台紅色老跑車沿著雨夜的山路行駛,鏡頭從車尾慢慢移到側面。」
模型根據文字產生影片,這類任務常叫做文字生成影片(Text-to-Video, T2V)。
這裡又會用到前面學過的 Prompt。一句話 recap:Prompt 就是你交給 AI 的需求、條件與上下文。
只是影片 Prompt 除了「畫面長怎樣」,還要多說「事情怎麼發生」。
什麼是圖片生成影片?
另一種常見方式,是先給模型一張圖片,再讓它把這張圖片動起來。
這叫做圖片生成影片(Image-to-Video, I2V)。
例如你已經有一張角色站在海邊的圖片,可以再要求:
「風吹動她的頭髮,她慢慢轉頭看向鏡頭,背景海浪持續移動。」
這樣的好處是第一個畫面已經比較確定,模型不用從零猜角色、衣服和場景。
如果你在意同一角色不要一直變臉,可以回看 Lesson 015:角色一致性。一句話 recap:只靠文字很難鎖住同一個角色,參考影像與逐步編輯通常更可靠。
為什麼人物會突然變形?
這就牽涉到時間一致性(Temporal Consistency)。
Temporal 是「時間上的」,Consistency 是「一致」。
你可以把它想成拍電影時的場記工作。
上一個鏡頭演員右手拿杯子,下一個鏡頭不能突然變成左手;上一秒外套扣著,下一秒也不能無緣無故敞開。
AI 影片也必須維持這些前後關係。
如果模型沒有維持好,就可能看到:
- 手指數量在移動中改變
- 臉逐漸變成另一個人
- 衣服花紋一直漂
- 背景的門突然消失
- 車輪、文字或小物件形狀不穩定
這些問題不是「某一張圖畫不好」而已,而是跨時間沒有接好。
鏡頭也在時間裡移動
影片還有另一個圖片沒有的問題:鏡頭可以動。
例如:
- 推鏡(Dolly In):鏡頭逐漸靠近主體
- 拉鏡(Dolly Out):鏡頭逐漸遠離主體
- 橫搖(Pan):鏡頭向左或向右轉
- 跟拍(Tracking Shot):鏡頭跟著人物一起移動
你不用一開始就背所有電影術語。
如果不知道名稱,直接說「鏡頭慢慢靠近人物」通常也比只寫「cinematic」更清楚。
秒數越長,通常越難控制
假設一個三秒片段只有一個動作:
「女生抬頭看天空。」
模型只需要維持一小段連續變化。
如果你要求二十秒裡同時出現:起身、跑步、開門、上車、駕駛、轉彎、下車,模型要維持的狀態就多很多。
所以實作上,把長影片拆成多個短鏡頭,常常比要求模型一次生成完整長片更可控。
這也正是電影本來就在做的事:先拍一個個鏡頭,再剪在一起。
AI 影片不是「按一下就完成電影」
真正要做比較完整的影片,通常還會經過:
- 想故事或腳本。
- 做角色與場景設定。
- 規劃分鏡。
- 一個鏡頭一個鏡頭生成。
- 挑選可用片段。
- 剪輯、配音、音效與音樂。
所以生成模型比較像加入製作團隊的一個新工具,而不是把導演、攝影、剪輯全部變成一顆按鈕。
今天只要記住一句話
AI 影片比圖片多了一個時間維度:不只每一刻要合理,前後的人物、物件、動作和鏡頭還要接得起來。
下一篇,我們直接進實戰:影片 Prompt 要怎麼寫,才能讓模型知道誰在動、鏡頭怎麼走、幾秒內要發生什麼?
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。