如果你最近打開任何 AI 影片工具,很容易先被模型名稱淹沒。
但對新手來說,更實用的第一個問題其實不是:
哪一個模型最強?
而是:
我要拿什麼當起點,讓模型知道我要的影片?
Lesson 016:AI 是怎麼生成影片的? 已經講過:影片比圖片多了一個「時間」維度,模型不只要決定每一格長什麼樣,還要讓前後畫面在動作、人物和場景上連得起來。
到了 2026,主流影片生成服務常把這件事拆成幾種不同輸入方式。
Text-to-Video:從一句描述開始
文字轉影片(Text-to-Video, T2V) 就是只給文字,讓模型從零建立整個鏡頭。
例如:
雨夜的台北巷弄,一名穿紅色風衣的人慢慢走過霓虹招牌。
鏡頭低角度跟拍,地面反射燈光,電影感,6 秒。
這種模式的優點是自由度高。
你可以快速測:
- 世界觀
- 構圖
- 動作
- 氣氛
- 鏡頭感
但自由度高也代表模型要自己決定更多事情,所以人物長相、衣服細節或物件位置比較容易漂移。
如果你只是想「先看看這個點子長什麼樣」,Text-to-Video 很適合。
Image-to-Video:先把第一格定下來
圖片轉影片(Image-to-Video, I2V) 是先提供一張圖片,再要求模型讓它動起來。
這裡可以接回 Lesson 013:AI 圖片生成:先用圖片模型把角色、服裝、場景或產品視覺定好,再把那張圖交給影片模型,通常會比完全從文字開始更容易控制畫面。
例如你先有一張:
咖啡店窗邊的短髮女生,白襯衫,手拿玻璃杯
再告訴影片模型:
她慢慢轉頭看向窗外,右手輕輕轉動杯子。
鏡頭非常緩慢地向前推近。
這時 Prompt 的重點不必再花大量文字描述「她長什麼樣」,而是可以集中寫:
- 誰要動
- 怎麼動
- 鏡頭怎麼動
- 哪些東西不要亂動
Reference-to-Video:不只給第一格,還給模型更多參考
現在越來越多工作流會接受參考素材(Reference)。
Reference 不一定只代表一張起始圖片,它可能被用來提供:
- 角色身份
- 服裝
- 場景
- 美術風格
- 動作
- 鏡頭路徑
- 影片節奏
有些系統還能同時吃多張參考圖、參考影片或音訊。
你可以把它想成拍片前不只交一張分鏡,而是把「演員定裝照、場景照片、動作示範」一起交給團隊。
First / Last Frame:先指定開始和結束
另一個很實用的控制是 First Frame / Last Frame(首格/末格影格)。
例如你希望:
第一格:桌上是一朵完整的白玫瑰
最後一格:玫瑰變成散落的玻璃碎片
模型的工作就從「隨便生成一段變化」變成:
想辦法把 A 狀態合理地走到 B 狀態。
這對:
- 轉場
- 變身
- 商品展示
- 場景變化
- 首尾構圖控制
特別有用。
Video-to-Video:不是從零生,而是改既有影片
有些模型支援 影片轉影片(Video-to-Video, V2V)。
這類工作流通常是拿既有影片的:
- 動作
- 節奏
- 鏡頭
- 大致構圖
作為骨架,再改變人物、風格或場景。
例如真人拍一段走路,再把人物換成動畫角色;或保留運鏡,重新生成成不同美術風格。
這和完全從 Prompt 生影片是很不同的控制方式。
2026 的影片模型正在往「多種輸入一起用」發展
截至 2026 年 9 月,不少主流影片平台已經不是單純的「打一段文字 → 拿一段影片」。Google Veo 3.1 的官方文件列出 Text-to-Video、Image-to-Video、首尾影格、參考圖片與延長影片等能力;Runway 的開發文件也列出多種文字、圖片、影片與 Reference 輸入模式。
實際支援能力會隨模型版本更新,所以不要把某一張網路比較表當成永久規格。
更值得記住的是這個選擇順序:
我要自由探索?
→ Text-to-Video
我已經有想保留的構圖或角色?
→ Image-to-Video
我需要固定人物、場景、動作或鏡頭?
→ Reference / Video-to-Video
我很在意開頭與結尾?
→ First / Last Frame
「模型最強」不等於最適合你的 Workflow
一個模型可能在純 Text-to-Video 很強,但你真正的需求是:
- 同一個角色拍 8 個鏡頭
- 保留產品 Logo
- 接既有真人演出
- 做精確轉場
那麼「Reference 能不能控制」可能比單段 Demo 的畫質更重要。
所以看影片模型時,不只看輸出畫面,也要看:
- 接受哪些輸入?
- 能不能固定 Reference?
- 能不能指定首尾影格?
- 能不能延長或編輯既有影片?
- 音訊是不是一起生成?
- 生成後能不能接進你的剪輯流程?
下一步:角色一致性
當你從「生成一支 6 秒短片」進入「同一個角色要連續拍很多鏡頭」,下一個最常遇到的問題就是:
為什麼明明 Prompt 都一樣,角色卻每一鏡都像不同人?
下一篇就專門處理這件事。
一句話帶走
AI 影片生成不是只有 Text-to-Video。先根據你手上已有的素材與想控制的東西,選 Text、Image、Reference、First/Last Frame 或 Video-to-Video,再選模型,通常比直接問「哪個 AI 影片最強」更實用。
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。