你想做一支 30 秒短片。
第一鏡的主角很漂亮,第二鏡也不錯,第三鏡開始覺得哪裡怪怪的,第四鏡突然像換了一個人。
很多人第一個反應是把 Prompt 寫得更長:
25 歲女性、短黑髮、橢圓臉、棕色眼睛、白襯衫……
但這只能增加描述一致性,不能保證每一次生成都重新找到完全相同的身份。
Lesson 015:為什麼同一個 AI 角色每張圖都長不一樣? 已經講過:文字描述的是一個特徵範圍,不是一張真正的身分證。
影片跨鏡頭也是同一個問題,只是更難。
連續劇靠固定演員,不靠每場重新描述
想像拍一部連續劇。
導演不會每一場都對劇組說:
「找一個短黑髮、棕色眼睛、身高大約 165 公分的人來演。」
而是直接說:
「今天還是同一位演員。」
AI 工作流裡的 Reference Image(參考圖片),就更接近這張「固定演員」的錨點。
先做 Character Master,再做影片
實務上很常見的做法是先建立一組角色母圖(Character Master)。
至少準備:
- 正面
- 3/4 側面
- 側面
- 半身
- 全身
- 主要服裝
- 中性表情
這些圖不必每張都塞給模型,但你要先有一組自己認可的「角色標準答案」。
如果某個工具支援多張 Reference,就可以依場景選最合適的角度。
為什麼中性照片反而好用?
Reference 如果本身:
- 光線非常戲劇化
- 臉被頭髮遮住
- 表情極端
- 身體只剩一小部分
模型要同時猜「身份」和「這張照片裡的特殊條件」。
Runway 的官方 Reference 指南也建議用自然、均勻光線與較中性的角色照片作為穩定起點。
你可以把它想成演員的定裝照:
定裝照的工作不是自己很戲劇化,而是讓後面的每一場戲都有同一個基準。
Image-to-Video 通常比每鏡 Text-to-Video 更容易固定角色
Lesson 037 提到 Image-to-Video(圖片轉影片):先把一格畫面定下來,再讓模型生成動作。
如果你的目標是角色一致性,一個很穩定的流程是:
角色 Reference
↓
先生成每個鏡頭的靜態 Keyframe
↓
挑出身份最一致的 Keyframe
↓
每一張再做 Image-to-Video
↓
剪輯成完整影片
這會比每一鏡都重新 Text-to-Video 更像真正的影像製作流程。
一致性不只是一張臉
「同一個角色」其實至少包含:
- 臉部身份
- 髮型與髮色
- 身材比例
- 年齡感
- 服裝
- 配件
- 妝容
- 特殊標記
如果第一鏡戴金色耳環、第二鏡突然沒有,第三鏡換成銀色,觀眾一樣會覺得角色不連續。
所以除了人物 Reference,你還可以建立簡單的 Continuity Sheet(連戲表):
角色:Mia
髮型:肩上黑色短髮
服裝:米白襯衫 + 深灰長褲
配件:左耳小金環、黑色腕錶
不可改:髮色、耳環、腕錶
它不是魔法,但能讓你自己在生成過程中更快抓到「哪裡漂了」。
Seed 能不能直接鎖住同一張臉?
有些生成工具提供 Seed(隨機種子)。
Seed 可以影響隨機生成的起點,但不要把它當成「角色 ID」。
只要 Prompt、模型版本、Reference、比例或生成流程改變,結果仍然可能出現很大差異。
所以角色一致性的核心通常不是:
同一個 Seed = 同一個人
而是:
穩定 Reference
+ 明確角色規格
+ 控制每一鏡的輸入
+ 人工挑選與迭代
場景也需要一致性
同樣的問題也會發生在背景。
第一鏡咖啡店有三扇窗,第二鏡變兩扇,第三鏡桌子方向反過來。
如果同一個場景要反覆出現,也可以先做:
- 場景全景 Reference
- 不同角度 Keyframe
- 固定色調
- 固定主要家具位置
角色和場景分開建立 Reference,之後再組合,通常比每一鏡從零生成更容易控制。
不要追求 100% 自動
即使是 2026 的模型,跨多鏡頭的身份、服裝、道具與空間連續性仍然需要檢查。
專業工作流的重點不是期待:
「我打一個 Prompt,它一次幫我完成兩分鐘完美電影。」
而是把生成拆成可檢查的小單位。
每一鏡錯了,只重做那一鏡。
這就是為什麼 AI 影片越成熟,Workflow 反而越像真正影像製作,而不是越像抽卡。
一句話帶走
Prompt 可以描述一個角色「應該長什麼樣」,但跨鏡頭一致性更需要 Reference、角色母圖與連戲規格。把角色當固定演員,而不是每一鏡重新召喚一個相似的人,影片會穩很多。
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。