你設計了一個角色:
「短黑髮、右眼下有一顆小痣、穿深紅色皮外套的女生。」
第一張很完美。
你立刻再生成第二張:「同一個女生走在便利商店裡。」
結果髮型變長了,小痣不見了,連臉型都像換了一個人。
這不是少數人的問題。
讓同一個角色跨多張圖片維持一致,本來就比生成單張漂亮圖片更難。
如果你還沒看過前兩篇,可以先記兩句:
Lesson 013:AI 圖片生成 講過:模型會根據條件生成一個合理的新畫面,不是在資料庫裡調出固定角色。
Lesson 014:圖片 Prompt 講過:Prompt 像拍攝企劃,條件越清楚,模型需要猜的地方越少。
但就算 Prompt 寫得很好,角色仍然可能漂。
為什麼只靠文字很難鎖住同一張臉?
想像你把同一份人物描述寄給十位不同攝影師:
「二十多歲、短黑髮、右眼下有痣、瓜子臉。」
十位攝影師都能找到符合描述的人,但不代表會找到同一個人。
文字可以描述特徵,卻很難完整包含一張臉所有細節:
- 眼睛真正的距離
- 鼻樑形狀
- 嘴角弧度
- 臉部比例
- 髮際線
- 痣的精確位置
- 光線下皮膚的細節
所以你寫「同一個女生」,模型知道你的語意,但它不一定擁有一張固定身分證照片可以逐像素照著走。
這個問題叫角色一致性
**角色一致性(Character Consistency)**指的是同一個角色出現在不同圖片、姿勢、場景或鏡頭時,仍然讓人一眼認得出是同一個角色。
它不只包含臉。
還可能包含:
- 髮型與髮色
- 身形比例
- 衣服
- 配件
- 刺青、痣、傷疤等識別特徵
- 畫風與色調
如果你在做漫畫、角色設定集、廣告系列或連續短片,這件事會非常重要。
最直接的方法:給它參考圖
**參考影像(Reference Image)**就是直接把已經滿意的圖片交給模型,告訴它後續生成要以這個角色或視覺元素為參考。
這就像不再跟下一位攝影師說:
「她是短黑髮、眼下有痣。」
而是直接把上一張照片拿給他看:
「就是這個人,現在幫我拍另一個場景。」
資訊量差很多。
不同平台對參考圖的支援程度不同,有些能保留人物特徵很好,有些比較偏風格參考,所以仍然要看實際工具能力。
圖生圖:不是從零開始
前面提過圖片生成圖片(Image-to-Image, I2I)。
一句話 recap:I2I 是把既有圖片當成新的生成條件,而不是完全從空白開始。
如果你的第一張角色已經很接近理想狀態,可以用它當起點,再要求:
- 換背景
- 換姿勢
- 換服裝
- 改鏡頭距離
- 改時間與光線
這通常比每張都只從文字重新抽一次更容易維持一致。
哪裡錯,就只改哪裡
另一個實用概念是局部重繪(Inpainting)。
它可以先想成 Photoshop 的「只圈一小塊叫 AI 重做」。
例如整張都很好,只有左手不自然。
你不需要整張重新生成,因為重新生成可能連原本漂亮的臉也一起換掉。
比較好的策略是只修改手部區域。
這個觀念很重要:
AI 圖片工作流不是一直按重新生成,而是逐步保留成功的部分。
一致性不是只有角色,風格也會漂
你第一張可能是柔和水彩,第二張突然變成高對比數位插畫。
因此除了角色,一套系列圖還要固定:
- 色調
- 線條粗細
- 材質
- 光線方向
- 鏡頭語言
- 背景細節程度
最簡單的方法,是把已成功的第一張當參考,再在後續 Prompt 裡明確要求保留視覺風格。
Seed 是不是就能解決?
有些生成工具提供隨機種子(Random Seed, Seed),它可以影響生成時的隨機起點。
固定 Seed 在某些系統裡能幫助你重現或接近某次結果,但不要把它理解成「角色身分證號碼」。
只要 Prompt、模型版本、尺寸、參數或工具流程改變,結果仍可能不同;而且有些平台根本不提供 Seed 控制。
所以角色一致性的核心仍然是:參考資料與可控工作流,而不是只記住一個數字。
一個比較穩的實作流程
如果你要做十張同一角色,可以這樣做:
- 先把角色正面或半身設定圖做滿意。
- 保留這張作為主要 Reference Image。
- 固定最重要的外觀描述。
- 每次只改場景、姿勢或鏡頭等少數條件。
- 哪裡壞掉就局部修改,不要整張推倒重來。
- 每完成一張好的,就把它加入後續參考素材。
這很像拍時尚型錄:模特兒是同一位,只是換造型、位置與攝影方式。
今天只要記住一句話
文字可以描述「像什麼樣的人」,但要讓 AI 穩定生成「同一個人」,通常需要參考影像、圖生圖與逐步編輯。
下一篇,我們把單張照片動起來:AI 到底是怎麼生成影片的?為什麼影片比圖片更容易出現人物變形與場景漂移?
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。