你可能看過這種影片:
- 一張插畫角色突然開始講話
- 一張真人照片開始眨眼、點頭
- 卡通人物完整模仿真人的表情和手勢
這些都可能被統稱成 AI Avatar(AI 虛擬角色) 或 Digital Human(數位人)。
但它們背後不一定是同一種方法。
最簡單的 Avatar:一張臉 + 一段聲音
最基礎的 Talking Avatar 工作流可能只需要:
角色圖片
+
語音
→
會說話的角色影片
這裡核心通常是 Lesson 040 提到的 Lip Sync:讓嘴型與語音對齊,再加上眨眼、頭部小幅動作。
適合:
- 說明影片
- 教學旁白
- 虛擬主持人
- 短版社群內容
但如果你想讓角色真的「演戲」,只動嘴通常不夠。
Performance Capture:讓另一個人提供表演
Performance Capture(表演捕捉) 的思路是:
真人先演一遍。
模型再把:
- 臉部表情
- 頭部方向
- 身體動作
- 手勢
- 說話節奏
轉移到另一個角色身上。
Runway 的 Act-Two 官方說明就是典型例子:輸入 Driving Performance Video,再提供 Character Image 或 Video,系統把表演轉到角色上。
Driving Performance 是「演技來源」
Driving Performance(驅動表演) 可以想成替數位角色提供一位替身演員。
例如你錄一段自己:
先皺眉
→ 指向右邊
→ 笑
→ 往後退一步
最後影片裡做這些動作的,不一定是你。
可以是一個:
- 卡通角色
- 機器人
- 歷史風格人物
- 品牌 Mascot
你的表演提供「怎麼動」,Reference 提供「看起來是誰」。
Character Reference 是「數位戲服」
Lesson 038 已經講過 Reference 的用途:它不是只描述角色,而是在給模型一個更穩定的身份錨點。
放到 Avatar 工作流,就是:
Driving Performance = 演技
Character Reference = 外觀
這兩層能分開,是現在數位角色很強的一個原因。
Gesture Control:不只是臉
早期 Talking Head 很容易只剩:
臉在動,身體像紙板
現在部分工具會把手勢和身體也納入控制。
這會讓角色更像真的表演,而不是一張會講話的照片。
不過動作越大,模型也越容易遇到:
- 手指變形
- 四肢遮擋
- 身體比例漂移
- 衣服細節跳動
所以全身 Avatar 通常比半身 Talking Head 難。
即時 Avatar 和離線生成又不一樣
有些數位人要先生成一段影片,等幾分鐘再拿結果。
另一些目標則是 Real-time Avatar(即時虛擬角色):
使用者說話
→ AI 即時理解
→ 生成語音
→ 角色同步表情與嘴型
→ 幾乎即時回應
這對客服、遊戲 NPC、直播角色很有吸引力,但要求也更高,因為延遲不能太長。
AI Avatar 最容易被忽略的是「身份權利」
如果角色是虛構人物,主要要看素材授權與模型平台條款。
如果角色像真實人物,就多了:
- 肖像權
- 聲音權
- 本人同意
- Deepfake 風險
- 商業用途授權
不要因為技術可以把 A 的臉、B 的聲音、C 的表演合在一起,就假設法律與平台規則也允許。
最實用的新手工作流
如果你只是想做一個自己的虛擬主持人,可以先:
- 做一張乾淨的角色母圖。
- 先測 10 秒 Talking Avatar。
- 確認嘴型與聲音。
- 再加入手勢。
- 最後才做大幅度全身動作。
每次只增加一層,問題比較好找。
一句話帶走
AI Avatar 可以把「角色長什麼樣」和「角色怎麼演」分開:Character Reference 提供外觀,Driving Performance 提供表情與動作,再搭配語音與 Lip Sync。這就是一張照片能逐步變成會說話、會表演的數位角色的核心思路。
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。