一枚のイラストが突然話し始めたり、実写人物の表情をキャラクターがそのまま真似したりする動画があります。
こうした仕組みはAI Avatarや**Digital Human(デジタルヒューマン)**と呼ばれますが、中身は一種類ではありません。
最も単純なAvatar:画像 + 音声
基本Workflowは:
Character Image
+ Speech Audio
→ Talking Character
Lesson 040で扱ったLip Syncを中心に、口、目、頭部を動かします。
説明動画やVirtual Presenterにはこれだけでも十分な場合があります。
Performance Capture:別の人が演技を提供する
**Performance Capture(パフォーマンスキャプチャ)**では、実際の人が先に演技し、その情報を別キャラクターに移します。
転送対象には:
- 表情
- 頭の向き
- 身体動作
- 手のGesture
- 話すTempo
などがあります。
Runway Act-Twoは、Driving Performance VideoとCharacter Image / Videoを使う現在の一例です。
Driving Performanceは演技のSource
自分で:
眉をひそめる
→ 右を指す
→ 笑う
→ 一歩下がる
という演技を撮影しても、最終画面に出るのはロボットやアニメ人物かもしれません。
Driving Performanceは「どう動くか」を提供します。
Character Referenceは外見を提供する
Lesson 038で説明したReferenceは、キャラクター身份のAnchorです。
Avatarでは:
Driving Performance = 演技
Character Reference = 外見
と分けて考えると分かりやすいです。
顔だけでなくGestureも重要
古いTalking Headは「顔だけ動いて身体が板のよう」に見えることがありました。
身体や手までPerformanceを移すと自然になりますが、動きが大きいほど手指、遮蔽、衣服、体格の崩れも増えます。
全身Avatarは上半身Presenterより難しいことが多いです。
Real-time AvatarはLatencyも重要
即時対話型では:
ユーザーが話す
→ AIが理解
→ 音声生成
→ 表情・Lip Sync
→ ほぼ即時応答
となり、Qualityだけでなく**Latency(遅延)**も重要になります。
実在人物なら同意と権利を確認する
実在人物の顔や声を使う場合は、肖像、Voice、Consent、Deepfake、商用利用権などを確認する必要があります。
技術的に組み合わせられることと、許可されていることは別です。
ひとことで
AI Avatarでは「誰に見えるか」と「どう演じるか」を分離できます。Character Referenceが外見、Driving Performanceが表情や動作を提供し、VoiceとLip Syncを別Layerとして組み合わせます。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。