← ホームへ戻る
LESSON 041AIツール入門8 分

AI AvatarとDigital Humanとは?一枚のReferenceに表情・動作・声を与える仕組み

AI Avatarは写真の口を動かすだけではありません。Driving Performance、Character Reference、Gesture、Lip Syncを分けて理解します。

今日のたとえ人間の演技が動作を提供し、Character Referenceがデジタル衣装として画面に誰が現れるかを決めるイメージです。

一枚のイラストが突然話し始めたり、実写人物の表情をキャラクターがそのまま真似したりする動画があります。

こうした仕組みはAI Avatarや**Digital Human(デジタルヒューマン)**と呼ばれますが、中身は一種類ではありません。

最も単純なAvatar:画像 + 音声

基本Workflowは:

Character Image
+ Speech Audio
→ Talking Character

Lesson 040で扱ったLip Syncを中心に、口、目、頭部を動かします。

説明動画やVirtual Presenterにはこれだけでも十分な場合があります。

Performance Capture:別の人が演技を提供する

**Performance Capture(パフォーマンスキャプチャ)**では、実際の人が先に演技し、その情報を別キャラクターに移します。

転送対象には:

などがあります。

Runway Act-Twoは、Driving Performance VideoとCharacter Image / Videoを使う現在の一例です。

Driving Performanceは演技のSource

自分で:

眉をひそめる
→ 右を指す
→ 笑う
→ 一歩下がる

という演技を撮影しても、最終画面に出るのはロボットやアニメ人物かもしれません。

Driving Performanceは「どう動くか」を提供します。

Character Referenceは外見を提供する

Lesson 038で説明したReferenceは、キャラクター身份のAnchorです。

Avatarでは:

Driving Performance = 演技
Character Reference = 外見

と分けて考えると分かりやすいです。

顔だけでなくGestureも重要

古いTalking Headは「顔だけ動いて身体が板のよう」に見えることがありました。

身体や手までPerformanceを移すと自然になりますが、動きが大きいほど手指、遮蔽、衣服、体格の崩れも増えます。

全身Avatarは上半身Presenterより難しいことが多いです。

Real-time AvatarはLatencyも重要

即時対話型では:

ユーザーが話す
→ AIが理解
→ 音声生成
→ 表情・Lip Sync
→ ほぼ即時応答

となり、Qualityだけでなく**Latency(遅延)**も重要になります。

実在人物なら同意と権利を確認する

実在人物の顔や声を使う場合は、肖像、Voice、Consent、Deepfake、商用利用権などを確認する必要があります。

技術的に組み合わせられることと、許可されていることは別です。

ひとことで

AI Avatarでは「誰に見えるか」と「どう演じるか」を分離できます。Character Referenceが外見、Driving Performanceが表情や動作を提供し、VoiceとLip Syncを別Layerとして組み合わせます。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. Runway — Performance Capture with Act-Two ↗
  2. Runway Academy — Character Animation with Act-Two ↗
  3. Runway — Creating with Gen-4 Image References ↗
← 前の章040AI動画は音まで生成する?Native Audio、Lip Sync、TTS、効果音はそれぞれ別の仕事
次の章 →042実用的なAI動画Workflow:Script → Storyboard → Reference → Shot → Editingで作る
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200