AI動画ツールを開くと、最初に目に入るのは大量のモデル名かもしれません。
しかし初心者にとって、先に決めるべきなのは「どのモデルが一番強いか」ではなく、何を出発点として動画を作るかです。
Lesson 016では、動画生成では一枚の画像だけでなく、時間方向のつながりまで作る必要があると説明しました。
現在の動画生成では、その難しい仕事に対して複数の入力方法があります。
Text-to-Video:文章だけから始める
Text-to-Video(T2V) は、文章を渡してシーン全体を一から作る方法です。
雨の夜の台北の路地。
赤いコートの人物がネオン看板の前を歩く。
低い位置から追跡撮影、濡れた路面に光が反射、6秒。
自由度が高く、雰囲気や構図のアイデアを素早く試せます。
その一方で、顔、服、物の位置など多くの要素をモデル側が決めるため、試行ごとの差も大きくなりやすいです。
Image-to-Video:最初の画を先に決める
Image-to-Video(I2V) は、画像を渡してその画面を動かす方法です。
Lesson 013の画像生成でキャラクターや商品、場面を先に確定し、その承認済み画像を動画化できます。
この場合、Promptは外見説明よりも動きに集中できます。
彼女はゆっくり窓の外を見る。
右手のグラスを少し回す。
カメラは非常にゆっくり前進する。
Reference:身份やスタイルの手掛かりを増やす
現在は**Reference(参照素材)**として複数の画像や動画を使えるWorkflowも増えています。
Referenceは、キャラクター、衣装、場面、スタイル、動作、カメラの参考などに使われます。
映画制作で、絵コンテだけでなく出演者の写真、衣装資料、動作見本も渡すイメージです。
First / Last Frame:開始と終了を指定する
**First Frame / Last Frame(最初/最後のフレーム)**を指定できるモデルでは、AからBへの変化をより明確にできます。
開始:机の上に白いバラ
終了:バラがガラス片に変わっている
変身、商品演出、トランジションなどで便利です。
Video-to-Video:既存動画を骨格にする
**Video-to-Video(V2V)**は、既存動画の動きや時間、カメラワークを利用しながら外見やスタイルを変更するWorkflowです。
すでに良い演技やカメラ移動がある場合、それをモデルに再発明させる必要がありません。
2026年は複数入力を組み合わせる方向へ
2026年9月時点で、Google Veo 3.1やRunwayの公式資料には、文字、画像、Reference、フレーム制約、既存動画など複数の入力方法が記載されています。
機能はモデルのVersionや提供画面によって変わるため、古い比較表を固定仕様だと思わないことが重要です。
判断の順番は覚えやすいです。
ゼロから発想したい
→ Text-to-Video
見た目を先に固定したい
→ Image-to-Video
人物・スタイル・動きを維持したい
→ Reference / Video-to-Video
開始と終了を強く固定したい
→ First / Last Frame
「最高画質」と「自分のWorkflowに最適」は別
同じキャラクターで8ショット作るなら、一発のDemo画質よりReference制御のほうが重要かもしれません。
比較するときは、画質だけでなく入力形式、Reference、首尾フレーム、編集・延長、音声、編集ソフトへの接続を確認しましょう。
ひとことで
AI動画生成はText-to-Videoだけではありません。手元の素材と固定したい要素に合わせて入力モードを選び、その後でモデルを比較するほうが実用的です。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。