← ホームへ戻る
LESSON 012AI入門7 分

マルチモーダルAIとは?文字だけでなく、画像を見て音も聞けるアシスタント

AIは文字だけを読むものではありません。第012回では、文字・画像・音声・動画を同じ課題で扱うマルチモーダルAIを感覚のたとえから理解します。

今日のたとえ文字しか読めなかった案内係が、画像を見て音を聞き、資料まで読めるようになること

ホテルのフロントで、部屋のエアコンが壊れたと相談する場面を想像してください。

一人目のスタッフは、あなたが入力した文章しか読めません。二人目は、操作パネルの写真を見て、異音の録音を聞き、説明書のPDFまで確認できます。

この二人目のイメージが、**マルチモーダル人工知能(Multimodal Artificial Intelligence, Multimodal AI)**を理解する入口です。

モダリティとは?

**モダリティ(Modality)**とは、情報が入ってくる形式のことです。

は、それぞれ別のモダリティです。

以前のAIは、画像認識、音声認識、文章処理のように役割が分かれていることが多くありました。現在は、一つのやり取りの中で複数形式を扱えるモデルが増えています。

「モデル」がまだ曖昧なら、第002回を先に確認してください。モデルとは、学習を通して入力を出力へ変換するAIの中核です。

複数のAIをつないだだけとは限らない

音声認識で音を文字に変換し、その文字を言語モデルへ渡すようなシステムもあります。

一方、マルチモーダルモデルでは、複数種類の入力を同じ問題の中で扱えるように設計されています。

たとえば冷蔵庫の写真を渡して「今夜何を作れる?」と聞く場合、画像内の食材と質問文の意味を同時に使う必要があります。

単に「卵、牛乳、トマトがあります」と物体を列挙するだけとは違います。

AIは人間と同じように画像を見ている?

完全に同じではありません。

人間は写真を見ると、距離、表情、空間関係などを自然に感じ取ります。モデルは画像を計算可能な数値表現へ変換し、文字などの情報と一緒に処理します。

そのため、強力なモデルでも、

ことがあります。

第006回の注意点と同じで、「もっともらしい答え」と「事実として正しい答え」は同じではありません。

本当の強みは手がかりを組み合わせること

探偵が文章だけでなく、写真、録音、映像、書類を同時に調べられると、使える証拠が増えます。

マルチモーダルAIも同じです。たとえば、

といった使い方ができます。

入力できることと、生成できることは別

画像を入力できるモデルが、必ず画像を生成できるとは限りません。

モデルを見るときは、

  1. 何を入力できるか
  2. 何を出力できるか

を分けて考えましょう。

今日の一文

マルチモーダルAIとは、文字・画像・音声・動画など異なる形式の情報を、同じ課題の中で扱えるAIです。

次の第013回では、「画像を理解する」から一歩進み、AIが存在しなかった画像をどう生成するのかを見ていきます。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. Google — Gemini API Getting Started: Multimodal Understanding ↗
  2. OpenAI — Models ↗
← 前の章011AIロールプレイはどこまで深くできる?陪伴、恋愛、成人向けはモデル以外のルールでも決まる
次の章 →013AIはどうやって画像を生成する?ノイズだらけの画面を少しずつ絵に整えるイメージ
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200