ホテルのフロントで、部屋のエアコンが壊れたと相談する場面を想像してください。
一人目のスタッフは、あなたが入力した文章しか読めません。二人目は、操作パネルの写真を見て、異音の録音を聞き、説明書のPDFまで確認できます。
この二人目のイメージが、**マルチモーダル人工知能(Multimodal Artificial Intelligence, Multimodal AI)**を理解する入口です。
モダリティとは?
**モダリティ(Modality)**とは、情報が入ってくる形式のことです。
- 文字
- 画像
- 音声
- 動画
は、それぞれ別のモダリティです。
以前のAIは、画像認識、音声認識、文章処理のように役割が分かれていることが多くありました。現在は、一つのやり取りの中で複数形式を扱えるモデルが増えています。
「モデル」がまだ曖昧なら、第002回を先に確認してください。モデルとは、学習を通して入力を出力へ変換するAIの中核です。
複数のAIをつないだだけとは限らない
音声認識で音を文字に変換し、その文字を言語モデルへ渡すようなシステムもあります。
一方、マルチモーダルモデルでは、複数種類の入力を同じ問題の中で扱えるように設計されています。
たとえば冷蔵庫の写真を渡して「今夜何を作れる?」と聞く場合、画像内の食材と質問文の意味を同時に使う必要があります。
単に「卵、牛乳、トマトがあります」と物体を列挙するだけとは違います。
AIは人間と同じように画像を見ている?
完全に同じではありません。
人間は写真を見ると、距離、表情、空間関係などを自然に感じ取ります。モデルは画像を計算可能な数値表現へ変換し、文字などの情報と一緒に処理します。
そのため、強力なモデルでも、
- 小さな文字を読み違える
- 物体の位置関係を間違える
- グラフを誤解する
- 写っていない細部を補ってしまう
- 動画の一瞬を取り違える
ことがあります。
第006回の注意点と同じで、「もっともらしい答え」と「事実として正しい答え」は同じではありません。
本当の強みは手がかりを組み合わせること
探偵が文章だけでなく、写真、録音、映像、書類を同時に調べられると、使える証拠が増えます。
マルチモーダルAIも同じです。たとえば、
- 商品写真を見て説明文を書く
- 会議音声からToDoを整理する
- グラフと説明文を一緒に読んで傾向を探す
- 動画のどの時点で動作が起きたか答える
- デザイン案と要件書を比較する
といった使い方ができます。
入力できることと、生成できることは別
画像を入力できるモデルが、必ず画像を生成できるとは限りません。
モデルを見るときは、
- 何を入力できるか
- 何を出力できるか
を分けて考えましょう。
今日の一文
マルチモーダルAIとは、文字・画像・音声・動画など異なる形式の情報を、同じ課題の中で扱えるAIです。
次の第013回では、「画像を理解する」から一歩進み、AIが存在しなかった画像をどう生成するのかを見ていきます。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。