← 返回首頁
LESSON 012AI 入門7 分鐘

多模態 AI 是什麼?像一位不只聽你說話,還會看圖、聽聲音的助理

AI 不一定只能讀文字。第十二篇用人的感官理解多模態 AI,看看文字、圖片、聲音、影片為什麼可以一起成為模型的輸入。

今天用這個比喻從只會看文字的客服,升級成能看、能聽、能讀文件的助理

想像你去飯店櫃台求助。

第一位服務人員只能看你打出來的文字。你說:「我的房間冷氣好像壞了。」他可以回答你,但如果你丟一張控制面板照片給他,他看不懂。

第二位不一樣。你可以直接把控制面板拍給他、錄下冷氣發出的怪聲,甚至把說明書 PDF 一起傳過去。

他不只「聽你描述」,還能一起看其他線索。

這就是理解**多模態人工智慧(Multimodal Artificial Intelligence, Multimodal AI)**最簡單的方式。

模態是什麼?

「模態(Modality)」可以先想成資訊進來的不同形式。

例如:

以前很多 AI 系統很專門:看圖片的做圖片、聽聲音的做聲音、處理文字的做文字。

現在越來越多模型可以在同一次互動裡處理多種資訊。

如果你忘了「模型」到底是什麼,可以先回去看 Lesson 002:AI 模型是什麼?。一句話 recap:模型就是經過訓練、負責把輸入轉成某種輸出的 AI 核心。

多模態不等於「很多個 AI 貼在一起」

有些系統確實會把不同模型串起來:先用語音辨識把聲音轉文字,再把文字交給語言模型。

但「多模態模型」更進一步的概念,是模型本身就能接收不只一種資訊形式,並把它們放在同一個問題裡理解。

例如你給它一張冰箱照片,再問:

「我今晚可以煮什麼?」

模型要同時理解圖片裡有哪些食材,也要理解你的文字問題。

這和只做「圖片裡有雞蛋、牛奶、番茄」的辨識不太一樣。

圖片進去之後,AI 真的像人一樣看嗎?

不完全是。

人看到一張照片,會自然感受到距離、空間、表情與情境。模型則需要把圖片轉成它能計算的表示,再和文字等資訊一起處理。

所以多模態 AI 可以很強,但還是可能:

這和前面談過的 AI 不保證永遠正確是同一件事。忘記的話可以回看 Lesson 006:AI 幻覺是什麼?。一句話 recap:模型很擅長產生合理答案,但合理不代表事實一定正確。

多模態真正厲害的地方,是「把線索放在一起」

你可以想像偵探辦案。

只有筆錄時,他只能讀文字。

如果再給他監視器照片、電話錄音、現場影片和文件,能使用的線索就更多。

同樣地,多模態 AI 的價值不只是「它會看圖片」,而是可以把多種資訊一起放進同一個任務。

例如:

輸入和輸出也可以是不同模態

這裡再多一個重要概念。

模型「看得到」圖片,不代表它一定「畫得出」圖片。

有些模型可以接收圖片,但最後只輸出文字;有些模型則可以直接生成圖片、聲音甚至影片。

所以看模型能力時,要分清楚:

它能接收什麼(Input)?又能產生什麼(Output)?

就像一位翻譯可能聽得懂日文、英文和中文,但工作內容只要求他最後交一份中文文字稿。

今天只要記住一句話

多模態 AI,就是能在同一個任務裡處理文字、圖片、聲音、影片等不同形式資訊的 AI。

下一篇,我們就從「AI 看得懂圖片」再往前一步:它到底是怎麼把一張原本不存在的圖片生成出來的?

正式資料來源

比喻是理解入口;正式定義與細節請以原始資料為準。

  1. Google — Gemini API Getting Started: Multimodal Understanding ↗
  2. OpenAI — Models ↗
← 上一章011AI 角色扮演可以到多深入?陪伴、戀愛、成人向,其實差在產品規則與記憶
下一章 →013AI 是怎麼生成圖片的?像從一張滿是雜訊的紙,慢慢把畫面整理出來
COMMUNITY

留言

有想法、疑問或想補充的地方,都可以留在這裡。

0 / 1200