想像你去飯店櫃台求助。
第一位服務人員只能看你打出來的文字。你說:「我的房間冷氣好像壞了。」他可以回答你,但如果你丟一張控制面板照片給他,他看不懂。
第二位不一樣。你可以直接把控制面板拍給他、錄下冷氣發出的怪聲,甚至把說明書 PDF 一起傳過去。
他不只「聽你描述」,還能一起看其他線索。
這就是理解**多模態人工智慧(Multimodal Artificial Intelligence, Multimodal AI)**最簡單的方式。
模態是什麼?
「模態(Modality)」可以先想成資訊進來的不同形式。
例如:
- 文字是一種模態
- 圖片是一種模態
- 聲音是一種模態
- 影片是一種模態
以前很多 AI 系統很專門:看圖片的做圖片、聽聲音的做聲音、處理文字的做文字。
現在越來越多模型可以在同一次互動裡處理多種資訊。
如果你忘了「模型」到底是什麼,可以先回去看 Lesson 002:AI 模型是什麼?。一句話 recap:模型就是經過訓練、負責把輸入轉成某種輸出的 AI 核心。
多模態不等於「很多個 AI 貼在一起」
有些系統確實會把不同模型串起來:先用語音辨識把聲音轉文字,再把文字交給語言模型。
但「多模態模型」更進一步的概念,是模型本身就能接收不只一種資訊形式,並把它們放在同一個問題裡理解。
例如你給它一張冰箱照片,再問:
「我今晚可以煮什麼?」
模型要同時理解圖片裡有哪些食材,也要理解你的文字問題。
這和只做「圖片裡有雞蛋、牛奶、番茄」的辨識不太一樣。
圖片進去之後,AI 真的像人一樣看嗎?
不完全是。
人看到一張照片,會自然感受到距離、空間、表情與情境。模型則需要把圖片轉成它能計算的表示,再和文字等資訊一起處理。
所以多模態 AI 可以很強,但還是可能:
- 看錯很小的字
- 搞錯物體位置
- 對圖表做錯推論
- 把沒有出現的細節補出來
這和前面談過的 AI 不保證永遠正確是同一件事。忘記的話可以回看 Lesson 006:AI 幻覺是什麼?。一句話 recap:模型很擅長產生合理答案,但合理不代表事實一定正確。
多模態真正厲害的地方,是「把線索放在一起」
你可以想像偵探辦案。
只有筆錄時,他只能讀文字。
如果再給他監視器照片、電話錄音、現場影片和文件,能使用的線索就更多。
同樣地,多模態 AI 的價值不只是「它會看圖片」,而是可以把多種資訊一起放進同一個任務。
例如:
- 看一張產品照片,幫你寫商品描述
- 聽一段會議錄音,再整理待辦事項
- 讀圖表加上文字說明,幫你找出趨勢
- 看一段影片,再回答某個動作發生在哪裡
- 同時看設計稿和需求文件,指出不一致的地方
輸入和輸出也可以是不同模態
這裡再多一個重要概念。
模型「看得到」圖片,不代表它一定「畫得出」圖片。
有些模型可以接收圖片,但最後只輸出文字;有些模型則可以直接生成圖片、聲音甚至影片。
所以看模型能力時,要分清楚:
它能接收什麼(Input)?又能產生什麼(Output)?
就像一位翻譯可能聽得懂日文、英文和中文,但工作內容只要求他最後交一份中文文字稿。
今天只要記住一句話
多模態 AI,就是能在同一個任務裡處理文字、圖片、聲音、影片等不同形式資訊的 AI。
下一篇,我們就從「AI 看得懂圖片」再往前一步:它到底是怎麼把一張原本不存在的圖片生成出來的?
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。