你跟 AI 說:
「畫一間下雨夜裡、只有暖黃色燈光的便利商店。」
幾秒後,一張原本不存在的圖出現了。
第一個很自然的問題是:
它是不是從網路上找了一張最像的便利商店照片給我?
不是這麼簡單。
生成式圖片模型的核心工作,是根據你的條件產生新的影像內容,而不是單純做圖片搜尋。
如果你忘了「模型」是什麼,可以回看 Lesson 002:AI 模型是什麼?。一句話 recap:模型是經過訓練後,負責把輸入轉成輸出的 AI 核心。
先想像一張滿是電視雪花的畫面
老電視沒收到訊號時,畫面會是一堆亂七八糟的雪花點。
現在想像有一位非常會畫圖的人站在旁邊。你告訴他:
「我要雨夜、便利商店、暖黃色燈、街上沒有人。」
他不是一筆把整張圖畫完,而是不斷問:
「現在這團混亂,往哪個方向調整,會更像你描述的東西?」
一點一點整理後,原本沒有形狀的雜訊開始出現建築、窗戶、燈光、柏油路和雨滴。
這是理解**擴散模型(Diffusion Model)**的一個很好入口。
擴散模型在做什麼?
很多經典的 AI 圖片生成系統使用擴散方法。訓練時,模型學習影像被加入雜訊後會變成什麼樣子,也學習如何反過來逐步去除雜訊。
生成時,就可以從高度隨機的狀態開始,一步一步往符合條件的圖片靠近。
要注意:**現在不是所有圖片生成模型都使用完全相同的架構。**不同公司與模型可能採用不同方法,或把語言理解、影像生成與其他技術整合在一起。
所以「從雜訊整理成圖片」是一個非常有用的入門直覺,但不是所有現代模型的完整內部說明。
那文字是怎麼控制圖片的?
這就接到前面學過的 Prompt。一句話 recap:Prompt 就是你交給 AI 的需求、條件與上下文。
當你輸入:
「一隻白色柴犬坐在紅色沙發上,下午陽光從左邊窗戶照進來。」
模型不只是看到「狗」這一個關鍵字。
它要同時處理:
- 主體:白色柴犬
- 位置:紅色沙發
- 光線:下午陽光
- 方向:左側窗戶
- 整體關係:狗坐在沙發上,而不是沙發坐在狗上
這種從文字直接生成圖片的任務,常叫做文字生成圖片(Text-to-Image, T2I)。
為什麼同一句 Prompt,每次圖片不一樣?
因為生成過程通常包含隨機性。
你可以把它想成同一位攝影師收到同一份拍攝需求:
「幫我拍一張東京雨夜的街景。」
即使條件一模一樣,他也可能第一次站左邊、第二次站右邊;第一次剛好有人撐紅傘,第二次沒有。
AI 圖片生成也有類似情況。
同一段描述可以對應很多合理畫面,所以不同生成結果不一定完全相同。
AI 是不是把訓練資料直接剪貼在一起?
也不能這樣理解。
模型在訓練時會從大量資料中學習影像與文字之間的統計規律,例如「金屬通常怎麼反光」、「夕陽常有哪些色調」、「貓的臉通常有哪些結構」。
如果你想複習 AI 的「學習」概念,可以回看 Lesson 003:AI 是怎麼學會的?。一句話 recap:訓練不是把答案一題題塞進模型,而是讓模型從大量例子中調整自己對規律的判斷。
但這不代表生成模型完全沒有著作權、記憶或資料重現方面的爭議。模型可能在某些情況產生與訓練內容高度相似的結果,因此商業使用時仍要注意平台規則、素材權利與實際用途。
生成和編輯其實是兩件不同但相近的事
你可以:
- 從文字開始,生成一張全新的圖。
- 丟一張現有圖片,要求改背景、換衣服或調整某個區域。
第二種常被稱為**圖片到圖片(Image-to-Image, I2I)**或影像編輯工作流程。
這也帶出後面很重要的一件事:如果你想讓同一個角色每張都長得很像,光靠文字往往不夠。
今天只要記住一句話
AI 圖片生成不是去圖庫找答案,而是根據學到的影像規律與你的條件,產生一個新的畫面。
下一篇我們不只理解原理,直接進入實戰:一個圖片 Prompt 到底該怎麼寫,才能讓 AI 少猜一點?
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。