← 返回首頁
LESSON 013工具入門8 分鐘

AI 是怎麼生成圖片的?像從一張滿是雜訊的紙,慢慢把畫面整理出來

AI 不是從圖庫裡找一張最像的照片貼給你。第十三篇用整理雜訊的比喻理解圖片生成,以及文字提示怎麼一步步影響畫面。

今天用這個比喻從滿是雪花雜訊的畫面裡,一步步整理出你描述的場景

你跟 AI 說:

「畫一間下雨夜裡、只有暖黃色燈光的便利商店。」

幾秒後,一張原本不存在的圖出現了。

第一個很自然的問題是:

它是不是從網路上找了一張最像的便利商店照片給我?

不是這麼簡單。

生成式圖片模型的核心工作,是根據你的條件產生新的影像內容,而不是單純做圖片搜尋。

如果你忘了「模型」是什麼,可以回看 Lesson 002:AI 模型是什麼?。一句話 recap:模型是經過訓練後,負責把輸入轉成輸出的 AI 核心。

先想像一張滿是電視雪花的畫面

老電視沒收到訊號時,畫面會是一堆亂七八糟的雪花點。

現在想像有一位非常會畫圖的人站在旁邊。你告訴他:

「我要雨夜、便利商店、暖黃色燈、街上沒有人。」

他不是一筆把整張圖畫完,而是不斷問:

「現在這團混亂,往哪個方向調整,會更像你描述的東西?」

一點一點整理後,原本沒有形狀的雜訊開始出現建築、窗戶、燈光、柏油路和雨滴。

這是理解**擴散模型(Diffusion Model)**的一個很好入口。

擴散模型在做什麼?

很多經典的 AI 圖片生成系統使用擴散方法。訓練時,模型學習影像被加入雜訊後會變成什麼樣子,也學習如何反過來逐步去除雜訊。

生成時,就可以從高度隨機的狀態開始,一步一步往符合條件的圖片靠近。

要注意:**現在不是所有圖片生成模型都使用完全相同的架構。**不同公司與模型可能採用不同方法,或把語言理解、影像生成與其他技術整合在一起。

所以「從雜訊整理成圖片」是一個非常有用的入門直覺,但不是所有現代模型的完整內部說明。

那文字是怎麼控制圖片的?

這就接到前面學過的 Prompt。一句話 recap:Prompt 就是你交給 AI 的需求、條件與上下文。

當你輸入:

「一隻白色柴犬坐在紅色沙發上,下午陽光從左邊窗戶照進來。」

模型不只是看到「狗」這一個關鍵字。

它要同時處理:

這種從文字直接生成圖片的任務,常叫做文字生成圖片(Text-to-Image, T2I)。

為什麼同一句 Prompt,每次圖片不一樣?

因為生成過程通常包含隨機性。

你可以把它想成同一位攝影師收到同一份拍攝需求:

「幫我拍一張東京雨夜的街景。」

即使條件一模一樣,他也可能第一次站左邊、第二次站右邊;第一次剛好有人撐紅傘,第二次沒有。

AI 圖片生成也有類似情況。

同一段描述可以對應很多合理畫面,所以不同生成結果不一定完全相同。

AI 是不是把訓練資料直接剪貼在一起?

也不能這樣理解。

模型在訓練時會從大量資料中學習影像與文字之間的統計規律,例如「金屬通常怎麼反光」、「夕陽常有哪些色調」、「貓的臉通常有哪些結構」。

如果你想複習 AI 的「學習」概念,可以回看 Lesson 003:AI 是怎麼學會的?。一句話 recap:訓練不是把答案一題題塞進模型,而是讓模型從大量例子中調整自己對規律的判斷。

但這不代表生成模型完全沒有著作權、記憶或資料重現方面的爭議。模型可能在某些情況產生與訓練內容高度相似的結果,因此商業使用時仍要注意平台規則、素材權利與實際用途。

生成和編輯其實是兩件不同但相近的事

你可以:

  1. 從文字開始,生成一張全新的圖。
  2. 丟一張現有圖片,要求改背景、換衣服或調整某個區域。

第二種常被稱為**圖片到圖片(Image-to-Image, I2I)**或影像編輯工作流程。

這也帶出後面很重要的一件事:如果你想讓同一個角色每張都長得很像,光靠文字往往不夠。

今天只要記住一句話

AI 圖片生成不是去圖庫找答案,而是根據學到的影像規律與你的條件,產生一個新的畫面。

下一篇我們不只理解原理,直接進入實戰:一個圖片 Prompt 到底該怎麼寫,才能讓 AI 少猜一點?

正式資料來源

比喻是理解入口;正式定義與細節請以原始資料為準。

  1. OpenAI — GPT Image 2 Model ↗
  2. Google — Gemini API Image Generation ↗
← 上一章012多模態 AI 是什麼?像一位不只聽你說話,還會看圖、聽聲音的助理
下一章 →014AI 圖片 Prompt 怎麼寫?像一份拍攝企劃:主角、場景、鏡頭、光線都要交代
COMMUNITY

留言

有想法、疑問或想補充的地方,都可以留在這裡。

0 / 1200