生成式 AI · 生成模型

擴散模型 Diffusion

先把圖片一步步加噪成雪花,再訓練一個網路「倒帶」——從純雜訊裡逐步去噪,把清晰的圖案還原出來。這就是 Stable Diffusion、DALL·E、Midjourney 的核心。

前向加噪逆向去噪從雜訊生圖品質高、比 GAN 穩Stable Diffusion

💡一句話定義

擴散模型(Diffusion)分兩階段:前向過程逐步對資料加雜訊直到變純噪聲;反向過程訓練網路逐步去噪,從隨機噪聲一步步還原出清晰樣本。它是與 GAN、VAE 並列的三大生成模型,近年品質與穩定性最受青睞。

🎮互動:逐步去噪生成

畫面一開始是純雜訊。按「開始生成」,網路分 4 步逐步去噪,笑臉圖案從迷霧中慢慢浮現;按「重置為雜訊」回到起點再玩一次。

🌫️ 擴散模型 (Diffusion) 圖像生成原理
目前狀態: 純雜訊 (Pure Noise)

🖋️核心比喻:墨水與清水

一杯清水滴入一滴墨水,墨水會慢慢擴散直到整杯混濁——這很容易。擴散模型要做的是相反:給你一杯混濁的水,要你把它「倒帶」,讓墨水重新聚回最初那一滴。這極其困難,需要強大的 AI 來預測「每一步該去掉哪些雜訊」。

🔀前向 vs 逆向

面向前向過程(加噪)逆向過程(去噪)
方向清晰圖 → 純雜訊純雜訊 → 清晰圖
做什麼一步步加高斯雜訊,幾百次後成雪花網路逐步預測並減去雜訊
需要 AI 嗎不需要(固定的加噪規則)需要(U-Net 去噪網路,本頁動畫)
用途製造訓練資料推論時生成新圖

🧠它到底在學什麼?

去噪網路(常是 U-Net)學的是:「在某個噪聲程度下,這張圖該去掉哪些雜訊(或還原方向)」。推論時就從一團純噪聲開始,反覆套用這個去噪網路幾十上百步,清晰結構逐漸浮現,最終生成高品質結果。

🧭文字如何控制生成?

輸入「一隻戴帽子的太空貓」時,這段文字被轉成嵌入向量,並在每一步去噪都注入給網路(常用交叉注意力 cross-attention)。就像給 AI 一個指南針:去噪時往「太空貓」的方向走、別往「風景畫」——這叫條件擴散(Conditional Diffusion),也就是文字生圖。

優缺點 & Stable Diffusion

優點
生成品質與多樣性高、訓練比 GAN 穩定(沒有對抗、不易崩潰)。
🐢缺點
多步取樣、速度較慢;可用 DDIM 等方法加速。
🗜️Stable Diffusion
潛在擴散:先用自編碼器把影像壓到較小的潛在空間做擴散,大幅省算,再解碼回影像。

評估生成影像常用 FID(越低越逼真),別用準確率。

自我檢測

Q1. 擴散模型怎麼生成資料?
兩階段:前向過程逐步加雜訊直到變純噪聲;反向過程訓練網路逐步去噪,從隨機噪聲一步步還原清晰樣本。
Q2. 它實際在學什麼?
學在某個噪聲程度下如何預測該去掉的噪聲(或還原方向)。推論時從噪聲開始、反覆套用去噪網路即可生成。
Q3. 擴散模型的優缺點?
優點:品質與多樣性高、訓練比 GAN 穩定(無對抗)。缺點:需多步取樣、速度慢(可用 DDIM 等加速)。
Q4. 文字怎麼控制生成內容?
把文字嵌入透過條件機制(如交叉注意力)注入去噪網路的每一步,讓生成依提示詞導向,即文字生圖。

🎯重點整理

📝 iPAS 考點提醒

擴散模型(Diffusion)是當前主流影像生成技術,iPAS 生成式 AI 考點(中級科目一)。重點:先逐步加噪、再學習反向去噪從雜訊生成,品質高、訓練比 GAN 穩,是 Stable Diffusion、Midjourney 的底層。易混點:評估生成影像用 FID(越低越逼真),別用準確率;Diffusion 取樣步驟多、較慢;與 GAN、VAE 並列三大生成法。情境:文字生圖、影像編輯、超解析。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

擴散模型怎麼生成資料?

分兩階段:前向過程逐步對資料加雜訊直到變純噪聲;反向過程訓練網路逐步去噪,從隨機噪聲一步步還原出清晰樣本。

它實際在學什麼?

學在某個噪聲程度下如何預測該去掉的噪聲(或還原方向)。推論時從噪聲開始、反覆套用去噪網路即可生成。

擴散模型的優缺點?

優點:生成品質與多樣性高、訓練比 GAN 穩定(無對抗)。缺點:需多步取樣、速度慢(可用 DDIM 等加速)。

Stable Diffusion 為什麼較快?

它是潛在擴散:先用自編碼器把影像壓到較小的潛在空間,在那裡做擴散以大幅降低運算量,再解碼回影像。

文字怎麼控制生成內容?

透過條件機制(如把文字嵌入用交叉注意力注入去噪網路),讓生成依提示詞導向,即文字生圖。

🧭 相關主題

← 返回 AI 學習與考證地圖