💡一句話定義
擴散模型(Diffusion)分兩階段:前向過程逐步對資料加雜訊直到變純噪聲;反向過程訓練網路逐步去噪,從隨機噪聲一步步還原出清晰樣本。它是與 GAN、VAE 並列的三大生成模型,近年品質與穩定性最受青睞。
🎮互動:逐步去噪生成
畫面一開始是純雜訊。按「開始生成」,網路分 4 步逐步去噪,笑臉圖案從迷霧中慢慢浮現;按「重置為雜訊」回到起點再玩一次。
🌫️ 擴散模型 (Diffusion) 圖像生成原理
🖋️核心比喻:墨水與清水
🔀前向 vs 逆向
| 面向 | 前向過程(加噪) | 逆向過程(去噪) |
|---|---|---|
| 方向 | 清晰圖 → 純雜訊 | 純雜訊 → 清晰圖 |
| 做什麼 | 一步步加高斯雜訊,幾百次後成雪花 | 網路逐步預測並減去雜訊 |
| 需要 AI 嗎 | 不需要(固定的加噪規則) | 需要(U-Net 去噪網路,本頁動畫) |
| 用途 | 製造訓練資料 | 推論時生成新圖 |
🧠它到底在學什麼?
去噪網路(常是 U-Net)學的是:「在某個噪聲程度下,這張圖該去掉哪些雜訊(或還原方向)」。推論時就從一團純噪聲開始,反覆套用這個去噪網路幾十上百步,清晰結構逐漸浮現,最終生成高品質結果。
🧭文字如何控制生成?
輸入「一隻戴帽子的太空貓」時,這段文字被轉成嵌入向量,並在每一步去噪都注入給網路(常用交叉注意力 cross-attention)。就像給 AI 一個指南針:去噪時往「太空貓」的方向走、別往「風景畫」——這叫條件擴散(Conditional Diffusion),也就是文字生圖。
⚡優缺點 & Stable Diffusion
✅優點
生成品質與多樣性高、訓練比 GAN 穩定(沒有對抗、不易崩潰)。
生成品質與多樣性高、訓練比 GAN 穩定(沒有對抗、不易崩潰)。
🐢缺點
需多步取樣、速度較慢;可用 DDIM 等方法加速。
需多步取樣、速度較慢;可用 DDIM 等方法加速。
🗜️Stable Diffusion
潛在擴散:先用自編碼器把影像壓到較小的潛在空間做擴散,大幅省算,再解碼回影像。
潛在擴散:先用自編碼器把影像壓到較小的潛在空間做擴散,大幅省算,再解碼回影像。
評估生成影像常用 FID(越低越逼真),別用準確率。
✅自我檢測
Q1. 擴散模型怎麼生成資料?
兩階段:前向過程逐步加雜訊直到變純噪聲;反向過程訓練網路逐步去噪,從隨機噪聲一步步還原清晰樣本。
Q2. 它實際在學什麼?
學在某個噪聲程度下如何預測該去掉的噪聲(或還原方向)。推論時從噪聲開始、反覆套用去噪網路即可生成。
Q3. 擴散模型的優缺點?
優點:品質與多樣性高、訓練比 GAN 穩定(無對抗)。缺點:需多步取樣、速度慢(可用 DDIM 等加速)。
Q4. 文字怎麼控制生成內容?
把文字嵌入透過條件機制(如交叉注意力)注入去噪網路的每一步,讓生成依提示詞導向,即文字生圖。
🎯重點整理
- 兩階段:前向加噪、逆向去噪。
- 生成:從純噪聲反覆去噪還原圖像。
- 學什麼:預測某噪聲程度下該去掉的雜訊。
- 文字控制:條件擴散(cross-attention 注入)。
- 定位:品質高、比 GAN 穩;SD 用潛在擴散加速。