生成式 AI · GAN 的痛點

GAN 模式崩潰 Mode Collapse

生成器偷懶找捷徑:只要有幾種輸出能穩定騙過判別器,它就一直產同一種——結果多樣性全沒了。WGAN 用「推土機距離」把它救回來。

只生成少數樣本失去多樣性找捷徑騙 DWGAN 推土機距離WGAN-GP

💡一句話定義

模式崩潰(Mode Collapse)=GAN 訓練時,生成器只學會產生少數幾種能騙過判別器的樣本、失去多樣性(例如只生成一種臉),無法涵蓋真實資料的各種模式。它是 GAN 最常見也最棘手的問題之一。

🎮互動:GAN 崩潰 vs WGAN 覆蓋

綠點是真實資料的 4 種模式(如男女、長短髮)。選模式後按「開始訓練」看紅色生成點怎麼跑:原始 GAN 全擠進同一坨(崩潰);WGAN 均勻覆蓋四坨(有多樣性)。

🎯 GAN 模式崩潰與 WGAN 解決方案
真實資料分佈 (4種人臉模式)
網路生成資料 (Generator)

🕳️為什麼會發生?

生成器找到捷徑——某幾個輸出能穩定騙過判別器,它就一直產出這些,其他真實模式全被忽略。加上兩網路博弈不穩、目標相反、輪流更新,很容易陷入這種退化均衡。模式崩潰其實是「GAN 訓練不穩」的典型症狀之一。

⚖️原始 GAN vs WGAN

面向原始 GANWGAN
損失度量JS 散度(分布不重疊時梯度易消失)Wasserstein/推土機距離(EMD)
生成行為擠向單一模式(崩潰)被逼均勻覆蓋所有模式
多樣性
訓練穩定度不穩、易震盪較穩(WGAN-GP 更佳)

🚜WGAN 的「推土機距離」

Wasserstein 距離(Earth Mover's Distance)衡量的是「把一堆土從生成分布成真實分布,需要的整體搬運成本」。這個度量逼迫生成器把機率質量均勻鋪到所有模式上,而不是全堆在一處——所以能對抗模式崩潰,梯度也更平滑好訓練。

🔧怎麼診斷與緩解?

🔍診斷
生成多樣性低、不同輸入卻產相似圖;用多樣性指標或跟真實分布算 FID
🧪結構技巧
minibatch discrimination、特徵匹配、unrolled GAN,讓 G 看到「整批」而非單張。
📐損失改良
WGAN / WGAN-GP(更穩的損失+梯度懲罰)、加噪與多樣性正則。

自我檢測

Q1. 模式崩潰是什麼?
GAN 訓練時生成器只學會產生少數幾種能騙過判別器的樣本、失去多樣性(如只生成一種臉),無法涵蓋真實資料的各種模式。
Q2. 為什麼會發生?
生成器找到捷徑——某幾個輸出能穩定騙過判別器就一直產出;加上兩網路博弈不穩,容易陷入這種退化均衡。
Q3. WGAN 為什麼能緩解?
WGAN 用 Wasserstein(推土機)距離計算整體搬運成本,逼生成器把機率均勻鋪到所有模式、覆蓋多樣性,梯度也更平滑穩定。
Q4. 還有哪些緩解方法?
minibatch discrimination、特徵匹配、WGAN-GP(梯度懲罰)、unrolled GAN、加噪與多樣性正則;並可用 FID 檢查多樣性。

🎯重點整理

📝 iPAS 考點提醒

GAN 由生成器與判別器對抗訓練,iPAS 生成式 AI 考點(初級科目一鑑別與生成、中級科目一)。重點:生成器造假、判別器抓假,互相較勁直到生成逼真樣本。易混點:GAN 是生成新樣本、非分類;訓練不穩、常見模式崩潰(mode collapse)——生成器只產出少數幾種樣本、缺多樣性。情境:與 VAE、Diffusion 並列三大生成技術,Diffusion 近年品質與穩定性更受青睞。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

模式崩潰(mode collapse)是什麼?

GAN 訓練時生成器只學會產生少數幾種能騙過判別器的樣本、失去多樣性(如只生成一種臉),無法涵蓋真實資料的各種模式。

為什麼會發生?

生成器找到捷徑——某幾個輸出能穩定騙過判別器就一直產出;加上兩網路博弈不穩,容易陷入這種退化均衡。

怎麼診斷?

生成結果多樣性低、很多不同輸入卻產出相似圖;可用多樣性指標、看樣本分布,或與真實分布算 FID 檢查。

怎麼緩解?

minibatch discrimination、特徵匹配、WGAN 與 WGAN-GP(更穩的損失與梯度懲罰)、unrolled GAN、加噪與多樣性正則。

和訓練不穩的關係?

模式崩潰是 GAN 訓練不穩的典型症狀之一;改善穩定性(平衡兩網路、好的損失)通常也能減輕崩潰。

🧭 相關主題

← 返回 AI 學習與考證地圖