用直覺的特徵空間幾何圖與實體影像模擬,徹底搞懂 FID、IS 與 LPIPS 的制衡藝術!
影像生成模型不能只看單張圖,必須看「一萬張生成圖」的集體統計型態。綠色圓圈為真實分布。請切換模型狀態看藍點的變化:
💡 肉眼大盲點大破解:請拉動下方滑桿,讓右側的 AI 生成圖產生「微小的向右挪移、模糊與雜訊」。注意觀察:在人類肉眼看來,右邊依然是一個清楚的機器人笑臉;但左側的像素級 MSE 指標卻會瞬間崩潰!
傳統 MSE 是死板地把兩張圖的同一格像素相減。當機器人往右移 10 像素時,對 MSE 來說,原本是黑色的地方全變成了灰色,便判定這兩張圖「完全無關」!
而 LPIPS 是把圖送進神經網路大腦,提取高層特徵。大腦看懂了「這裡有兩個綠色圓形眼睛、一個嘴巴,組成了一張臉」。因此,圖片微調或帶有雜訊時,LPIPS 仍能保持高度理智,是最貼近人類肉眼主觀感受的黃金指標。
生成影像的評估是 iPAS 生成式 AI 考點(中級科目一)。重點:FID(生成與真實影像在特徵空間的分布距離,越低越逼真)、IS(清晰可辨且多樣)、LPIPS(用深度特徵衡量感知相似,比像素級 MSE 更貼近人眼)。易混點:像素級 MSE 或 PSNR 與人眼觀感不一致、LPIPS 較準;只看單一指標、忽略多樣性(模式崩潰)會誤判。情境:評估文生圖、超解析、風格轉換品質。
想練情境題與詳解 → AI 學習與考證地圖
Learned Perceptual Image Patch Similarity,用深度網路特徵衡量兩張影像的感知相似度,比像素級(MSE、PSNR)更貼近人眼判斷。
像素級指標對位移、模糊不敏感、與人類觀感不一致(模糊圖 MSE 可能很低卻看起來差);LPIPS 用感知特徵更符合人眼。
越小代表兩圖在感知上越相似(0 為相同);常用於評估生成、超解析、風格轉換等的視覺品質。
把兩圖各自丟進預訓練網路(如 VGG 或 AlexNet)取多層特徵,比較特徵差異並加權,故稱學習式感知相似度。
它衡量與參考圖的相似、需有參考;無參考的生成品質要配合 FID 等;不同骨幹網路結果略不同。