Diffusion 擴散模型指標新手村 (排版修正版)

進入跨模態幾何空間,秒懂 AI 圖像品質(FID)與圖文不合判定(CLIP Score)的科學標準!

文字提示詞與生成圖像的契合度判定

核心白話:文生圖模型(Diffusion)最怕「答非所問」。CLIP 模型將文字提示詞生成圖片分別轉換成特徵向量。如果兩者的**夾角越小、餘弦相似度越高**,代表圖文越一致!

提示詞 (Prompt):『 一隻穿西裝的紳士貓咪 』
👇 請切換測試不同的 Diffusion 模型生成結果:

🌌 CLIP 跨模態潛在空間向量夾角 (Cosine Similarity)

文字提示詞向量 (Text)

📊 跨模態即時判定數據

🎯 CLIP Score (圖文一致性) — 越高越好 0.00
🖼️ FID (圖像品質誤差) — 越低越精緻 0.00

宏觀統計:FID 圖像品質與 IS 多樣性

評估擴散模型時,我們不能只抽樣一張好看的圖,必須生成一萬張圖進行集團統計。以下圖表展示了歷代文生圖模型在**圖像品質(FID)**上的進步趨勢:

📈 歷代 Diffusion 模型 FID 走勢(越低越逼真)

30.0 (差) 8.0 (強) 早期概念款 (28.0) SD v1.5 (14.0) 現代頂尖模型 (8.2)

💡 擴散模型兩大客觀評估標準

  • FID (Fréchet Inception Distance):圖像品質
    將一萬張 AI 生成的圖片與一萬張真實世界的照片同時餵進特徵網路,計算兩個集團分佈的「幾何距離」。FID 越低,代表生成圖片的逼真度越好
  • IS (Inception Score):生成多樣性
    專注於看模型「有沒有創意思維」。一個優秀的 Diffusion 模型必須能同時畫出豐富多樣的類別,IS 分數才會高。

🔷 FID (圖像品質)

評估模型生成畫面的精緻度與逼真度。目前全世界公認最權威的硬核指標,數值越低越完美。

🔶 CLIP Score (圖文一致性)

評估模型有沒有「聽懂人話」、畫出正確的提示詞語義。利用跨模態網路在同一個大腦維度裡進行餘弦夾角比對,是文生圖模型的黃金標準。

🔮 IS (Inception Score 多樣性)

防範模型產生「模式崩塌」或單一輸出。越高代表模型生成的物體既清晰明確,種類又豐富多樣。

📝 iPAS 考點提醒

擴散模型(Diffusion)是當前主流影像生成技術,iPAS 生成式 AI 考點(中級科目一)。重點:加噪再學去噪、逐步從雜訊生成,品質高、訓練比 GAN 穩,是 Stable Diffusion、Midjourney 的底層。易混點:評估生成影像看 FID(與真實分布距離,越低越好)與 IS,別用準確率;Diffusion 取樣步驟多、較慢。情境:文字生圖、影像編輯;與 GAN、VAE 並列三大生成法。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

生成影像怎麼評估品質?

看逼真度與多樣性兩面向;常用 FID、Inception Score(IS)等自動指標,搭配人工觀感判斷。

FID 是什麼?

Fréchet Inception Distance,比較生成影像與真實影像在特徵空間的分布距離;越低代表越逼真且分布越接近真實,是最常用指標。

Inception Score(IS)衡量什麼?

同時看單張清晰可辨(分類有信心)與整體多樣(類別分布均勻);但有局限(不比對真實分布、易被鑽),常與 FID 並用。

為什麼自動指標不夠?

FID 與 IS 抓不到語意正確(如文字生圖是否符合提示)與細節合理性;需人工評估或用 CLIP 分數看圖文對齊。

評估生成模型常見陷阱?

只看單一指標、忽略多樣性(模式崩潰會讓 FID 看似不錯但內容單調)、樣本數不足、與真實分布不可比。

🧭 相關主題

← 返回 AI 學習與考證地圖