進入跨模態幾何空間,秒懂 AI 圖像品質(FID)與圖文不合判定(CLIP Score)的科學標準!
核心白話:文生圖模型(Diffusion)最怕「答非所問」。CLIP 模型將文字提示詞與生成圖片分別轉換成特徵向量。如果兩者的**夾角越小、餘弦相似度越高**,代表圖文越一致!
評估擴散模型時,我們不能只抽樣一張好看的圖,必須生成一萬張圖進行集團統計。以下圖表展示了歷代文生圖模型在**圖像品質(FID)**上的進步趨勢:
評估模型生成畫面的精緻度與逼真度。目前全世界公認最權威的硬核指標,數值越低越完美。
評估模型有沒有「聽懂人話」、畫出正確的提示詞語義。利用跨模態網路在同一個大腦維度裡進行餘弦夾角比對,是文生圖模型的黃金標準。
防範模型產生「模式崩塌」或單一輸出。越高代表模型生成的物體既清晰明確,種類又豐富多樣。
擴散模型(Diffusion)是當前主流影像生成技術,iPAS 生成式 AI 考點(中級科目一)。重點:加噪再學去噪、逐步從雜訊生成,品質高、訓練比 GAN 穩,是 Stable Diffusion、Midjourney 的底層。易混點:評估生成影像看 FID(與真實分布距離,越低越好)與 IS,別用準確率;Diffusion 取樣步驟多、較慢。情境:文字生圖、影像編輯;與 GAN、VAE 並列三大生成法。
想練情境題與詳解 → AI 學習與考證地圖
看逼真度與多樣性兩面向;常用 FID、Inception Score(IS)等自動指標,搭配人工觀感判斷。
Fréchet Inception Distance,比較生成影像與真實影像在特徵空間的分布距離;越低代表越逼真且分布越接近真實,是最常用指標。
同時看單張清晰可辨(分類有信心)與整體多樣(類別分布均勻);但有局限(不比對真實分布、易被鑽),常與 FID 並用。
FID 與 IS 抓不到語意正確(如文字生圖是否符合提示)與細節合理性;需人工評估或用 CLIP 分數看圖文對齊。
只看單一指標、忽略多樣性(模式崩潰會讓 FID 看似不錯但內容單調)、樣本數不足、與真實分布不可比。