模型評估 · 總覽地圖

AI 評估指標總覽

「這個模型好不好」不能只用一把尺量。分類、迴歸、生成、偵測各有各的指標——這頁用一張對照表,幫你一眼挑對指標,並連到每個指標的互動詳解。

任務→指標對照越高 vs 越低越好不平衡陷阱分類・迴歸・生成連到各指標詳解

💡一句話定義

評估指標是衡量模型好壞的。關鍵原則:不同任務用不同指標,而且要看清楚方向(有些越高越好、有些越低越好)。用錯指標,會讓一個爛模型看起來很棒(例如不平衡資料只看準確率)。

🗺️任務 → 指標 對照大表

先問「這是什麼任務」,再挑指標。點指標名稱可到互動詳解。

任務型態常用指標方向一句話
分類(平衡)Accuracy越高越好整體猜對的比率
分類(不平衡)F1AUC-ROC、PR-AUC越高越好聚焦少數類、看排序能力
分類(細看取捨)Precision、Recall混淆矩陣越高越好誤報 vs 漏報的權衡
迴歸MAE、MSE、RMSE、R²誤差越低/R²越高誤差大小與解釋變異
物件偵測mAP、IoU越高越好框得準不準、平均精度
影像分割IoU、Dice越高越好預測與真實區域的重疊
影像生成FID、ISFID 越低越好生成分布與真實的距離
機器翻譯BLEU越高越好與參考譯文的重疊程度
語言模型Perplexity越低越好對測試語料的「困惑度」
降維品質Trustworthiness、Continuity、kNN越高越好局部/全局結構保留程度

🎯分類指標細分(最常考)

🎯Accuracy 準確率整體猜對比率;只在類別平衡時可靠,不平衡會騙人。
🔍Precision 精確率說是的裡有多少真是;重「不誤報」(垃圾郵件)。
📦Recall 召回率真的裡抓到多少;重「不漏報」(癌症篩檢)。
🧬F1 分數精確率與召回率的調和平均;不平衡時的綜合指標。
📈ROC-AUC掃過所有門檻的排序能力;0.5 亂猜、1 完美。
🗺️混淆矩陣TP/FP/FN/TN 四格,所有分類指標的源頭。

⚠️三個常見陷阱

① 不平衡只看準確率:99% 是陰性時,全猜陰性也有 99% 準確率卻毫無用處 → 改用 F1、AUC 或看混淆矩陣。
② 搞錯方向:多數指標越高越好,但 FID、Perplexity、MAE/MSE/RMSE 是越低越好
③ 張冠李戴:拿分類指標評迴歸、拿準確率評生成——不同任務要用對應指標。

🧭怎麼挑指標?三步驟

① 看任務型態:分類 / 迴歸 / 生成 / 偵測 / 分割 / 翻譯 / 語言模型。
② 看資料與成本:類別是否平衡?在意誤報還是漏報?錯誤代價是否不對稱?
③ 對照上表挑指標:必要時多指標並看,別只信單一數字。想邊玩邊練,試試 指標配對挑戰

自我檢測

Q1. 為什麼不平衡資料不能只看準確率?
若多數類佔比極高,全猜多數類就有很高準確率卻毫無用處;應改用 F1、AUC-ROC 或直接看混淆矩陣。
Q2. 迴歸任務用什麼指標?
MAE、MSE、RMSE(誤差大小,越低越好)與 R²(解釋變異比例,越高越好);RMSE 對大誤差較敏感。
Q3. 影像生成、機器翻譯、語言模型各用什麼?
影像生成用 FID(越低越好);機器翻譯用 BLEU;語言模型用 Perplexity(越低越好)。
Q4. 哪些指標是「越低越好」?
FID、Perplexity、MAE/MSE/RMSE 等誤差或距離型指標越低越好;其餘如 Accuracy、F1、AUC、IoU、BLEU 越高越好。

🎯重點整理

📝 iPAS 考點提醒

「替任務挑對評估指標」是 iPAS 高頻應用題(初級科目一、中級科目三)。重點:分類看 Accuracy/Precision/Recall/F1/AUC-ROC、迴歸看 MAE/MSE/RMSE/R²、物件偵測用 mAP 與 IoU、影像分割用 IoU/Dice、影像生成用 FID、機器翻譯用 BLEU、語言模型用 Perplexity。易混點:類別不平衡別只看準確率(改用 F1 或 AUC);FID、Perplexity、誤差型指標是越低越好、別搞錯方向。情境:看模型與任務,選最合適的指標。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

不同任務怎麼挑評估指標?

先判斷任務型態:分類看 Accuracy/Precision/Recall/F1/AUC-ROC、迴歸看 MAE/MSE/RMSE/R²、偵測用 mAP/IoU、分割用 IoU/Dice、生成用 FID、翻譯用 BLEU、語言模型用 Perplexity。

為什麼不平衡資料不能只看準確率?

若多數類佔比極高,全猜多數類就有很高準確率卻毫無用處;應改用 F1、AUC-ROC 或直接看混淆矩陣。

哪些指標是越低越好?

FID、Perplexity、MAE/MSE/RMSE 等誤差或距離型指標越低越好;Accuracy、F1、AUC、IoU、BLEU 則越高越好。

Precision 和 Recall 怎麼取捨?

通常此消彼長:怕誤報(垃圾郵件)重 Precision、怕漏報(癌症篩檢)重 Recall;要平衡就看 F1。

迴歸指標 MAE、MSE、RMSE、R² 差在哪?

MAE 是平均絕對誤差(較穩健);MSE/RMSE 對大誤差更敏感;R² 是解釋變異比例(越接近 1 越好)。

🧭 相關主題

← 返回 AI 學習與考證地圖