💡一句話定義
評估指標是衡量模型好壞的尺。關鍵原則:不同任務用不同指標,而且要看清楚方向(有些越高越好、有些越低越好)。用錯指標,會讓一個爛模型看起來很棒(例如不平衡資料只看準確率)。
🗺️任務 → 指標 對照大表
先問「這是什麼任務」,再挑指標。點指標名稱可到互動詳解。
| 任務型態 | 常用指標 | 方向 | 一句話 |
|---|---|---|---|
| 分類(平衡) | Accuracy | 越高越好 | 整體猜對的比率 |
| 分類(不平衡) | F1、AUC-ROC、PR-AUC | 越高越好 | 聚焦少數類、看排序能力 |
| 分類(細看取捨) | Precision、Recall、混淆矩陣 | 越高越好 | 誤報 vs 漏報的權衡 |
| 迴歸 | MAE、MSE、RMSE、R² | 誤差越低/R²越高 | 誤差大小與解釋變異 |
| 物件偵測 | mAP、IoU | 越高越好 | 框得準不準、平均精度 |
| 影像分割 | IoU、Dice | 越高越好 | 預測與真實區域的重疊 |
| 影像生成 | FID、IS | FID 越低越好 | 生成分布與真實的距離 |
| 機器翻譯 | BLEU | 越高越好 | 與參考譯文的重疊程度 |
| 語言模型 | Perplexity | 越低越好 | 對測試語料的「困惑度」 |
| 降維品質 | Trustworthiness、Continuity、kNN | 越高越好 | 局部/全局結構保留程度 |
🎯分類指標細分(最常考)
⚠️三個常見陷阱
① 不平衡只看準確率:99% 是陰性時,全猜陰性也有 99% 準確率卻毫無用處 → 改用 F1、AUC 或看混淆矩陣。
② 搞錯方向:多數指標越高越好,但 FID、Perplexity、MAE/MSE/RMSE 是越低越好。
③ 張冠李戴:拿分類指標評迴歸、拿準確率評生成——不同任務要用對應指標。
② 搞錯方向:多數指標越高越好,但 FID、Perplexity、MAE/MSE/RMSE 是越低越好。
③ 張冠李戴:拿分類指標評迴歸、拿準確率評生成——不同任務要用對應指標。
🧭怎麼挑指標?三步驟
① 看任務型態:分類 / 迴歸 / 生成 / 偵測 / 分割 / 翻譯 / 語言模型。
② 看資料與成本:類別是否平衡?在意誤報還是漏報?錯誤代價是否不對稱?
③ 對照上表挑指標:必要時多指標並看,別只信單一數字。想邊玩邊練,試試 指標配對挑戰。
② 看資料與成本:類別是否平衡?在意誤報還是漏報?錯誤代價是否不對稱?
③ 對照上表挑指標:必要時多指標並看,別只信單一數字。想邊玩邊練,試試 指標配對挑戰。
✅自我檢測
Q1. 為什麼不平衡資料不能只看準確率?
若多數類佔比極高,全猜多數類就有很高準確率卻毫無用處;應改用 F1、AUC-ROC 或直接看混淆矩陣。
Q2. 迴歸任務用什麼指標?
MAE、MSE、RMSE(誤差大小,越低越好)與 R²(解釋變異比例,越高越好);RMSE 對大誤差較敏感。
Q3. 影像生成、機器翻譯、語言模型各用什麼?
影像生成用 FID(越低越好);機器翻譯用 BLEU;語言模型用 Perplexity(越低越好)。
Q4. 哪些指標是「越低越好」?
FID、Perplexity、MAE/MSE/RMSE 等誤差或距離型指標越低越好;其餘如 Accuracy、F1、AUC、IoU、BLEU 越高越好。
🎯重點整理
- 原則:不同任務用不同指標,先判斷任務型態。
- 分類:平衡看 Accuracy、不平衡看 F1/AUC。
- 迴歸:MAE/MSE/RMSE/R²。
- 生成/NLP/CV:FID、BLEU、Perplexity、mAP、IoU。
- 注意方向:誤差與 FID/Perplexity 越低越好。