機器學習指標互動實驗室
拖動滑桿改變混淆矩陣數值,即時觀察指標與權衡關係
1. 設定混淆矩陣數據
調整預測結果的四種分佈情況:
2. 視覺化分佈
3. 指標結果
機器學習評估指標詳解筆記
在評估模型時,我們不能只看「猜對了幾題」,因為資料往往是不平均的。以下是四個核心指標的詳細邏輯。
1. 準確率 (Accuracy) - 整體正確率
最直觀的指標,代表「模型總共猜對了多少比例」。
如果 100 個病人只有 1 人患病。模型只要採取「全部猜健康」的策略,準確率就能高達 99%,但這個模型對於找出病人完全沒用。因此,資料不平衡時不可單獨使用此指標。
2. 精確率 (Precision) - 查準率
關注的是「預測出的結果有多少可信度」。回答:「當模型發出警報時,我有多少信心它是真的?」
核心精神: 寧可漏抓,不可誤殺 (避免 FP)。
應用場景 垃圾郵件過濾:我們希望精確率很高,寧可漏抓垃圾信,也不要誤判重要郵件。
3. 召回率 (Recall) - 查全率 / 靈敏度
關注的是「原本的目標抓出了多少」。回答:「在所有的目標當中,模型成功抓出了幾成?」
核心精神: 寧可誤殺,不可漏抓 (避免 FN)。
應用場景 癌症篩檢 / 地震預警:我們希望召回率很高,寧可誤報(虛驚一場),也不能漏掉任何一個真正的病患或災害。
4. F1 Score - 綜合指標
精確率與召回率往往是互斥的 (Trade-off)。F1 是兩者的調和平均數,用來評估模型的穩健性。
為什麼不用算術平均? 如果 Precision=100% 但 Recall=0% (完全沒抓到),算術平均還有 50 分,但調和平均 F1 會變成 0 分。F1 只有在兩者都均衡時才會高。
快速對照表
| 指標 | 數學意義 | 關注點 | 適用情境 |
|---|---|---|---|
| 準確率 | (答對總數) / (總數) | 整體表現 | 資料分佈平均時 |
| 精確率 | (抓對) / (我說是對的) | 避免誤報 (FP) | 垃圾郵件、推薦系統 |
| 召回率 | (抓對) / (原本就是對的) | 避免漏報 (FN) | 防疫、醫療、災害預警 |
| F1 Score | 調和平均 | 綜合平衡 | 資料不平均、通用評估 |