機器學習指標互動實驗室

拖動滑桿改變混淆矩陣數值,即時觀察指標與權衡關係

1. 設定混淆矩陣數據

調整預測結果的四種分佈情況:

TP (真陽性 - 抓對了) 50
實際是 Yes,AI 預測 Yes
TN (真陰性 - 排對了) 50
實際是 No,AI 預測 No
FP (假陽性 - 誤報) 10
實際是 No,AI 預測 Yes (把狗認成貓)
FN (假陰性 - 漏報) 10
實際是 Yes,AI 預測 No (沒抓到貓)

2. 視覺化分佈

3. 指標結果

準確率 Accuracy
0%
整體猜對的比率
精確率 Precision
0%
避免誤報 (重質)
召回率 Recall
0%
避免漏報 (重量)
F1 Score
0%
綜合平衡指標

機器學習評估指標詳解筆記

在評估模型時,我們不能只看「猜對了幾題」,因為資料往往是不平均的。以下是四個核心指標的詳細邏輯。

1. 準確率 (Accuracy) - 整體正確率

最直觀的指標,代表「模型總共猜對了多少比例」。

Accuracy =
TP + TN (答對總數) TP + TN + FP + FN (總樣本數)
⚠️ 致命缺陷 (Accuracy Paradox):

如果 100 個病人只有 1 人患病。模型只要採取「全部猜健康」的策略,準確率就能高達 99%,但這個模型對於找出病人完全沒用。因此,資料不平衡時不可單獨使用此指標。

2. 精確率 (Precision) - 查準率

關注的是「預測出的結果有多少可信度」。回答:「當模型發出警報時,我有多少信心它是真的?」

Precision =
TP (真正確) TP + FP (模型說是的)

核心精神: 寧可漏抓,不可誤殺 (避免 FP)

應用場景 垃圾郵件過濾:我們希望精確率很高,寧可漏抓垃圾信,也不要誤判重要郵件。

3. 召回率 (Recall) - 查全率 / 靈敏度

關注的是「原本的目標抓出了多少」。回答:「在所有的目標當中,模型成功抓出了幾成?」

Recall =
TP (真正確) TP + FN (原本就是的)

核心精神: 寧可誤殺,不可漏抓 (避免 FN)

應用場景 癌症篩檢 / 地震預警:我們希望召回率很高,寧可誤報(虛驚一場),也不能漏掉任何一個真正的病患或災害。

4. F1 Score - 綜合指標

精確率與召回率往往是互斥的 (Trade-off)。F1 是兩者的調和平均數,用來評估模型的穩健性。

F1 = 2 ×
Precision × Recall Precision + Recall

為什麼不用算術平均? 如果 Precision=100% 但 Recall=0% (完全沒抓到),算術平均還有 50 分,但調和平均 F1 會變成 0 分。F1 只有在兩者都均衡時才會高。

快速對照表

指標 數學意義 關注點 適用情境
準確率 (答對總數) / (總數) 整體表現 資料分佈平均時
精確率 (抓對) / (我說是對的) 避免誤報 (FP) 垃圾郵件、推薦系統
召回率 (抓對) / (原本就是對的) 避免漏報 (FN) 防疫、醫療、災害預警
F1 Score 調和平均 綜合平衡 資料不平均、通用評估

📝 iPAS 考點提醒

F1 是精確率與召回率的調和平均,iPAS 分類評估高頻考點(初級科目一、中級科目三)。重點:只有兩者都高 F1 才高,在類別不平衡時比準確率可靠。易混點:調和平均對小值敏感(一邊低就被拉下);macro-F1 各類等權(重視少數類)、micro-F1 受多數類主導;F1 在精確率與召回率間取平衡。情境:不平衡分類選 F1;在意漏報看召回、在意誤報看精確。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

F1 分數是什麼?

Precision(精確率)與 Recall(召回率)的調和平均:F1 = 2·P·R/(P+R)。兩者都高時 F1 才高,常用於類別不平衡的單一綜合指標。

為什麼用調和平均而不是算術平均?

調和平均會被較小值拉低;只要 Precision 或 Recall 有一個很差,F1 就明顯下降,避免「一高一低」被算術平均美化。

什麼時候該用 F1 而不是 Accuracy?

類別不平衡時。若 99% 是陰性,全猜陰性 Accuracy 也有 99% 卻毫無用處;F1 聚焦少數的陽性類,更能反映真實表現。

F1 的限制是什麼?

它預設 Precision 與 Recall 同等重要;若實際更在意其中之一,可用 Fβ(β 大於 1 偏重 Recall、小於 1 偏重 Precision)。F1 也不直接反映 TN。

Macro、Micro、Weighted F1 差在哪?

多分類時,Macro 各類 F1 平均(每類等權、小類也重要);Micro 先彙總所有 TP/FP/FN 再算(受大類主導);Weighted 依各類樣本數加權。

🧭 相關主題

← 返回 AI 學習與考證地圖