分類任務指標新手村

透過極端資料集對決與動態算式,一秒搞懂準確率(Accuracy)與 F1-Score 的終極差異!

為什麼「準確率」有時候會騙人?

情境設定:我們有一張 100 人的醫療切片影像資料庫,其中只有 5 人真正患病(陽性),其餘 95 人都健康(陰性)。這是一個極端不均衡的資料集。請點擊下方按鈕,看看兩種 AI 模型的表現:

👇 請選擇要評估的 AI 模型:

🗺️ 該模型的混淆矩陣 (Confusion Matrix)

📊 指標數據即時對決

🎯 Accuracy (準確率) - 分類正確率
公式:(TP + TN) / 總人數
0.0%
🧬 F1-Score - 綜合平衡指標
公式:2 × (Precision × Recall) / (Precision + Recall)
0.0%

解構 F1-Score 的兩大支柱:精準率與召回率

F1-Score 其實是 **精準率 (Precision)** 與 **召回率 (Recall)** 的調和平均數。拉動滑桿來調配兩者的權重,觀察純 SVG 公式如何聯動計算:

AI 猜是陽性的人當中,有多少是真的陽性(不瞎猜)
全部真的陽性患者中,AI 成功抓到了多少(不漏抓)

📐 F1-Score 調和平均向量公式

F1 = 2 × 0.80 × 0.50 0.80 + 0.50 = 0.615

💡 為什麼不能用傳統算術平均?

如果一個模型精準率高達 100%(它只猜最穩的一個人),但召回率只有 1%(漏抓了其餘所有人)。

若用傳統算術平均:(100% + 1%) ÷ 2 = 50.5%(看起來依然及格)。
但用 F1-Score (調和平均) 計算,會得出極其慘烈的 1.98%

結論:F1-Score 對於「極端低分」具有強烈的懲罰機制,唯有 Precision 與 Recall 雙強,F1 才能拿到高分。

🔷 準確率 (Accuracy) 的黃金戰場

只有在類別比例非常平衡(例如 50 張貓、50 張狗)的影像分類任務中,準確率才具有指標性意義。此時它最符合大腦直覺。

🔮 F1-Score 的不可替代性

適用於所有稀有事件偵測(如:工廠瑕疵晶片檢測、罕見疾病篩檢、信用卡盜刷影像辨識)。在這些場景中,答對大宗的陰性毫無意義,抓住陽性才是核心。

📝 iPAS 考點提醒

F1 是精確率與召回率的調和平均,初級科目一與中級科目三都常考分類評估。重點:只有精確率與召回率都高 F1 才高,在類別不平衡時比準確率可靠。易混點:macro-F1 各類等權(重視少數類)、micro-F1 受多數類主導;調和平均只要一邊低就被拉下。情境題常要你在精確率(怕誤報)與召回率(怕漏報)之間取捨並選對指標。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

F1 分數是什麼?

精確率與召回率的調和平均,兩者都高 F1 才高;類別不平衡時常用 F1 取代會騙人的準確率。

為什麼用調和平均而非算術平均?

調和平均對較小值更敏感;只要精確率或召回率有一個很低,F1 就會被拉低,逼模型兩者兼顧。

Accuracy 和 F1 怎麼選?

類別平衡、各錯誤代價相近用 Accuracy;類別不平衡或更在意少數類(如詐欺、疾病)用 F1。

精確率和召回率怎麼權衡?

通常此消彼長:提高門檻精確率升、召回率降。依場景取捨(怕誤報重精確、怕漏報重召回),或用 F1 找平衡。

什麼是 macro 與 micro F1?

macro 各類 F1 取平均(每類等權、重視少數類);micro 匯總所有樣本再算(受多數類主導),多分類時依需求選用。

🧭 相關主題

← 返回 AI 學習與考證地圖