透過極端資料集對決與動態算式,一秒搞懂準確率(Accuracy)與 F1-Score 的終極差異!
情境設定:我們有一張 100 人的醫療切片影像資料庫,其中只有 5 人真正患病(陽性),其餘 95 人都健康(陰性)。這是一個極端不均衡的資料集。請點擊下方按鈕,看看兩種 AI 模型的表現:
F1-Score 其實是 **精準率 (Precision)** 與 **召回率 (Recall)** 的調和平均數。拉動滑桿來調配兩者的權重,觀察純 SVG 公式如何聯動計算:
如果一個模型精準率高達 100%(它只猜最穩的一個人),但召回率只有 1%(漏抓了其餘所有人)。
若用傳統算術平均:(100% + 1%) ÷ 2 = 50.5%(看起來依然及格)。
但用 F1-Score (調和平均) 計算,會得出極其慘烈的 1.98%!
結論:F1-Score 對於「極端低分」具有強烈的懲罰機制,唯有 Precision 與 Recall 雙強,F1 才能拿到高分。
只有在類別比例非常平衡(例如 50 張貓、50 張狗)的影像分類任務中,準確率才具有指標性意義。此時它最符合大腦直覺。
適用於所有稀有事件偵測(如:工廠瑕疵晶片檢測、罕見疾病篩檢、信用卡盜刷影像辨識)。在這些場景中,答對大宗的陰性毫無意義,抓住陽性才是核心。
F1 是精確率與召回率的調和平均,初級科目一與中級科目三都常考分類評估。重點:只有精確率與召回率都高 F1 才高,在類別不平衡時比準確率可靠。易混點:macro-F1 各類等權(重視少數類)、micro-F1 受多數類主導;調和平均只要一邊低就被拉下。情境題常要你在精確率(怕誤報)與召回率(怕漏報)之間取捨並選對指標。
想練情境題與詳解 → AI 學習與考證地圖
精確率與召回率的調和平均,兩者都高 F1 才高;類別不平衡時常用 F1 取代會騙人的準確率。
調和平均對較小值更敏感;只要精確率或召回率有一個很低,F1 就會被拉低,逼模型兩者兼顧。
類別平衡、各錯誤代價相近用 Accuracy;類別不平衡或更在意少數類(如詐欺、疾病)用 F1。
通常此消彼長:提高門檻精確率升、召回率降。依場景取捨(怕誤報重精確、怕漏報重召回),或用 F1 找平衡。
macro 各類 F1 取平均(每類等權、重視少數類);micro 匯總所有樣本再算(受多數類主導),多分類時依需求選用。