用直覺的垃圾郵件預測現場與動態算式,徹底搞懂 Accuracy、Precision、Recall 與 F1-Score 的核心分工!
真實情境:我們用 BERT 來做「垃圾郵件分類」。資料庫有 100 封郵件,其中只有 8 封是真正的垃圾郵件(陽性),其餘 92 封是正常郵件(陰性)。請切換下方按鈕,看看未完全訓練與完全訓練模型的表現差異!
在理解任務中,**Precision(不瞎猜錯怪好人)**與**Recall(不漏抓任何壞人)**往往在坐翹翹板。F1-Score 則是兩者的調和平均數。拉動滑桿配置兩者數值,觀察純 SVG 公式如何完美即時聯動:
如果一個 BERT 模型為了追求極致的 Precision (100%),它只敢在 100% 確定時才出手,結果 8 封垃圾郵件裡它只抓了 1 封,漏掉了其餘 7 封(Recall 只有 12.5%)。
此時,傳統算術平均為 (100% + 12.5%) ÷ 2 = 56.2%(看起來依然及格)。
但 F1-Score(調和平均)會給予強烈的偏科懲罰,計算出誠實的 22.2%!它能逼迫工程師在微調 BERT 時,必須全面顧及全面性。
定義:全體郵件中,AI 猜對(無論是抓到垃圾還是確認安全)的總比例。
在文本分類任務中,若遇到不均衡資料(如本案例垃圾郵件僅佔 8%),一律盲目猜正常就能無腦拿到 92% 的高分。因此準確率在此類任務中存在巨大的欺騙性。
定義:在 AI 標記為「垃圾郵件」的清發中,有多少比例真的是垃圾郵件。
注重這個指標代表「絕對不能錯怪好人」。如果精準率低,代表正常的重要商務郵件會不斷被誤送進垃圾桶,這對用戶來說是災難性的體驗。
定義:資料庫中所有真正危險的垃圾郵件,AI 成功撈出了多少比例。
注重這個指標代表「寧可錯殺一百,絕不放過一個」。如果召回率低,代表用戶的收件匣依然會被大量漏網之魚的廣告垃圾郵件塞爆。
BERT 等理解型模型的評估是 iPAS 中級科目一考點。重點:看下游任務指標——分類用準確率與 F1、命名實體用實體層級 F1、問答用 EM(完全匹配)與 F1,常以 GLUE、SuperGLUE 基準報告。易混點:許多 NLU 任務類別不平衡,F1 比準確率可靠;EM 嚴格、F1 較寬鬆,常並列。情境:評估理解類 NLP 模型、判斷該用哪個指標。
想練情境題與詳解 → AI 學習與考證地圖
看下游任務指標:分類用準確率與 F1、命名實體用實體層級 F1、問答用 EM(完全匹配)與 F1、語意相似用相關係數,依任務選擇。
一組標準化的自然語言理解基準(多任務),用來公平比較不同模型的理解能力;BERT 等常以此報告成績。
許多 NLU 任務類別不平衡(如實體稀疏),F1 兼顧精確率與召回率,比 Accuracy 更能反映真實表現。
EM(Exact Match)看答案是否與標準答案完全一致;F1 看預測與標準答案在詞層級的重疊、較寬鬆,兩者通常並列報告。
用獨立測試集、避免資料洩漏、注意領域差異(預訓練語料與目標領域不同會掉分),以及指標是否對齊真實需求。