🎯 混淆矩陣 · iPAS 最高頻考點
混淆矩陣:所有分類指標的源頭,別只看「準確率」
分類模型好不好,不能只看整體猜對幾成。混淆矩陣把結果拆成 TP/FP/FN/TN 四格——準確率、精確率、召回率、F1 通通從這四格算出來。看懂它,才知道模型是真的強,還是只是在不平衡資料上蒙混。
TP·FP·FN·TN準確率精確率 Precision召回率 RecallF1
🔲 一、混淆矩陣:預測 vs 真實的 2×2 表
把「模型猜的」和「實際的」交叉,就得到四格。所有指標都從這四格衍生。
TP 真陽性猜「有」、實際「有」→ 抓對了 ✅
FP 偽陽性(誤判)猜「有」、實際「無」→ 冤枉好人
FN 偽陰性(漏抓)猜「無」、實際「有」→ 放走壞人
TN 真陰性猜「無」、實際「無」→ 正確放行 ✅
⚠️ 兩種錯誤的代價不一樣
高 FP(誤判多):浪費資源——把沒病的人判為有病,造成恐慌與複診成本。
高 FN(漏抓多):致命錯誤——把有病的人判為沒病,錯過黃金治療期。哪種錯更不能接受,決定你要重視哪個指標。
📊 二、準確率 Accuracy:整體猜對的比例
Accuracy = (TP + TN) / 總數 比喻:考試分數,衡量整體猜對幾成。
🪤 最大陷阱:資料不平衡
若資料極度不平衡(如 99% 良品、1% 瑕疵),模型只要盲猜「全是良品」就能拿 99 分,但它其實完全抓不出瑕疵!所以準確率高 ≠ 模型好——不平衡時一定要搭配精確率、召回率、F1 一起看。
🎯 三、精確率 Precision:說有就要準
Precision = TP / (TP + FP) 比喻:狙擊手——沒把握就不開槍,重點是減少誤判(FP)。
白話
「在所有被模型判為『有』的當中,真的『有』的比例」。精確率高=很少冤枉好人。【陷阱】若逼近 100%,可能是模型太保守、只打最有把握的目標,代價是漏掉一堆(召回率崩)。
低精確率的災難:垃圾信過濾器把一堆正常重要郵件也擋掉了。
🚨 四、召回率 Recall(靈敏度):寧可錯抓,不可放過
Recall = TP / (TP + FN) 比喻:警察抓壞人——寧可抓錯良民,也不放過壞人,重點是減少漏抓(FN)。
白話
「在所有實際『有』的當中,被模型抓到的比例」。召回率高=很少漏網之魚。【陷阱】為衝 100% 召回而無腦大範圍撒網,會讓誤判暴增(精確率崩)、天天假警報。
低召回率的災難:醫療篩檢或機場安檢漏掉真陽性,後果不堪設想。
⚖️ 五、精確率 vs 召回率:此消彼長,用 F1 兼顧
精確率和召回率通常難以兩全:想抓得更全(召回↑),就容易誤判(精確↓),反之亦然。這時用 F1 當單一分數。
F1 = 精確率與召回率的「調和平均」
F1 = 2 × (P × R) / (P + R)
調和平均的特性:只要有一個很低,F1 就會很低——逼你兩個都要顧。在不平衡資料上,F1 通常比準確率可靠得多。
| 指標 | 公式 | 重點在減少 | 比喻 |
| Precision 精確率 | TP/(TP+FP) | 誤判 FP | 狙擊手 |
| Recall 召回率 | TP/(TP+FN) | 漏抓 FN | 警察撒網 |
| F1 | 2PR/(P+R) | 兩者兼顧 | 平衡木 |
🧭 六、情境決定你該看哪個指標
醫療篩檢 / 安檢 → 重召回率漏抓一個病患/危險品代價極高,寧可誤判也不能放過。
垃圾信 / 推薦 → 重精確率誤擋一封重要信、亂推一個爛內容很惱人,要「說有就準」。
不平衡資料 → 別看準確率看 F1、精確率、召回率、甚至 AUC-ROC。
兩者都重要 → 看 F1需要單一分數比較模型時。
🧪 七、觀念自我檢測
先想再點開。
Q1. 混淆矩陣的四格是什麼?
TP(猜有實有)、FP(猜有實無/誤判)、FN(猜無實有/漏抓)、TN(猜無實無)。
Q2. 精確率和召回率怎麼分?
精確率=說有就要準(減 FP);召回率=有的都要抓到(減 FN)。
Q3. 為什麼不平衡資料不能只看準確率?
盲猜多數類就能拿高準確率,卻毫無鑑別力;要看 F1/精確率/召回率。
Q4. F1 是什麼、什麼時候用?
精確率與召回率的調和平均;想用單一分數兼顧兩者、尤其不平衡時。
Q5. 醫療篩檢最該重視哪個指標?
召回率——盡量不漏掉病患(降 FN),即使誤判增加。
✅ 八、30 秒重點整理
混淆矩陣TP/FP/FN/TN 四格,所有指標的根。
準確率有陷阱不平衡時會騙人。
精確率說有就準,減 FP(誤判)。
召回率有的都抓,減 FN(漏抓)。
F1調和平均,兼顧兩者。
看情境選指標醫療重 recall、垃圾信重 precision。
📝 iPAS 考點提醒
混淆矩陣是分類評估的根本,iPAS 最高頻考點(初級科目一、中級科目三)。重點:TP、FP、FN、TN 四格衍生出準確率、精確率、召回率、F1、特異度等所有指標。易混點:精確率(預測為正中真正為正)與召回率(真正為正中被抓到)常被搞反;不平衡時別只看準確率。情境:幾乎所有分類情境題都從這四格出發,務必熟記各指標的定義與適用時機。
想練情境題與詳解 → AI 學習與考證地圖
❓ 常見問題
混淆矩陣是什麼?
預測 vs 真實情況的 2×2 表,分成 TP(真陽性)、FP(偽陽性/誤判)、FN(偽陰性/漏抓)、TN(真陰性)四格;是所有分類指標的基礎。
精確率和召回率差在哪?
精確率=預測為正之中真正為正的比例(重減少誤判 FP);召回率=真正為正之中被抓到的比例(重減少漏抓 FN),兩者常被搞反。
為什麼不能只看準確率?
資料不平衡時,盲猜多數類就能拿高準確率卻毫無鑑別力;應搭配精確率、召回率、F1 一起評估。
F1 是什麼?
精確率與召回率的調和平均:F1=2PR/(P+R);只要有一個很低 F1 就低,適合在不平衡資料上兼顧兩者。
醫療篩檢該重視哪個指標?
通常重視召回率(recall),盡量不漏掉病患(降低 FN),即使會增加一些誤判。