100 個病人中只有 3 個確診。我們該如何教導 AI?
但是... 3 個病患全漏抓了💀
| 層面 | 方法 | 注意 |
|---|---|---|
| 資料層 | 過取樣(SMOTE)、欠取樣 | 只在訓練集做,避免洩漏 |
| 演算法層 | 類別權重、cost-sensitive | 不動資料、調懲罰 |
| 評估層 | 用 F1、AUC、PR-AUC | 別只看準確率 |
| 門檻層 | 調整分類門檻 | 依成本移動決策點 |
類別不平衡是 iPAS 高頻考點(初級科目一、中級科目三),如詐欺 1% 對正常 99%。重點:此時準確率嚴重誤導(全猜多數類也有高分),要看召回率、F1、PR-AUC。易混點:重取樣(SMOTE 過取樣、欠取樣)只能在交叉驗證的訓練折內做,否則資料洩漏、高估表現;也可調類別權重或分類門檻。情境題常給你不平衡資料、問該用什麼指標或處理法。
想練情境題與詳解 → AI 學習與考證地圖
各類樣本數差距懸殊(如詐欺 1% 對正常 99%);模型容易偏向多數類、忽略少數類。
全猜多數類就有高準確率卻沒用;應看精確率、召回率、F1、PR-AUC,並看混淆矩陣。
重取樣(SMOTE 過取樣、欠取樣)、調類別權重、調門檻、選對指標、用集成或異常偵測法。
只在訓練資料、且在交叉驗證的每個 fold 內做;若先對全資料重取樣會造成資料洩漏、高估表現。
在意少數類抓得到看召回率;在意警報品質看精確率;要平衡看 F1;整體排序能力看 PR-AUC(不平衡時比 ROC-AUC 更敏感)。