看少數類如何「長出」新的合成樣本來平衡資料
想像班上有 95 個健康學生和 5 個生病學生,你要訓練 AI 辨識誰生病:
從少數類中隨機挑一個點
在少數類中找最近的 K 個點
從 K 個鄰居中隨機挑一個
兩點連線上隨機位置 = 新樣本
| 方法 | 做法 | 特點 |
|---|---|---|
| 隨機過取樣 | 複製少數類 | 簡單;易過擬合 |
| SMOTE | 在少數類鄰居間內插合成新樣本 | 增多樣性、較不過擬合 |
| 隨機欠取樣 | 刪多數類 | 平衡但損失資料 |
| 類別權重 | 不動資料、調懲罰 | 免造樣本 |
SMOTE 是處理類別不平衡的過取樣法,iPAS 中級科目三常考。重點:在少數類樣本之間內插合成新樣本(而非單純複製),增加多樣性、較不易過擬合少數類。易混點:只能對訓練集做(避免洩漏到測試集)、可能在類別邊界製造雜訊;變體 Borderline-SMOTE、ADASYN 可改善。對照:過取樣保留資訊適合資料少、欠取樣加快訓練適合資料多。
想練情境題與詳解 → AI 學習與考證地圖
處理類別不平衡的過取樣法;在少數類樣本之間內插合成新樣本(而非單純複製),增加多樣性、較不易過擬合。
複製會讓模型過度記住同樣的點;SMOTE 合成新的中間樣本,增加多樣性、較不易過擬合少數類。
只在訓練集做(避免資料洩漏到測試集)、可能在類別邊界製造雜訊;變體如 Borderline-SMOTE、ADASYN 可改善。
資料少用過取樣(SMOTE)保留資訊;資料多可欠取樣多數類加快訓練;也可兩者並用。
調整類別權重、改用對不平衡友善的指標(F1、PR-AUC)、調分類門檻、異常偵測視角等。