觀察各種方法在面對 12 筆陽性、138 筆陰性資料時,會把驗證集切成什麼可怕的模樣。
| 錯誤 | 為什麼錯 | 正解 |
|---|---|---|
| 前處理用全資料 | 縮放/填補看到測試資訊→洩漏 | 放 pipeline、對每折 fit |
| 時間序列用一般 K 折 | 用未來預測過去、時間穿越 | 用時序切分(只用過去) |
| 有群組卻隨機切 | 同一人跨訓練測試→高估 | Group K-Fold |
| 不平衡沒分層 | 某折可能沒有少數類 | Stratified K-Fold |
交叉驗證若做錯會讓評估虛高,是 iPAS 高頻陷阱題(中級科目二與三)。重點:最常見的錯是資料洩漏——在切分前就對全資料做標準化、特徵選擇或重取樣,測試資訊提前外洩。易混點:前處理要放進管線、在每折內只用訓練部分擬合;時間序列不能隨機切(要前向驗證)、分組資料要 GroupKFold。情境:辨識題目中哪個 CV 做法不當。
想練情境題與詳解 → AI 學習與考證地圖
資料洩漏——在切分前就對全資料做前處理(標準化、特徵選擇、重取樣),測試折的資訊提早洩漏給模型,造成評估過度樂觀。
要在每一折只用訓練部分擬合前處理參數、再套用到驗證部分;用 Pipeline 自動確保不洩漏,手動很容易出錯。
隨機切會用未來資料預測過去、洩漏未來資訊使評估虛高;應改用時間順序的前向(滾動)驗證。
同一受試者或使用者的樣本散落在訓練與驗證兩邊會洩漏;應用 GroupKFold 讓同組只落在同一邊。
用測試集調參、不平衡資料未分層、只跑一次就下結論、在交叉驗證外才做重取樣;這些都會高估真實表現。