| 方法 | 做法 | 適合 |
|---|---|---|
| K-Fold | 切 K 份輪流當驗證 | 通用預設(常 5/10) |
| Stratified K-Fold | 各折保持類別比例 | 分類、不平衡 |
| Group K-Fold | 同群組不跨折 | 有群組/重複(同一人) |
| Time Series Split | 只用過去預測未來 | 時間序列 |
| LOOCV | 留一筆當驗證 | 資料極少 |
交叉驗證能更穩健地評估模型泛化,iPAS 高頻考點(中級科目三)。重點:K 折把資料輪流切成訓練與驗證、平均 K 次結果,比單次切分更可靠、也更充分利用資料。易混點:前處理(標準化、重取樣)要在每折內只用訓練部分做、否則資料洩漏;時間序列不能隨機切(要前向驗證)、不平衡要分層。情境:資料量有限時的穩健評估。
想練情境題與詳解 → AI 學習與考證地圖
單次切訓練/測試集,結果受切法運氣影響大。交叉驗證多次輪流切分、平均結果,能更穩健、低變異地估計模型的泛化能力。
把資料分成 K 份,每次用其中 1 份當驗證、其餘 K 減 1 份訓練,輪流 K 次,最後平均 K 次分數,常用 K 等於 5 或 10。
資料洩漏——把標準化、特徵選擇等前處理在切分前對全資料做,會讓驗證集資訊滲入訓練。正確做法是把前處理放進每一折內。
不平衡用分層 K 折(Stratified)保持各折類別比例;同一來源或病人不可跨折,用 Group K-Fold;時間序列要用時序切分、不可用未來資料。
留一法,K 等於樣本數(每次只留 1 筆驗證);幾乎用盡資料、偏差小但變異大且很耗運算,適合小資料集。