交叉驗證三部曲
玩三種方法,體驗它們的差異
K-Fold 標準版
Stratified 分層版
LOO 留一法
K-FOLD
5 折 · 20筆/折
均等切割,隨機分配
STRATIFIED
5 折 · 保比例
每折類別比例相同
LOO
100 折 · 1筆/折
每次留一筆,最細緻
📊 交叉驗證方法
方法做法適合
K-Fold切 K 份輪流當驗證通用預設(常 5/10)
Stratified K-Fold各折保持類別比例分類、不平衡
Group K-Fold同群組不跨折有群組/重複(同一人)
Time Series Split只用過去預測未來時間序列
LOOCV留一筆當驗證資料極少
✅ 自我檢測
交叉驗證解決什麼問題?
只切一次訓練/測試易受運氣影響;CV 多次切分平均,估計更穩、更充分利用資料。
最常見的錯誤是什麼?
前處理(縮放/填補/選特徵)用到全資料→洩漏;要放進 pipeline 對每折分別 fit。
資料不平衡或有群組怎麼辦?
不平衡用分層(Stratified);有群組/重複用 Group K-Fold;時間序列用時序切分。
🎯 重點整理
  1. CV 多次切分平均,估計更穩。
  2. 前處理放 pipeline,對每折分別 fit。
  3. 不平衡用 Stratified K-Fold。
  4. 有群組用 Group、時序用時間切分。
  5. K 常取 5 或 10;資料極少才 LOOCV。

📝 iPAS 考點提醒

交叉驗證能更穩健地評估模型泛化,iPAS 高頻考點(中級科目三)。重點:K 折把資料輪流切成訓練與驗證、平均 K 次結果,比單次切分更可靠、也更充分利用資料。易混點:前處理(標準化、重取樣)要在每折內只用訓練部分做、否則資料洩漏;時間序列不能隨機切(要前向驗證)、不平衡要分層。情境:資料量有限時的穩健評估。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

交叉驗證解決什麼問題?

單次切訓練/測試集,結果受切法運氣影響大。交叉驗證多次輪流切分、平均結果,能更穩健、低變異地估計模型的泛化能力。

K 折交叉驗證怎麼做?

把資料分成 K 份,每次用其中 1 份當驗證、其餘 K 減 1 份訓練,輪流 K 次,最後平均 K 次分數,常用 K 等於 5 或 10。

最常見的錯誤是什麼?

資料洩漏——把標準化、特徵選擇等前處理在切分前對全資料做,會讓驗證集資訊滲入訓練。正確做法是把前處理放進每一折內。

資料不平衡或有群組怎麼辦?

不平衡用分層 K 折(Stratified)保持各折類別比例;同一來源或病人不可跨折,用 Group K-Fold;時間序列要用時序切分、不可用未來資料。

LOOCV 是什麼、何時用?

留一法,K 等於樣本數(每次只留 1 筆驗證);幾乎用盡資料、偏差小但變異大且很耗運算,適合小資料集。

🧭 相關主題

← 返回 AI 學習與考證地圖