為何其他三種方法會導致模型評估災難?

陰性個案 (138筆)
陽性個案 (12筆)
訓練集 (Training Set) 驗證集 (Validation Set) 無法計算指標!

請選擇上方按鈕

觀察各種方法在面對 12 筆陽性、138 筆陰性資料時,會把驗證集切成什麼可怕的模樣。

📊 交叉驗證常見錯誤
錯誤為什麼錯正解
前處理用全資料縮放/填補看到測試資訊→洩漏放 pipeline、對每折 fit
時間序列用一般 K 折用未來預測過去、時間穿越用時序切分(只用過去)
有群組卻隨機切同一人跨訓練測試→高估Group K-Fold
不平衡沒分層某折可能沒有少數類Stratified K-Fold
✅ 自我檢測
交叉驗證最常見的錯誤是什麼?
前處理(縮放/填補/選特徵)用到整個資料集,讓驗證折看到訓練外資訊,造成洩漏、分數虛高。
時間序列用一般 K 折錯在哪?
隨機折會用「未來」資料訓練去預測「過去」,發生時間穿越;要用只用過去的時序切分。
有分組資料時的陷阱?
同一使用者/病人的多筆若被切到不同折,模型「見過」該對象、評估被高估;要用 Group K-Fold。
🎯 重點整理
  1. 前處理放 pipeline,避免跨折洩漏。
  2. 時間序列用時序切分,別隨機折。
  3. 有群組用 Group K-Fold。
  4. 不平衡用 Stratified K-Fold。
  5. CV 要模擬真實預測情境。

📝 iPAS 考點提醒

交叉驗證若做錯會讓評估虛高,是 iPAS 高頻陷阱題(中級科目二與三)。重點:最常見的錯是資料洩漏——在切分前就對全資料做標準化、特徵選擇或重取樣,測試資訊提前外洩。易混點:前處理要放進管線、在每折內只用訓練部分擬合;時間序列不能隨機切(要前向驗證)、分組資料要 GroupKFold。情境:辨識題目中哪個 CV 做法不當。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

交叉驗證最常見的錯誤是什麼?

資料洩漏——在切分前就對全資料做前處理(標準化、特徵選擇、重取樣),測試折的資訊提早洩漏給模型,造成評估過度樂觀。

前處理為什麼要放進管線(pipeline)?

要在每一折只用訓練部分擬合前處理參數、再套用到驗證部分;用 Pipeline 自動確保不洩漏,手動很容易出錯。

時間序列用一般 K 折錯在哪?

隨機切會用未來資料預測過去、洩漏未來資訊使評估虛高;應改用時間順序的前向(滾動)驗證。

有分組資料時的陷阱?

同一受試者或使用者的樣本散落在訓練與驗證兩邊會洩漏;應用 GroupKFold 讓同組只落在同一邊。

還有哪些常見錯誤?

用測試集調參、不平衡資料未分層、只跑一次就下結論、在交叉驗證外才做重取樣;這些都會高估真實表現。

🧭 相關主題

← 返回 AI 學習與考證地圖