為何極端小資料需要「分層留一法」?

陰性個案 (138筆, 92%)
陽性個案 (12筆, 8%)
訓練集 (Training Set) 驗證集 (Validation Set)

總資料量:150 筆 (極度不平衡)

這就是團隊面臨的困境:150 筆資料中,只有 12 顆紅點(陽性心臟病個案),比例低於 8%。
請點擊上方按鈕,看看不同的交叉驗證切分方式會造成什麼影響。

📊 CV 折數與分層取捨
方法折數特點
K-Fold (K=5/10)中等偏差/變異平衡、常用
LOOCVN(每筆一折)近乎無偏但變異大、超貴
Stratified各折保比例分類/不平衡必用
Repeated K-Fold重複多次更穩、更貴
✅ 自我檢測
什麼是分層交叉驗證?
Stratified:切折時讓每折的類別比例與整體一致,避免某折缺少數類,分類任務(尤其不平衡)必用。
LOOCV 是什麼、優缺點?
留一法:每次留 1 筆當驗證、其餘訓練,做 N 次。近乎無偏但變異大、計算極貴,適合資料很少。
K 折怎麼選 K?
常用 5 或 10:K 大偏差小但變異大、成本高;K 小反之。資料極少才用 LOOCV。
🎯 重點整理
  1. 分層讓各折類別比例一致。
  2. 分類/不平衡一定要分層。
  3. LOOCV=留一,近無偏但貴、變異大。
  4. K 常取 5 或 10,平衡偏差與變異。
  5. 重複 K 折更穩定但更費時。

📝 iPAS 考點提醒

分層與留一交叉驗證是 iPAS 評估方法考點(中級科目三)。重點:分層 CV 保持每折類別比例與整體一致(不平衡分類很重要);LOOCV 每次只留一個樣本驗證、重複 N 次,偏誤低但計算昂貴。易混點:LOOCV 各次訓練集高度重疊、變異可能偏高;一般用 5 或 10 折折衷。情境:資料少或類別不平衡時的穩健評估。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

什麼是分層交叉驗證?

在切折時保持每折的類別比例與整體一致;對不平衡分類很重要,避免某折少數類太少或缺席,使評估更穩。

留一交叉驗證(LOOCV)是什麼?

極端的 K 折:每次只留一個樣本當驗證、其餘全訓練,重複 N 次;幾乎用盡資料,但計算昂貴。

LOOCV 的優缺點?

優點是偏誤低、適合小資料;缺點是計算量大(訓練 N 次),且各次訓練集高度重疊使結果變異可能偏高。

K 折怎麼選 K?

常用 5 或 10,在偏誤與變異、計算成本間折衷;資料很少可用 LOOCV,很多則小 K 即可。

什麼時候一定要分層?

類別不平衡或樣本數少的分類任務;分層能確保每折都有各類代表,評估才不會因切分運氣失真。

🧭 相關主題

← 返回 AI 學習與考證地圖