🗺️ AI 學習與考證地圖

為何極端小資料需要「分層留一法」?

眼神明亮好奇的 Mochi 貓老師比較紅藍樣本在不同交叉驗證折中的分布
溫柔擔心的 Mochi 貓老師在大量藍色樣本中找出稀少的紅色陽性樣本
01 · 先抓住直覺

資料少,又很不平衡:每一顆紅點都很珍貴

若少數類只占一小部分,普通隨機切分可能讓某折完全看不到陽性案例。分層的目的,就是讓每一折都盡量保有可比較的類別比例。

戴端正圓眼鏡的 Mochi 貓老師專注操作訓練集與驗證集的分層切分控制台
陰性個案 (138筆, 92%)
陽性個案 (12筆, 8%)
訓練集 (Training Set) 驗證集 (Validation Set)

總資料量:150 筆 (極度不平衡)

這就是團隊面臨的困境:150 筆資料中,只有 12 顆紅點(陽性心臟病個案),比例低於 8%。
請點擊上方按鈕,看看不同的交叉驗證切分方式會造成什麼影響。

📊 CV 折數與分層取捨
沉思側看的 Mochi 貓老師比較 K 折、留一法、分層與重複交叉驗證
方法折數特點
K-Fold (K=5/10)中等偏差/變異平衡、常用
LOOCVN(每筆一折)近乎無偏但變異大、超貴
Stratified各折保比例分類/不平衡必用
Repeated K-Fold重複多次更穩、更貴
✅ 自我檢測
安心閉眼微笑的 Mochi 貓老師揮手並展示分層交叉驗證檢核板
什麼是分層交叉驗證?
Stratified:切折時讓每折的類別比例與整體一致,避免某折缺少數類,分類任務(尤其不平衡)必用。
LOOCV 是什麼、優缺點?
留一法:每次留 1 筆當驗證、其餘訓練,做 N 次。近乎無偏但變異大、計算極貴,適合資料很少。
K 折怎麼選 K?
常用 5 或 10:K 大偏差小但變異大、成本高;K 小反之。資料極少才用 LOOCV。
🎯 重點整理
  1. 分層讓各折類別比例一致。
  2. 分類/不平衡一定要分層。
  3. LOOCV=留一,近無偏但貴、變異大。
  4. K 常取 5 或 10,平衡偏差與變異。
  5. 重複 K 折更穩定但更費時。
03 · 典型應用場景

哪些任務特別需要「小資料+分層」的評估思維?

共同特徵是:資料不多、少數類又珍貴。先讓每折保留合理的類別代表,再比較模型,分數才不會只反映切分運氣。

溫柔自信的 Mochi 貓老師展示小資料與不平衡分類的評估工具箱
溫柔關心的 Mochi 貓老師檢查心臟篩檢資料中的稀少陽性病例
罕見疾病與醫療篩檢
陽性病例很少時,分層可降低某折沒有病例的風險;同一病患若有多筆資料,還要搭配群組切分。
驚訝圓眼但不兇的 Mochi 貓老師發現大量交易卡中的少數詐欺警示
詐欺與稀有事件偵測
詐欺交易占比低,普通隨機切分容易讓每折陽性數差太多;分層可讓 Recall、F1 與 AUC 的比較更穩。
好奇專注的 Mochi 貓老師在產品樣本中保留稀少瑕疵品供每折評估
少量瑕疵與品質檢測
瑕疵品少但代價高,每折都要有足夠瑕疵樣本,才能判斷模型是否真的抓得到少數異常。
開心亮眼的 Mochi 貓老師用顯微鏡與少量樣本瓶進行小資料研究
小型科學與實驗資料
昂貴實驗常只有少量樣本,可用較大的 K 或留一法提高訓練利用率,但仍要留意高變異與計算成本。

📝 iPAS 考點提醒

分層與留一交叉驗證是 iPAS 評估方法考點(中級科目三)。重點:分層 CV 保持每折類別比例與整體一致(不平衡分類很重要);LOOCV 每次只留一個樣本驗證、重複 N 次,偏誤低但計算昂貴。易混點:LOOCV 各次訓練集高度重疊、變異可能偏高;一般用 5 或 10 折折衷。情境:資料少或類別不平衡時的穩健評估。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

什麼是分層交叉驗證?

在切折時保持每折的類別比例與整體一致;對不平衡分類很重要,避免某折少數類太少或缺席,使評估更穩。

留一交叉驗證(LOOCV)是什麼?

極端的 K 折:每次只留一個樣本當驗證、其餘全訓練,重複 N 次;幾乎用盡資料,但計算昂貴。

LOOCV 的優缺點?

優點是偏誤低、適合小資料;缺點是計算量大(訓練 N 次),且各次訓練集高度重疊使結果變異可能偏高。

K 折怎麼選 K?

常用 5 或 10,在偏誤與變異、計算成本間折衷;資料很少可用 LOOCV,很多則小 K 即可。

什麼時候一定要分層?

類別不平衡或樣本數少的分類任務;分層能確保每折都有各類代表,評估才不會因切分運氣失真。

🧭 相關主題

← 返回 AI 學習與考證地圖