真實資料常有缺失。處理三類:補值(猜合理數字)、刪除(丟整列)、標記(缺失也是資訊)。
選哪個取決於『為什麼會缺』——沒有萬用解。
真實資料常有缺失(沒填、感測器壞、整合漏掉)。處理方式有三類:補值(猜一個合理數字填進去)、刪除(整列丟掉)、標記(把「缺失」本身當成一種資訊)。選哪個,取決於為什麼會缺。
均值/中位數/KNN 猜一個值。
整列刪除,簡單但損失資料。
「缺失」本身可能有意義。
缺失機制三種:MCAR(完全隨機)、MAR(與其他欄位有關)、MNAR(與缺失值本身有關,最棘手)。機制不同,處理策略也不同。
一欄資料中間挖空了幾格。切換補值方法,看補進去的值(紅點)與真實趨勢的差距。沒有萬用解——要看資料的形狀。
趨勢資料(如時間序列)用「線性插補」貼合最好;均值補值會把所有缺失都填成同一個值,破壞趨勢。沒有最好,只有最適合。
沒有萬用解,方法要配合缺失機制與資料型態。點一眼帶走:
| 方法 | 怎麼做 | 適合 | 風險 |
|---|---|---|---|
| 均值 / 中位數 | 用該欄統計量填數值 | 數值型、缺失少 | 低估變異、破壞趨勢;中位數較抗離群 |
| 眾數 | 填最常見的類別 | 類別型欄位 | 放大多數類別 |
| 前後值 / 線性插補 | 沿趨勢或前後值補 | 時間序列 | 遇轉折點會失真 |
| 模型補值(KNN/迴歸) | 用其他欄位預測 | 缺失有規律(MAR) | 計算較貴、可能過擬合 |
| 刪除 | 丟整列或整欄 | 缺失極少 / 整欄多缺 | 損失資料、可能引入偏差 |
| 缺失指示欄 | 加一個布林標記 | MNAR、缺失本身有意義 | 增加維度 |
缺失值處理是資料清理的重點,iPAS 考點(初級科目一、中級科目二)。重點:可刪除(整列或整欄)或填補(平均、中位數、眾數、模型預測、前後值),依缺失比例與機制選擇。易混點:要看缺失機制(完全隨機 MCAR、隨機 MAR、非隨機 MNAR)——非隨機缺失硬填會引入偏誤;大量缺失的欄位可能該刪。情境:選填補法、判斷某做法會不會扭曲分布。
想練情境題與詳解 → AI 學習與考證地圖
MCAR(完全隨機缺失)、MAR(隨某些已觀測變數而缺)、MNAR(與缺失值本身有關,如高收入者不填收入);類型影響該怎麼處理。
刪除(整列或整欄)、填補(均值/中位數/眾數、前後值、模型預測如 KNN 或迴歸)、或新增「是否缺失」指示欄保留訊息。
缺失比例很低且為隨機(MCAR)時刪列影響小;某欄缺太多(如超過一半)可考慮刪欄。但刪除會損失資料,需謹慎。
用含測試集的全資料算均值來填會造成資料洩漏;應只用訓練資料的統計量,並在 pipeline 內對各折分別擬合。
有時有(MNAR)——「缺失」這件事可能與目標相關,可加一個布林指示欄讓模型利用,而非直接抹掉。