Missing Values · 補值策略

缺失值處理

資料有空格,補、刪、還是標記?

真實資料常有缺失。處理三類:補值(猜合理數字)、刪除(丟整列)、標記(缺失也是資訊)。
選哪個取決於『為什麼會缺』——沒有萬用解。

策略取決於缺失機制:MCAR / MAR / MNAR
01 — 白話直覺

資料有空格,怎麼辦?

真實資料常有缺失(沒填、感測器壞、整合漏掉)。處理方式有三類:補值(猜一個合理數字填進去)、刪除(整列丟掉)、標記(把「缺失」本身當成一種資訊)。選哪個,取決於為什麼會缺

補值
填進去

均值/中位數/KNN 猜一個值。

刪除
丟掉

整列刪除,簡單但損失資料。

?
標記
當資訊

「缺失」本身可能有意義。

缺失機制三種:MCAR(完全隨機)、MAR(與其他欄位有關)、MNAR(與缺失值本身有關,最棘手)。機制不同,處理策略也不同。

02 — 核心互動

比較三種補值法的效果

一欄資料中間挖空了幾格。切換補值方法,看補進去的值(紅點)與真實趨勢的差距。沒有萬用解——要看資料的形狀。

趨勢資料(如時間序列)用「線性插補」貼合最好;均值補值會把所有缺失都填成同一個值,破壞趨勢。沒有最好,只有最適合。

03 — 策略

缺失值處理選擇

優點

  • 補值:保留資料量,適合缺失不多時
  • 刪除:簡單乾淨,適合缺失極少時
  • 標記:當缺失本身帶有資訊時很有用

缺點 / 限制

  • 均值補值會低估變異、破壞趨勢
  • 刪太多列 → 資料量銳減、引入偏差
  • 補值不當會製造假訊號

方法一覽

📊
統計補值
均值、中位數、眾數
🔗
模型補值
KNN、迴歸、多重插補
🗑️
刪除
整列刪 / 整欄刪
04 — 速記與對照

補值方法對照表

沒有萬用解,方法要配合缺失機制與資料型態。點一眼帶走:

方法怎麼做適合風險
均值 / 中位數用該欄統計量填數值數值型、缺失少低估變異、破壞趨勢;中位數較抗離群
眾數填最常見的類別類別型欄位放大多數類別
前後值 / 線性插補沿趨勢或前後值補時間序列遇轉折點會失真
模型補值(KNN/迴歸)用其他欄位預測缺失有規律(MAR)計算較貴、可能過擬合
刪除丟整列或整欄缺失極少 / 整欄多缺損失資料、可能引入偏差
缺失指示欄加一個布林標記MNAR、缺失本身有意義增加維度

自我檢測

Q1. 為什麼補值前要先判斷缺失機制?
因為 MCAR/MAR/MNAR 決定策略:隨機缺失(MCAR)刪列影響小;MNAR(非隨機、如高收入者不填收入)硬填會引入偏誤,需保留「是否缺失」的資訊。
Q2. 時間序列的缺失該用哪種補法?
線性/前後插補最貼近趨勢;均值/中位數會把缺失都填成同一個固定值,破壞上升或下降的走勢。
Q3. 補值最常見的資料洩漏錯誤是什麼?
用「含測試集的全資料」算均值來填。應只用訓練資料的統計量,並在交叉驗證中對每一折分別擬合填補器。

🎯 重點整理

  1. 先問「為什麼會缺」——MCAR / MAR / MNAR 決定策略。
  2. 數值缺失少用中位數(抗離群);類別型用眾數。
  3. 時間序列用插補;缺失有規律(MAR)用模型補值。
  4. 整欄缺太多可刪欄;MNAR 加「缺失指示欄」保留資訊。
  5. 只用訓練資料的統計量填,避免資料洩漏。

📝 iPAS 考點提醒

缺失值處理是資料清理的重點,iPAS 考點(初級科目一、中級科目二)。重點:可刪除(整列或整欄)或填補(平均、中位數、眾數、模型預測、前後值),依缺失比例與機制選擇。易混點:要看缺失機制(完全隨機 MCAR、隨機 MAR、非隨機 MNAR)——非隨機缺失硬填會引入偏誤;大量缺失的欄位可能該刪。情境:選填補法、判斷某做法會不會扭曲分布。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

缺失值有哪些類型?

MCAR(完全隨機缺失)、MAR(隨某些已觀測變數而缺)、MNAR(與缺失值本身有關,如高收入者不填收入);類型影響該怎麼處理。

處理缺失值有哪些方法?

刪除(整列或整欄)、填補(均值/中位數/眾數、前後值、模型預測如 KNN 或迴歸)、或新增「是否缺失」指示欄保留訊息。

什麼時候可以直接刪除?

缺失比例很低且為隨機(MCAR)時刪列影響小;某欄缺太多(如超過一半)可考慮刪欄。但刪除會損失資料,需謹慎。

填補要避免什麼錯誤?

用含測試集的全資料算均值來填會造成資料洩漏;應只用訓練資料的統計量,並在 pipeline 內對各折分別擬合。

缺失本身有資訊嗎?

有時有(MNAR)——「缺失」這件事可能與目標相關,可加一個布林指示欄讓模型利用,而非直接抹掉。

🧭 相關主題

← 返回 AI 學習與考證地圖