Outlier Detection · 異常值

離群值偵測

那個極端值,是錯誤還是寶藏?

離群值是遠離群體的極端值。關鍵是判斷它是錯誤(要清掉)還是真實重要(詐騙、故障,正是目標)。
用 Z-score、IQR 偵測,門檻拿捏是核心。

IQR 法:超出 Q1−k·IQR 或 Q3+k·IQR(常用 k=1.5)
01 — 白話直覺

那個超大的數字,是錯誤還是寶藏?

離群值(Outlier)是遠離其他資料的極端值。關鍵問題:它是錯誤(打錯字、感測器壞)還是真實又重要(詐騙交易、設備異常)?前者要清掉,後者正是你要找的目標。所以離群值偵測既是清理、也是異常偵測。

離群值
極端

遠離群體的點。

Z-score
標準差法

離平均幾個標準差以外。

IQR 法
箱型圖

超出四分位距 1.5 倍。

先別急著刪!永遠先問:這個極端值是「錯」還是「真」。詐騙偵測、故障預警,要找的正是離群值。

02 — 核心互動

拖門檻,看 IQR/Z-score 怎麼抓離群值

下面一排資料點,大部分集中,少數極端。拖動靈敏度,看離群判定範圍怎麼變——太鬆抓不到異常,太嚴把正常值也當異常(誤報)。這個拿捏是偵測的核心。

1.5
判定為離群
提示

IQR 法常用 1.5 倍當界線(箱型圖鬚線)。調很鬆(3.0)只抓最誇張的;調很嚴(1.0)連邊緣正常值都被標成離群——誤報變多。

03 — 方法與判斷

離群值的處理

優點

  • 先判斷:錯誤值 vs 有意義的極端值
  • IQR 對偏態資料較穩健
  • Isolation Forest 適合高維、自動偵測

缺點 / 限制

  • 盲目刪除可能丟掉重要訊號(詐騙!)
  • Z-score 假設常態分布,偏態會失準
  • 門檻太嚴 → 大量誤報

偵測方法

📏
Z-score
離均值幾個標準差
📦
IQR
箱型圖四分位距
🌲
Isolation Forest
高維自動偵測
04 — 速記與對照

離群值偵測方法

方法怎麼判特點
IQR 法超過 Q1−1.5·IQR 或 Q3+1.5·IQR不受極端值影響、直觀
Z-score|z|>3(距均值幾個標準差)假設近常態
視覺化箱型圖、散佈圖快速人眼發現
模型法Isolation Forest、LOF高維、非線性有效

自我檢測

怎麼偵測離群值?
統計法(IQR、Z-score)、視覺化(箱型圖)、或模型法(Isolation Forest、LOF);高維資料多用模型法。
IQR 法怎麼判定?
算四分位距 IQR=Q3−Q1,落在 Q1−1.5·IQR 以下或 Q3+1.5·IQR 以上視為離群,對極端值穩健。
發現離群值該怎麼處理?
先判斷是錯誤還是真實極端:錯誤就修正/刪除;真實則保留、蓋帽(winsorize)或用穩健方法,別一律刪。

🎯 重點整理

  1. 離群值=明顯偏離多數的觀測值。
  2. IQR、Z-score、箱型圖、模型法偵測。
  3. IQR 用 1.5 倍距、對極端值穩健。
  4. 先分辨錯誤 vs 真實極端再處理。
  5. 別盲刪——可能是重要訊號。

📝 iPAS 考點提醒

離群值偵測與處理影響模型穩定,iPAS 考點(中級科目二與三)。重點:用箱形圖、Z 分數、IQR 或模型法找極端值,再決定保留、修正或移除。易混點:不可粗暴刪除而破壞整體分布——要先分辨是錯誤資料還是真實的極端案例(如高額理賠);有些模型(樹)對離群較不敏感。情境:在不破壞分布前提下處理離群、判斷某做法是否恰當。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

什麼是離群值(outlier)?

明顯偏離其他資料的值,可能是錯誤(輸入錯)或真實極端事件(如詐欺);是否處理要看它是雜訊還是有意義的訊號。

怎麼偵測離群值?

統計法(Z-score、IQR 箱型圖)、距離與密度法(DBSCAN、LOF)、模型法(Isolation Forest);視覺化(箱型圖、散點圖)也很有用。

IQR 法怎麼判定?

算 Q1、Q3 與四分位距 IQR=Q3−Q1,落在 Q1−1.5×IQR 以下或 Q3+1.5×IQR 以上者視為離群。

發現離群值該怎麼處理?

先判斷成因:是錯誤就修正或刪除;是真實極端值可保留、做轉換(如取對數)、或改用對離群值穩健的方法與指標(中位數、MAE)。

離群值對模型的影響?

對 SVM、線性迴歸、K-means、MSE 等敏感方法影響大(會被拉偏);樹模型相對穩健,處理前要想清楚它是否該被忽略。

🧭 相關主題

← 返回 AI 學習與考證地圖