離群值是遠離群體的極端值。關鍵是判斷它是錯誤(要清掉)還是真實重要(詐騙、故障,正是目標)。
用 Z-score、IQR 偵測,門檻拿捏是核心。
離群值(Outlier)是遠離其他資料的極端值。關鍵問題:它是錯誤(打錯字、感測器壞)還是真實又重要(詐騙交易、設備異常)?前者要清掉,後者正是你要找的目標。所以離群值偵測既是清理、也是異常偵測。
遠離群體的點。
離平均幾個標準差以外。
超出四分位距 1.5 倍。
先別急著刪!永遠先問:這個極端值是「錯」還是「真」。詐騙偵測、故障預警,要找的正是離群值。
下面一排資料點,大部分集中,少數極端。拖動靈敏度,看離群判定範圍怎麼變——太鬆抓不到異常,太嚴把正常值也當異常(誤報)。這個拿捏是偵測的核心。
IQR 法常用 1.5 倍當界線(箱型圖鬚線)。調很鬆(3.0)只抓最誇張的;調很嚴(1.0)連邊緣正常值都被標成離群——誤報變多。
| 方法 | 怎麼判 | 特點 |
|---|---|---|
| IQR 法 | 超過 Q1−1.5·IQR 或 Q3+1.5·IQR | 不受極端值影響、直觀 |
| Z-score | |z|>3(距均值幾個標準差) | 假設近常態 |
| 視覺化 | 箱型圖、散佈圖 | 快速人眼發現 |
| 模型法 | Isolation Forest、LOF | 高維、非線性有效 |
離群值偵測與處理影響模型穩定,iPAS 考點(中級科目二與三)。重點:用箱形圖、Z 分數、IQR 或模型法找極端值,再決定保留、修正或移除。易混點:不可粗暴刪除而破壞整體分布——要先分辨是錯誤資料還是真實的極端案例(如高額理賠);有些模型(樹)對離群較不敏感。情境:在不破壞分布前提下處理離群、判斷某做法是否恰當。
想練情境題與詳解 → AI 學習與考證地圖
明顯偏離其他資料的值,可能是錯誤(輸入錯)或真實極端事件(如詐欺);是否處理要看它是雜訊還是有意義的訊號。
統計法(Z-score、IQR 箱型圖)、距離與密度法(DBSCAN、LOF)、模型法(Isolation Forest);視覺化(箱型圖、散點圖)也很有用。
算 Q1、Q3 與四分位距 IQR=Q3−Q1,落在 Q1−1.5×IQR 以下或 Q3+1.5×IQR 以上者視為離群。
先判斷成因:是錯誤就修正或刪除;是真實極端值可保留、做轉換(如取對數)、或改用對離群值穩健的方法與指標(中位數、MAE)。
對 SVM、線性迴歸、K-means、MSE 等敏感方法影響大(會被拉偏);樹模型相對穩健,處理前要想清楚它是否該被忽略。