Feature Scaling

特徵縮放

讓不同尺度的欄位公平競爭

年齡 0-100、收入 0-百萬,靠距離的演算法會被大數值主導。
縮放把所有欄位調到差不多尺度,年齡才有發言權。

標準化:(x−μ)/σ | MinMax:壓到 [0,1]
01 — 白話直覺

年齡 0-100、收入 0-100萬,怎麼公平比較?

如果一欄是「年齡(0~100)」、一欄是「收入(0~1,000,000)」,很多演算法(尤其靠距離的,如 KNN、SVM)會被數值大的欄位主導,年齡幾乎被忽略。特徵縮放就是把所有欄位調到差不多的尺度,讓它們公平競爭。

標準化
Z-score

變成均值0、標準差1。最常用。

0~1
MinMax
壓到 0~1

最小變0、最大變1。

Robust
抗離群

用中位數,不怕極端值。

小提醒:樹模型(決策樹、隨機森林、XGBoost)不需要縮放;但 KNN、SVM、神經網路、線性模型很需要。

02 — 核心互動

看縮放如何讓兩欄公平

下面兩欄原始範圍差很大。按「標準化」看它們被拉到同一尺度——原本被收入主導的距離計算,年齡終於也有發言權。

年齡軸範圍
收入軸範圍

原始狀態下收入(橫跨百萬)完全壓過年齡(0~100);標準化後兩軸都變成大約 −3~+3,距離計算才公平,模型才不會只看收入。

03 — 選擇

縮放方法怎麼選

優點

  • 標準化:最通用,適合大多數情況
  • MinMax:需要固定範圍(如影像0~1)時
  • Robust:資料有離群值時更穩

缺點 / 限制

  • 在切分前縮放 → 測試資訊洩漏
  • 樹模型其實不需要縮放
  • MinMax 對離群值很敏感

方法一覽

📊
StandardScaler
Z-score,均值0標準差1
📐
MinMaxScaler
壓到 [0,1]
🛡️
RobustScaler
用中位數,抗離群
04 — 速記與對照

標準化 vs 正規化

方法概念適合
標準化 Z-score減均值除標準差→均值0變異1多數情況、有離群較穩
正規化 Min-Max縮到 [0,1]需固定範圍(影像、神經網路)
Robust Scaling用中位數與 IQR有明顯離群值時
免縮放樹模型(決策樹/RF/XGB)

自我檢測

標準化和正規化差在哪?
標準化減均值除標準差(均值0、變異1),不限範圍、對離群較穩;正規化 Min-Max 縮到固定 [0,1],受離群影響大。
哪些模型不需要縮放?
樹模型(決策樹、隨機森林、XGBoost)對尺度不敏感;而 KNN、SVM、線性/神經網路、含距離或梯度的模型需縮放。
縮放要注意什麼洩漏問題?
只用訓練資料算均值/範圍來 fit,再 transform 驗證與測試;用全資料 fit 會把測試資訊洩漏進來。

🎯 重點整理

  1. 尺度差很多時,距離/梯度型模型需縮放。
  2. 標準化(Z)較穩、正規化(Min-Max)給固定範圍。
  3. 有離群用 Robust Scaling。
  4. 樹模型不需縮放。
  5. 只 fit 訓練資料,避免洩漏。

📝 iPAS 考點提醒

特徵縮放讓各特徵尺度一致,iPAS 前處理考點(中級科目三)。重點:標準化(減均值除標準差)與正規化(縮到 0 到 1)讓距離型(KNN、SVM)與梯度型模型更穩、更快收斂。易混點:縮放參數(均值、標準差)只能用訓練集擬合再套到驗證與測試,否則資料洩漏、評估虛高;樹模型通常不需縮放。情境:在資料切分之後、且只用訓練集統計量做縮放。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

特徵縮放是什麼、為何要做?

把不同尺度的數值特徵調到可比範圍;對依賴距離或梯度的模型(KNN、SVM、K-means、神經網路、PCA)很重要,否則大尺度特徵會主導。

標準化和正規化差在哪?

標準化(Standardization)轉成均值 0、標準差 1,對離群值較穩、不限範圍;正規化(Min-Max)壓到 0 與 1 之間固定範圍,但對離群值敏感。

哪些模型不需要縮放?

樹模型(決策樹、隨機森林、GBDT)依門檻分割、對單調縮放不敏感,通常不需要;距離型與梯度型則需要。

縮放要注意什麼洩漏問題?

縮放參數(均值/標準差或 min/max)只能用訓練資料算,再套到驗證與測試;用全資料算會洩漏,應放進 pipeline 對各折分別 fit。

有離群值時怎麼縮放?

用 RobustScaler(以中位數與 IQR)較不受離群值影響,或先處理離群值再標準化。

🧭 相關主題

← 返回 AI 學習與考證地圖