Feature Engineering

特徵建模

特徵是餵給模型的食材

模型只吃特徵——把原始欄位加工成好消化的數字。
資料和特徵決定機器學習的上限,模型只是逼近它。

好特徵 = 縮放 + 編碼 + 交叉 + 時間窗
01 — 白話直覺

特徵,是餵給模型的『食材』

模型不懂原始資料,只吃特徵(Feature)——把原始欄位加工成模型好消化的數字。特徵工程決定模型的上限,模型只是逼近它。有句名言:「資料和特徵決定了機器學習的上限,模型只是逼近這個上限。」

縮放
統一尺度

讓不同範圍的數值可比。

編碼
類別轉數字

文字類別變成數字。

特徵交叉
組合

把兩欄組合出新意義。

這頁是特徵建模總覽。下面兩個子題(縮放、編碼)各有專頁;也涵蓋特徵交叉、時間窗、樣本不平衡等策略。

02 — 核心互動

好特徵 vs 壞特徵,模型差很多

同一個預測任務,特徵做得好不好,模型表現天差地遠。切換特徵工程的程度,看模型準確率怎麼變。體會「特徵決定上限」。

模型準確率
說明

每加一層特徵工程,模型就更能抓到資料的規律。同樣的模型、同樣的資料,光是特徵做得好,準確率就能大幅提升。

03 — 特徵工程

常見手法

優點

  • 好特徵讓簡單模型也很強
  • 縮放/編碼是大多數演算法的前置
  • 特徵交叉能捕捉欄位間的交互

缺點 / 限制

  • 特徵洩漏:用了預測時拿不到的資訊
  • 在切分前做特徵工程 → 資料洩漏
  • 盲目加特徵 → 維度爆炸、過擬合

常見手法

📏
縮放
標準化、MinMax、Robust
🔤
編碼
One-hot、Label、Target
✖️
特徵交叉
組合欄位生新特徵
時間窗
滾動平均、lag 特徵
04 — 速記與對照

特徵工程手法

手法做什麼
特徵縮放標準化/正規化數值欄
類別編碼One-Hot/Label/目標編碼
衍生特徵組合、比值、時間拆解
特徵選擇濾除無用/共線特徵
特徵抽取PCA、嵌入等降維

自我檢測

特徵工程是什麼、為何重要?
把原始資料轉成模型好學的特徵;好特徵常比換模型更能提升表現,是實務關鍵。
特徵選擇和特徵抽取差在哪?
選擇是「挑出」原始特徵子集(保留可解釋);抽取是「轉換」成新特徵(如 PCA、嵌入),常降維但較難解釋。
怎麼避免特徵工程造成資料洩漏?
只用訓練資料擬合縮放/編碼/選擇,再套用到驗證與測試;在交叉驗證的 pipeline 內對每折分別擬合。

🎯 重點整理

  1. 特徵工程常比換模型更有效。
  2. 手法:縮放、編碼、衍生、選擇、抽取。
  3. 選擇挑子集、抽取造新特徵(降維)。
  4. 只用訓練資料擬合,避免洩漏。
  5. 樹模型免縮放,但仍需編碼與衍生。

📝 iPAS 考點提醒

特徵工程常比換模型更能提升效果,iPAS 高頻考點(初級科目一、中級科目三)。重點:從原始資料選取、轉換、組合出對任務有用的特徵(編碼、縮放、交互、時間特徵)。易混點:特徵須在資料切分之後做,否則用到測試資訊就是資料洩漏;暴力造特徵會過擬合,應靠領域知識。情境:題目常考某特徵處理會不會洩漏、或哪種特徵對任務有幫助。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

特徵工程是什麼、為何重要?

把原始資料轉成對模型更有用的特徵(衍生、組合、轉換、編碼);好特徵常比換更複雜的模型更能提升表現,是傳統 ML 的成敗關鍵。

常見的特徵工程手法?

數值縮放、類別編碼、缺失處理、衍生特徵(比值、時間差)、分箱(binning)、交互特徵、文字向量化、日期拆解。

特徵選擇和特徵抽取差在哪?

選擇是從原特徵挑子集(保留可解釋);抽取是組合成新特徵(如 PCA 主成分,較難解讀),都為降維與去冗餘。

怎麼避免特徵工程造成資料洩漏?

任何用到統計量的步驟(縮放、目標編碼、分箱邊界)只能用訓練資料擬合,放進 pipeline 對各折分別 fit,別用到未來或測試資訊。

對樹模型也要做特徵縮放嗎?

樹模型不需縮放(依門檻分割);但編碼類別、處理缺失、衍生有意義特徵仍有幫助。縮放主要對距離或梯度型模型重要。

🧭 相關主題

← 返回 AI 學習與考證地圖