模型只吃特徵——把原始欄位加工成好消化的數字。
資料和特徵決定機器學習的上限,模型只是逼近它。
模型不懂原始資料,只吃特徵(Feature)——把原始欄位加工成模型好消化的數字。特徵工程決定模型的上限,模型只是逼近它。有句名言:「資料和特徵決定了機器學習的上限,模型只是逼近這個上限。」
讓不同範圍的數值可比。
文字類別變成數字。
把兩欄組合出新意義。
這頁是特徵建模總覽。下面兩個子題(縮放、編碼)各有專頁;也涵蓋特徵交叉、時間窗、樣本不平衡等策略。
同一個預測任務,特徵做得好不好,模型表現天差地遠。切換特徵工程的程度,看模型準確率怎麼變。體會「特徵決定上限」。
每加一層特徵工程,模型就更能抓到資料的規律。同樣的模型、同樣的資料,光是特徵做得好,準確率就能大幅提升。
| 手法 | 做什麼 |
|---|---|
| 特徵縮放 | 標準化/正規化數值欄 |
| 類別編碼 | One-Hot/Label/目標編碼 |
| 衍生特徵 | 組合、比值、時間拆解 |
| 特徵選擇 | 濾除無用/共線特徵 |
| 特徵抽取 | PCA、嵌入等降維 |
特徵工程常比換模型更能提升效果,iPAS 高頻考點(初級科目一、中級科目三)。重點:從原始資料選取、轉換、組合出對任務有用的特徵(編碼、縮放、交互、時間特徵)。易混點:特徵須在資料切分之後做,否則用到測試資訊就是資料洩漏;暴力造特徵會過擬合,應靠領域知識。情境:題目常考某特徵處理會不會洩漏、或哪種特徵對任務有幫助。
想練情境題與詳解 → AI 學習與考證地圖
把原始資料轉成對模型更有用的特徵(衍生、組合、轉換、編碼);好特徵常比換更複雜的模型更能提升表現,是傳統 ML 的成敗關鍵。
數值縮放、類別編碼、缺失處理、衍生特徵(比值、時間差)、分箱(binning)、交互特徵、文字向量化、日期拆解。
選擇是從原特徵挑子集(保留可解釋);抽取是組合成新特徵(如 PCA 主成分,較難解讀),都為降維與去冗餘。
任何用到統計量的步驟(縮放、目標編碼、分箱邊界)只能用訓練資料擬合,放進 pipeline 對各折分別 fit,別用到未來或測試資訊。
樹模型不需縮放(依門檻分割);但編碼類別、處理缺失、衍生有意義特徵仍有幫助。縮放主要對距離或梯度型模型重要。