特徵一多,就有一堆雜訊和重複的欄位在拖累模型。Lasso(L1 正則化)有個獨門絕技:加大懲罰時,它會把不重要特徵的係數直接壓成 0——等於自動幫你做特徵選擇。想看 L1 的數學原理,可搭配 L1 正則化。
Lasso = Least Absolute Shrinkage and Selection Operator,重點在最後那個 Selection(選擇)。
情境是預測顧客流失,有 5 個特徵:兩個關鍵、兩個高度相關的冗餘、一個純雜訊。拖動 λ 懲罰強度,看哪些特徵的長條先崩潰歸零。
當前沒有懲罰 (λ=0)。模型納入了所有的特徵,包括雜訊(如贈品次數)以及高度相關的冗餘特徵(通話時長與上網頻率)。這會導致模型變得過於複雜,記住太多無用的細節,在未來的預測上表現不佳。
| 比較 | Lasso (L1) | Ridge (L2) |
|---|---|---|
| 懲罰項 | 係數絕對值和 Σ|βⱼ| | 係數平方和 Σβⱼ² |
| 約束形狀 | 菱形(有尖角) | 圓形(無角) |
| 對係數的效果 | 部分歸零(稀疏) | 只縮小、不歸零 |
| 能做特徵選擇? | ✅ 能(自動剔除) | ❌ 不能 |
| 擅長 | 特徵多、要精簡與可解釋 | 共線性、想全保留但穩定 |
先想再點開。
L1(係數絕對值和);會把不重要特徵的係數壓成 0,達成自動特徵選擇。
Lasso 會歸零(稀疏、做選擇);Ridge 只縮小、不歸零。
L1 的菱形約束有尖角、落在座標軸上;L2 的圓形沒有角,不會剛好歸零。
連重要特徵都被砍成 0,模型太簡單 → 欠擬合。
Lasso 會隨機砍一個、不穩;改用 Elastic Net(L1+L2)較穩。
Lasso 是加 L1 正則化的線性迴歸,iPAS 正則化考點(中級科目三)。重點:L1 懲罰會把不重要特徵的係數壓到 0,達成自動特徵選擇、產生稀疏解。易混點:Lasso(L1,會歸零做選擇)與 Ridge(L2,只縮小不歸零)不同;L1 的菱形約束尖角使解落在座標軸上。情境:特徵很多、想自動篩選與提升可解釋性;特徵高度相關時 Elastic Net 更穩。
想練情境題與詳解 → AI 學習與考證地圖
加上 L1 正則化(係數絕對值和)的線性迴歸;能把不重要特徵的係數壓到 0,達成自動特徵選擇。
Lasso 用 L1、會產生稀疏解(部分係數歸零、做選擇);Ridge 用 L2、只把係數縮小但不歸零。
L1 的菱形約束有尖角,最佳解容易落在座標軸上(某些係數恰為 0);L2 的圓形約束則不會。
用超參數 lambda(或 alpha)控制;越大懲罰越強、保留特徵越少。常用交叉驗證選最佳值。
特徵很多、想自動篩選重要變數、提升可解釋性時;若特徵高度相關,Elastic Net 常更穩。