🎯 Lasso 特徵選擇 · iPAS 正則化考點

Lasso 的魔法:自動把「沒用的特徵」砍成 0

特徵一多,就有一堆雜訊和重複的欄位在拖累模型。Lasso(L1 正則化)有個獨門絕技:加大懲罰時,它會把不重要特徵的係數直接壓成 0——等於自動幫你做特徵選擇。想看 L1 的數學原理,可搭配 L1 正則化

L1 正則化稀疏解自動特徵選擇係數歸零vs Ridge

🧳 一、先用白話講:像整理超重的行李

Lasso = Least Absolute Shrinkage and Selection Operator,重點在最後那個 Selection(選擇)

🧳 行李超重怎麼辦?

準備一堆特徵去預測,就像行李箱塞滿東西還超重。Ridge 的做法是把每樣東西都壓扁一點(係數都縮小,但全都留著);Lasso 更狠——它直接把用不到的東西整個丟掉(係數歸 0),只留真正必需品。
結果:模型變更簡單、更好解釋,因為它只用了少數幾個真正重要的特徵。

🎮 二、動手玩:拉高懲罰,看誰先被砍掉

情境是預測顧客流失,有 5 個特徵:兩個關鍵、兩個高度相關的冗餘、一個純雜訊。拖動 λ 懲罰強度,看哪些特徵的長條先崩潰歸零。



當前強度:0
特徵權重絕對值 (Coefficient Magnitude)

狀態:未正則化 (易過擬合 Overfitting)

當前沒有懲罰 (λ=0)。模型納入了所有的特徵,包括雜訊(如贈品次數)以及高度相關的冗餘特徵(通話時長與上網頻率)。這會導致模型變得過於複雜,記住太多無用的細節,在未來的預測上表現不佳。

🗺️ 怎麼看

λ 從 0 慢慢拉大,你會看到純雜訊(贈品兌換次數)最先歸零,接著兩個高度相關的冗餘特徵被砍掉一個。λ 到中段(約 30~75)進入「完美特徵選擇」——只剩真正有鑑別度的核心特徵。λ 再拉太高,連最重要的「客服聯絡次數」也被壓成 0,模型就欠擬合了。這條路徑就是 Lasso 的精髓。

🔷 三、為什麼 L1 能把係數「砍成 0」?

菱形的尖角,是關鍵

正則化=在「最小化誤差」時,額外要求係數落在一個約束範圍內。L1(Lasso)的約束是個菱形(有尖角)L2(Ridge)的約束是個圓形(沒有角)
最佳解通常會落在約束的邊界上——而菱形的尖角剛好在座標軸上,所以解很容易落在「某個係數=0」的地方。圓形沒有尖角,解就只會被縮小、不會剛好歸零。這就是L1 稀疏、L2 不稀疏的幾何原因。想看互動見 L1L2 (Ridge)

⚖️ 四、Lasso vs Ridge 對照

比較Lasso (L1)Ridge (L2)
懲罰項係數絕對值和 Σ|βⱼ|係數平方和 Σβⱼ²
約束形狀菱形(有尖角)圓形(無角)
對係數的效果部分歸零(稀疏)縮小、不歸零
能做特徵選擇?✅ 能(自動剔除)❌ 不能
擅長特徵多、要精簡與可解釋共線性、想全保留但穩定

🎚️ 五、λ 太小、剛好、太大(demo 的四個階段)

λ = 0(沒懲罰)全部特徵都留 → 太複雜、易過擬合
λ 輕度開始壓縮,雜訊先歸零
λ 剛好完美特徵選擇——只留核心特徵。
λ 太大連重要特徵都砍 → 太簡單、欠擬合

🧠 怎麼挑 λ?

交叉驗證:試一排 λ 值,挑驗證誤差最低的那個。λ 就是在「保留多少特徵」與「準不準」之間找平衡。

🔗 六、遇到高度相關的特徵,Lasso 的取捨

Lasso 會「隨機留一個、砍一個」

當兩個特徵高度相關(像 demo 的「通話時長」與「上網頻率」),Lasso 傾向只留其中一個、把另一個歸零——留哪個有點隨機、不太穩定。若你希望相關特徵能一起被保留或一起縮小,就改用 Elastic Net(L1 + L2 混合),兼顧稀疏與穩定。

🛠️ 七、什麼時候該用 Lasso?

📌 適合的場景

特徵很多、想自動篩出重要的那幾個、需要可解釋(少數特徵的模型好說明)、或懷疑很多特徵是雜訊/冗餘時。反之,若特徵都重要、只是想穩定係數,用 Ridge;相關特徵多又想篩選,用 Elastic Net。

🧪 八、觀念自我檢測

先想再點開。

Q1. Lasso 用的是哪種正則化?效果是什麼?

L1(係數絕對值和);會把不重要特徵的係數壓成 0,達成自動特徵選擇。

Q2. Lasso 和 Ridge 最大的差別?

Lasso 會歸零(稀疏、做選擇);Ridge 只縮小、不歸零

Q3. 為什麼 L1 會讓係數變 0?

L1 的菱形約束有尖角、落在座標軸上;L2 的圓形沒有角,不會剛好歸零。

Q4. λ 開太大會怎樣?

重要特徵都被砍成 0,模型太簡單 → 欠擬合

Q5. 特徵高度相關時該用什麼?

Lasso 會隨機砍一個、不穩;改用 Elastic Net(L1+L2)較穩。

✅ 九、30 秒重點整理

Lasso=L1 正則化加係數絕對值懲罰。
會歸零稀疏解、自動特徵選擇。
幾何原因菱形尖角落在座標軸。
vs RidgeRidge 只縮小、不歸零。
λ 交叉驗證選太大會欠擬合。
共線性不穩 → Elastic Net。

📝 iPAS 考點提醒

Lasso 是加 L1 正則化的線性迴歸,iPAS 正則化考點(中級科目三)。重點:L1 懲罰會把不重要特徵的係數壓到 0,達成自動特徵選擇、產生稀疏解。易混點:Lasso(L1,會歸零做選擇)與 Ridge(L2,只縮小不歸零)不同;L1 的菱形約束尖角使解落在座標軸上。情境:特徵很多、想自動篩選與提升可解釋性;特徵高度相關時 Elastic Net 更穩。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

Lasso 迴歸是什麼?

加上 L1 正則化(係數絕對值和)的線性迴歸;能把不重要特徵的係數壓到 0,達成自動特徵選擇。

Lasso 和 Ridge 差在哪?

Lasso 用 L1、會產生稀疏解(部分係數歸零、做選擇);Ridge 用 L2、只把係數縮小但不歸零。

為什麼 L1 會讓係數變 0?

L1 的菱形約束有尖角,最佳解容易落在座標軸上(某些係數恰為 0);L2 的圓形約束則不會。

正則化強度怎麼調?

用超參數 lambda(或 alpha)控制;越大懲罰越強、保留特徵越少。常用交叉驗證選最佳值。

什麼時候用 Lasso?

特徵很多、想自動篩選重要變數、提升可解釋性時;若特徵高度相關,Elastic Net 常更穩。

🧭 相關主題

← 返回 AI 學習與考證地圖