Lasso 太激進、亂砍特徵;Ridge 太保守、全部留下。
Elastic Net 把兩種懲罰加在一起,用一個比例參數 α 決定該偏向哪一邊。
正則化就是在「擬合資料」之外,額外懲罰係數太大。懲罰的方式不同,行為就天差地遠:
激進的裁判,直接把不重要的係數砍成 0。精簡,但相關特徵裡常只「亂選一個」,不穩定。
保守的好好先生,把所有係數一起縮小,但幾乎不會歸零。穩定,卻不做特徵選擇、不夠精簡。
折衷者:保留 Lasso 的「能砍到 0」尖角,又帶 Ridge 的圓滑穩定。相關特徵會被一起選、一起砍。
注意三個圖形:菱形有尖角、圓形平滑、Elastic Net 是圓角菱形。這個形狀差異,正是下一節的關鍵。
把問題畫成兩個係數 (β₁, β₂) 的平面。正則化等於把解限制在一塊約束區域內,而最佳解會落在「資料的理想解 β̂」最靠近約束邊界的點上。
尖角(L1 菱形)剛好長在座標軸上,解很容易被吸到角上 → 某個係數 = 0,特徵被剔除;圓形(L2)沒有角,解通常落在斜對角 → 係數都保留。
拖曳黑色的 β̂ 點移動「理想解」,並滑動 α。觀察:把 α 推向 1、且 β̂ 偏向某一軸時,解會「啪」地吸到尖角上,讓另一個係數歸零。
Elastic Net 的約束區域在 L2 的圓和 L1 的菱形之間連續變形。α 越大越尖、越容易產生稀疏(特徵選擇);α 越小越圓、越穩定。你正在親手調這個權衡。
下面是 8 個特徵在普通最小平方法(OLS)下的原始係數(淡色框)。調整下方參數,實心柱就是 Elastic Net 收縮後的結果——歸零的特徵會被標上 ✕ 剔除。
把 α 調到 0(純 Ridge):係數全部縮小但沒人歸零。把 α 調到 1(純 Lasso):小係數一個個被砍成 0。中間值就是 Elastic Net 的折衷。
註:此為正交設計下的封閉解。soft( ) 是軟門檻(L1 把小係數推向 0),分母則是 L2 的等比縮小。
真實資料常有高度相關的特徵群組(例如基因組學裡同一條路徑上的基因)。這時 Lasso 會出問題:它傾向只留群組裡的某一個,而且每次換一批資料,留下的還不一樣——不穩定。
Elastic Net 因為帶了 L2 項,會把相關特徵當成一群一起處理,要嘛一起留、要嘛一起砍,結果穩定可重現。
在 Lasso 模式下反覆按「重新抽一批資料」,觀察相關群組(G1、G2、G3)留下來的對象一直跳動;切到 Elastic Net,三個就會穩定地一起亮起。(此為概念示意)
Elastic Net 結合 L1(Lasso)與 L2(Ridge)兩種正則化,iPAS 中級科目三考點。重點:兼顧特徵選擇(稀疏)與係數穩定。易混點:純 Lasso 遇一群高度相關特徵會隨機只留一個,加入 L2 能讓相關特徵一起保留、更穩;靠 l1_ratio 調 L1 與 L2 比例,兩端退化為 Ridge 與 Lasso。情境:特徵數多且彼此相關時優於單用 Lasso 或 Ridge。
想練情境題與詳解 → AI 學習與考證地圖
結合 L1(Lasso)與 L2(Ridge)兩種正則化的線性模型;兼顧特徵選擇與係數穩定。
純 Lasso 遇到一群高度相關特徵會隨機只留一個;加入 L2 能讓相關特徵一起被保留、結果更穩定。
一個控制整體強度(alpha 或 lambda),一個控制 L1 與 L2 比例(l1_ratio);兩端分別退化為 Ridge 與 Lasso。
特徵數多、且彼此相關時的好選擇;想要稀疏又不想犧牲穩定度時優於單用 Lasso 或 Ridge。
用交叉驗證同時掃 alpha 與 l1_ratio 的組合,選使驗證誤差最小者。