🛡️ 正則化 · iPAS 常考

Ridge(L2 正則化):讓模型別「想太多」

模型在訓練資料上太用力,反而會把雜訊也背下來。Ridge 用一個溫和的「平方懲罰」,把所有係數一起壓小,讓模型更穩、更能應付沒見過的資料。這頁帶你從「為什麼需要它」,一路看懂那張抽象的圓圈圖到底在說什麼。

過擬合是什麼損失+懲罰圖怎麼看為何不歸零L1 vs L2λ 怎麼選

🤔 一、先搞懂:模型為什麼會「想太多」?

在談 Ridge 之前,要先知道它在解決什麼問題——過擬合,以及它的徵兆:係數爆大

🌀 過擬合(Overfitting)= 死背

一個學生如果把考古題「一字不漏背下來」,連印錯的字都背,模考很高分,但換一份新考卷就崩。模型也一樣:太複雜時它會連訓練資料的雜訊都學起來,舊資料超準、新資料很爛。

過擬合常伴隨一個徵兆:係數(權重)變得異常大。模型為了硬擠過每一個訓練點,會把某些係數拉到很大的正值、再用另一個很大的負值去抵銷——數字一大,模型就對輸入的小變化過度敏感、很不穩。

💡 那就「管住」係數 → 正則化(Regularization)

正則化的點子很簡單:在「把訓練誤差變小」這個目標之外,再加一條規則:係數不准亂長大。等於幫模型養成「節制」的習慣。Ridge 就是用「平方」來懲罰大係數的那種正則化,也叫 L2。

📖 二、Ridge / L2 到底做了什麼?

一句話:在原本的損失(MSE)後面,加上「所有係數的平方和」,再乘上一個力道 λ 當作罰款。

Loss = MSE(沒考好的扣分) + λ × ( β₁² + β₂² + … )(係數太大的罰款)

🧑‍🏫 比喻:一位溫和的老師

把訓練想成考試。MSE 是「你考差多少」的扣分;正則化懲罰則是老師規定「不准死背」——係數越大(越像死背、越複雜),額外再扣分。最終成績 = 考差的扣分 + 死背被抓的扣分。
L2 是個溫和的老師:它會逼你把「作弊小抄」越縮越小,但不會強迫你完全丟掉小抄(所以係數會變小、但不會變 0)。

➗ 另一個直覺:像一直做除法

Ridge 壓縮係數的過程,有點像每一步都把係數除一點:100 → 50 → 25 → 12.5 → … → 0.0001。它會變得無限小,但理論上永遠不會剛好等於 0。先記住這個感覺,等下看圖會更有體會。

🎮 三、動手玩:看 λ 怎麼把係數壓小

這張圖很多人第一次看會卡住,因為它畫的不是資料,而是「係數的世界」。先看懂下面的圖例,再拉滑桿,就會非常清楚。

🗺️ 怎麼看這張圖(重要!)

兩條軸 = 兩個係數 β1、β2,不是資料!圖上每個位置 = 一組係數組合,原點 (0,0) 代表「兩個係數都是 0」。
灰色橢圓 = 誤差等高線:越靠中心誤差越小、越外圈誤差越大(像地圖的等高線)。
藍點 = 原始最佳解:完全不加懲罰時、誤差最小的那組係數。
青色圓 = L2 的「允許範圍」:係數只能待在圈內。λ 越大、圈越小,逼係數靠近原點。
青點 = Ridge 最終解:在「圈內」又「誤差盡量小」的折衷點,通常落在圈邊上。
β1 β2 原始最佳解
← 懲罰弱・圈大懲罰強・圈小 →

目前狀態:中等懲罰

// L2 計算過程即時監控
限制式 (Constraint): β₁² + β₂² ≤ C²

👀 你會看到什麼

把滑桿往拉(加大 λ)→ 青色圈變小 → 青點被拉向原點,右邊面板顯示 β1、β2 一起變小、平方和下降。這就是 Ridge:所有係數一起、平滑地縮水。但不管圈多小,青點都還在圈「邊」上,兩個係數都不會剛好變 0

⭕ 四、為什麼 L2 只「縮小」、不「歸零」?

這是考試最愛考、也最容易搞混的點。關鍵在「圈圈的形狀」。

1
L2 的範圍是「圓形」,沒有尖角
誤差橢圓往外擴、碰到圓的瞬間就停(那就是解)。圓是圓滑的,碰觸點幾乎都落在圓弧的斜斜位置,極難剛好碰在座標軸上。落在軸上才代表某個係數=0——既然碰不到軸,所以兩個係數都還在,只是一起變小。
2
L1(Lasso)的範圍是「菱形」,有尖角
菱形的尖角剛好在座標軸上。誤差橢圓很容易先碰到尖角 → 該位置某個係數正好=0 → L1 會把不重要的係數直接砍成 0(做特徵選擇)。這就是 L1 和 L2 最大的差別。
比較L1(Lasso)L2(Ridge)
懲罰項係數絕對值和 Σ|β|係數平方和 Σβ²
範圍形狀菱形(有尖角)圓形(圓滑)
對係數把不重要的砍成 0全部一起縮小、不歸零
特徵選擇✅ 會(產生稀疏解)❌ 不會(保留所有特徵)
最適場景特徵很多、想挑出關鍵少數特徵相關、想要穩定的係數

🧠 記憶口訣

Lasso 的「L」長得像數字 1 → L1。所以 L1 = Lasso = 會歸零 = 做特徵選擇;剩下的 L2 = Ridge = 只縮小、不歸零。兩個都想要?用 Elastic Net(L1+L2 混合)。

🏠 五、Ridge 的強項:搞定「多重共線性」

既然 Ridge 不能刪變數,它的價值在哪?答案是:當特徵彼此高度相關時,它能讓係數穩下來。

❌ 不用正則化會怎樣

假設模型同時用「房子坪數」和「房間數」——這兩個高度相關。沒有約束時,模型可能給坪數一個超大正係數、給房間數一個超大負係數,兩者互相抵銷。結果係數又大又不穩,資料動一點點、係數就大跳,這就是過擬合的溫床。

✅ 用 Ridge 之後

因為 L2 罰的是平方,一個超大的數字平方後會變超級大(罰超重)。為了避開重罰,模型會傾向把權重平均分配給這些相關特徵,而不是讓某一個獨大。係數變得溫和、穩定、好解讀——這正是 Ridge 最實用的地方。

🎚️ 六、λ 要設多少?

λ 是「懲罰力道」的旋鈕,太鬆太緊都不好。

λ 太小 → 接近沒正則化懲罰幾乎沒作用,模型可能還是過擬合。
λ 太大 → 欠擬合係數被壓太狠,模型太簡單,連訓練資料的規律都抓不到。
偏差–變異權衡λ 變大:變異↓(更穩)、偏差↑(更死板)。要找中間的甜蜜點。
用交叉驗證挑 λ試一排 λ,看哪個在「沒見過的資料」上表現最好。

⚠️ 用 L2 前一定要做的事

先把特徵標準化(縮到同樣尺度)!否則尺度大的特徵會被罰得不成比例、結果失真。另外,截距(bias)通常不施加懲罰——我們要壓的是斜率係數,不是整體基準。

📝 七、iPAS 考題實戰

題目:關於資料正則化(Regularization)L1、L2 方法,下列敘述何者正確?
註:第四梯次初級 AI 應用規劃師・第一科 人工智慧基礎概論・第 4 題
查看答案與詳解
正確答案:(C)
  • (A) ❌:正則化的目的是「減少」不必要的權重影響;權重越多、越複雜,通常越容易過擬合,而非提升正確率。
  • (B) ❌:L1 才是 Lasso,L2 是 Ridge。口訣:Lasso 的 L 像「1」。
  • (C) ✅:L1 透過懲罰權重的「絕對值和」(Σ|w|)來控制複雜度,正是它的定義。
  • (D) ❌(陷阱):兩者都會讓權重變小,但只有 L1 能把權重壓成真正的 0;L2 只會「趨近 0、不會等於 0」。所以「L2 比 L1 更會把權重趨近零」是錯的——真正的歸零者是 L1。

✅ 八、30 秒重點整理

Ridge = L2 正則化在損失加「係數平方和 × λ」的懲罰,治過擬合。
只縮小、不歸零圓形範圍沒尖角,係數一起變小但不會=0。
L1 才會歸零菱形尖角在軸上 → Lasso 做特徵選擇。
強項:多重共線性把相關特徵的權重平均分配,穩定係數。
λ 用交叉驗證挑太小沒用、太大欠擬合;偏差↑變異↓。
先標準化特徵否則大尺度特徵被罰過重;截距不罰。

📝 iPAS 考點提醒

L2 正則化(Ridge)是抑制過擬合的常用手段,iPAS 中級科目三考點。重點:在損失加上係數平方和的懲罰,把係數整體縮小、讓模型更平滑穩定,尤其能緩解多重共線性。易混點:L2 只縮小不歸零(不做特徵選擇)、L1 才會歸零;懲罰強度由 λ 控制、用交叉驗證挑。情境:特徵相關、想要穩定係數而非稀疏時用 Ridge。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

L2 正則化(Ridge)做什麼?

在損失加上權重平方和的懲罰,促使所有權重平滑縮小,降低模型對單一特徵的依賴與對雜訊的敏感,抑制過擬合。

L2 為什麼不會把權重變 0?

平方懲罰的等高線是圓形、在 0 附近梯度趨近 0,只會縮小權重而不會剛好歸零,因此不像 L1 能做特徵選擇。

正則化強度 λ 的影響?

λ 越大懲罰越強、權重被壓得越小(偏差上升、變異下降);λ 太大會欠擬合、太小則正則化無效,常用交叉驗證選 λ。

用 L2 前要注意什麼?

通常要先標準化特徵,否則尺度大的特徵會受到不成比例的懲罰;正則化一般不施加在偏置(bias)項。

L1 還是 L2?

想要稀疏或特徵選擇用 L1;只想穩定縮小、處理共線性用 L2;兩者皆要可用 Elastic Net。

🧭 相關主題

← 返回 AI 學習與考證地圖