📉 梯度方差 Gradient Variance · iPAS 訓練機制

梯度方差:AI 下山為什麼「腳步發抖」,又怎麼走穩?

訓練時我們用一小批資料估計該往哪走(梯度)。每批不一樣,估出的方向就會在真方向附近上下抖動——這就是梯度方差(雜訊)。它有好有壞:適量能幫忙跳出陷阱,太多則讓訓練震盪、學不穩

SGD 雜訊批次大小基準線 Baseline跳出鞍點訓練穩定性

🧠 一、先用白話講:梯度方差是什麼?

SGD(隨機梯度下降)用小批次估計「整體」該走的方向。每批資料不同,估計值就會在真實梯度附近波動——這波動就是梯度方差

⛰️ 生活比喻:下山問路

你在濃霧的山上想下到谷底(真實梯度=谷底方向)。但你每一步只問幾個路人(一個 batch),每組人指的方向都略有出入,於是你的路線歪歪扭扭。
問越多人(batch 越大),把意見平均後越接近真方向,走得越穩——但問越多人也越花時間。

🎲 二、雜訊哪裡來?批次估計

用一小批近似全部

算「整體梯度」要用全部資料(準但超慢)。SGD 改用一小批近似它(快,但每批不同 → 有雜訊)。雜訊大小大約以 1/√(批次大小) 縮小——批次放大 4 倍,雜訊只剩一半。這就是為什麼加大 batch 能讓路徑變穩。

🎮 三、動手玩:在等高線山谷裡下山

📜 情境

AI 從左上角出發,要走到中心的綠點(最佳解)。但梯度有雜訊,路徑會抖。調整批次大小(探路人數)、勾選基準線 (Baseline),按「開始一回合訓練」看軌跡穩不穩。
*人越多,意見平均後越準確 (降低方差),但計算成本較高。
*過濾掉普遍的雜訊,讓 AI 只關注「比平均更好/更差」的信號 (大幅降低方差)。
系統估算方差大小:
高 (不穩定)
最佳解

🗺️ 怎麼看

batch 調到很小(1~5):路徑紅色、劇烈鋸齒,繞老半天才到(甚至衝過頭)。batch 調大:路徑變平滑勾選 Baseline:路徑最穩、幾乎直奔綠點。左上角的「方差大小」也會跟著紅→黃→綠。

⚖️ 四、雜訊是壞事嗎?其實有兩面

好的一面 ✅適度雜訊能幫忙跳出鞍點與壞的局部最小,還有正則化效果(泛化常更好)。
壞的一面 ❌雜訊太大 → 訓練震盪、難收斂,甚至發散。

🧠 所以不是越小越好

梯度方差要適中:完全沒雜訊(超大批次)容易卡在爛谷底、泛化差;雜訊太大又學不穩。這也是「大批次 vs 小批次」永遠在拉鋸的原因。

📊 五、批次大小的取捨

比較大批次小批次
梯度方差低(穩)高(抖)
每步速度慢(算得多)
更新軌跡平滑震盪
泛化有時略差(易卡尖銳谷底)更好(雜訊當正則化)

🎯 六、Baseline:策略梯度的降變異神器

只看「比平均好多少」,過濾掉共同雜訊

demo 裡那個「基準線」勾選,其實就是前面 Policy GradientActor-Critic 用來降變異的招——把回報減掉一個基準值(如狀態價值),只保留「比平均更好或更差」的訊號。
神奇的是:這樣大幅降低變異,卻不改變更新的期望方向(不引入偏差)。所以它幾乎是「免費的午餐」,Actor-Critic 的 Critic 就是在當這個 baseline。

🛠️ 七、其他降變異/穩定訓練的手段

動量 Momentum累積過去方向、平滑掉抖動,衝過小坑。
學習率衰減後期步伐變小,減少在谷底來回彈跳。
梯度裁剪 Clipping設上限,防止偶爾的超大梯度爆炸
Adam 等自適應優化器用梯度的統計自動調步伐,較穩。
適度加大批次直接靠平均降雜訊(但別過頭)。

🧪 八、觀念自我檢測

先想再點開。

Q1. 梯度方差是怎麼產生的?

SGD 用小批次估計整體梯度,每批資料不同 → 估計值在真方向附近波動

Q2. 批次大小怎麼影響變異?

大批次=低變異、穩但慢;小批次=高變異、快但震盪(雜訊 ~ 1/√N)。

Q3. 梯度雜訊全是壞事嗎?

不是。適度能跳出鞍點/壞局部最小、有正則化效果;太大才會震盪難收斂。

Q4. baseline 怎麼降變異、有副作用嗎?

把回報減基準只留相對優劣訊號,大幅降變異不改變期望方向(無偏)。

Q5. 還有哪些穩定訓練的手段?

動量、學習率衰減、梯度裁剪、Adam、適度加大批次。

✅ 九、30 秒重點整理

梯度方差=估計雜訊小批次近似整體梯度而抖。
雜訊 ~ 1/√批次批次越大越穩、越慢。
兩面性適度跳鞍點/正則化;太大則震盪。
Baseline減基準降變異、不改期望。
穩定手段動量、LR 衰減、梯度裁剪、Adam。
取捨大批次穩、小批次常泛化更好。

📝 iPAS 考點提醒

梯度變異是隨機梯度下降(SGD)的固有現象,iPAS 訓練機制考點(中級科目三)。重點:用小批次估計整體梯度,每批不同使估計值在真實梯度附近上下波動(雜訊)。易混點:適度雜訊有助跳出鞍點與壞局部最小、有正則化效果,但太大會震盪難收斂;批次越大雜訊越小、每步較慢、泛化有時略差。情境:調批次大小與學習率是在偏差與變異間取捨。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

為什麼隨機梯度會有變異?

SGD 用小批次估計整體梯度,每批資料不同,估計值會在真實梯度附近上下波動,這就是梯度變異(雜訊)。

梯度變異是壞事嗎?

有兩面:適度雜訊能幫忙跳出鞍點與壞的局部最小、有正則化效果;但太大會使訓練震盪、難收斂。

批次大小如何影響變異?

批次越大估計越準、雜訊越小、更新越穩但每步較慢、泛化有時略差;批次越小雜訊大、更新快但震盪。

怎麼降低梯度變異的負面影響?

用動量平滑方向、適度加大批次、學習率衰減、梯度裁剪(防爆炸),以及 Adam 等自適應優化器。

變異和偏誤怎麼權衡?

大批次低變異但可能收斂到較差的平坦度;小批次高變異卻常泛化更好;需依任務調批次與學習率取平衡。

🧭 相關主題

← 返回 AI 學習與考證地圖