訓練時我們用一小批資料估計該往哪走(梯度)。每批不一樣,估出的方向就會在真方向附近上下抖動——這就是梯度方差(雜訊)。它有好有壞:適量能幫忙跳出陷阱,太多則讓訓練震盪、學不穩。
SGD(隨機梯度下降)用小批次估計「整體」該走的方向。每批資料不同,估計值就會在真實梯度附近波動——這波動就是梯度方差。
| 比較 | 大批次 | 小批次 |
|---|---|---|
| 梯度方差 | 低(穩) | 高(抖) |
| 每步速度 | 慢(算得多) | 快 |
| 更新軌跡 | 平滑 | 震盪 |
| 泛化 | 有時略差(易卡尖銳谷底) | 常更好(雜訊當正則化) |
先想再點開。
SGD 用小批次估計整體梯度,每批資料不同 → 估計值在真方向附近波動。
大批次=低變異、穩但慢;小批次=高變異、快但震盪(雜訊 ~ 1/√N)。
不是。適度能跳出鞍點/壞局部最小、有正則化效果;太大才會震盪難收斂。
把回報減基準只留相對優劣訊號,大幅降變異且不改變期望方向(無偏)。
動量、學習率衰減、梯度裁剪、Adam、適度加大批次。
梯度變異是隨機梯度下降(SGD)的固有現象,iPAS 訓練機制考點(中級科目三)。重點:用小批次估計整體梯度,每批不同使估計值在真實梯度附近上下波動(雜訊)。易混點:適度雜訊有助跳出鞍點與壞局部最小、有正則化效果,但太大會震盪難收斂;批次越大雜訊越小、每步較慢、泛化有時略差。情境:調批次大小與學習率是在偏差與變異間取捨。
想練情境題與詳解 → AI 學習與考證地圖
SGD 用小批次估計整體梯度,每批資料不同,估計值會在真實梯度附近上下波動,這就是梯度變異(雜訊)。
有兩面:適度雜訊能幫忙跳出鞍點與壞的局部最小、有正則化效果;但太大會使訓練震盪、難收斂。
批次越大估計越準、雜訊越小、更新越穩但每步較慢、泛化有時略差;批次越小雜訊大、更新快但震盪。
用動量平滑方向、適度加大批次、學習率衰減、梯度裁剪(防爆炸),以及 Adam 等自適應優化器。
大批次低變異但可能收斂到較差的平坦度;小批次高變異卻常泛化更好;需依任務調批次與學習率取平衡。