依梯度決定「往哪走、走多大步」以最小化損失函數。不同優化器=不同的步伐策略:有的加慣性、有的自動調步幅。
Adam 幾乎免調參、上手就能用,適合大多數情況與快速實驗;SGD+Momentum 調得好時泛化常更佳,經典 CV 訓練常用。
它把「所有」歷史平方梯度累積在分母、只增不減,學習率遲早衰竭到近乎零;RMSProp 改用指數移動平均解決此問題。
AdamW 把權重衰減(L2 正則化)從梯度更新中解耦、單獨執行,正則化效果才正確;Transformer 與大模型幾乎都用 AdamW。
太大會震盪甚至發散;太小收斂龜速又容易卡在淺谷。實務標配是 Warmup 起步+Cosine/Step 衰減收尾。