AKIRA.IPAS-AI.COM · OPTIMIZER VISUAL FIELD GUIDE

優化器・流體圖鑑

⚠ 此裝置不支援 WebGL,無法顯示 GPU 流體模擬。
下方資訊面板仍可正常瀏覽 7 種優化器的重點整理。
滑鼠 / 手指拖曳可攪動流體
← → 切換 · WEBGL FLUID

❓ 常見問題

優化器是做什麼的?

依梯度決定「往哪走、走多大步」以最小化損失函數。不同優化器=不同的步伐策略:有的加慣性、有的自動調步幅。

SGD 和 Adam 怎麼選?

Adam 幾乎免調參、上手就能用,適合大多數情況與快速實驗;SGD+Momentum 調得好時泛化常更佳,經典 CV 訓練常用。

AdaGrad 為什麼會提早停下來?

它把「所有」歷史平方梯度累積在分母、只增不減,學習率遲早衰竭到近乎零;RMSProp 改用指數移動平均解決此問題。

Adam 和 AdamW 差在哪?

AdamW 把權重衰減(L2 正則化)從梯度更新中解耦、單獨執行,正則化效果才正確;Transformer 與大模型幾乎都用 AdamW。

學習率太大或太小會怎樣?

太大會震盪甚至發散;太小收斂龜速又容易卡在淺谷。實務標配是 Warmup 起步+Cosine/Step 衰減收尾。

🧭 相關主題

← 返回 AI 學習與考證地圖