深度學習 · 超參數

學習率 Learning Rate

每次更新「跨多大步」的旋鈕——太小龜速前進,太大踩空發散,只有剛剛好才能又快又穩地收斂。

步伐大小太小很慢太大發散學習率排程warmup

💡一句話定義

學習率(Learning Rate, η)= 梯度下降時每次參數更新跨多大步。它是深度學習最重要的超參數之一,直接決定模型能不能收斂、收斂得多快。

公式 w ← w − η·梯度 裡的那個 η 就是學習率。梯度告訴你方向,學習率決定步伐——步伐挑得好不好,往往比模型架構更影響成敗。

🚶用「下樓梯」來想

下一座很高的樓梯到最低層:步伐太小(每次一公分)方向雖對,但慢得要命,還可能卡在半路的平台;步伐剛好離底層遠時大步、快到時自動放小,平穩落地;步伐太大一腳跨過整層樓,直接踩空、越滾越遠——這就是發散

🎮互動:太小 / 剛好 / 太大

三顆球都從左上高處出發,只有學習率不同。看「過小」龜速爬、「適中」漂亮收斂到谷底、「過大」直接暴走飛出畫面。

機器學習核心:學習率 (Learning Rate)
看懂模型訓練時的「步伐大小」如何決定成敗
最佳準確率 (誤差=0) 更新次數:0 當前誤差:10000
請點擊上方的按鈕,開始觀察模型的訓練過程!

📊三種學習率一次看懂

學習率現象後果
太小每步移動極少收斂很慢、浪費資源,易卡在不好的點
適中遠時大步、近時小步快速且穩定收斂(理想)
太大跨過谷底來回跳震盪;再大則發散、誤差爆表
起手式:用 Adam 時常從 1e-3(0.001)起步,再依損失曲線微調。

📉學習率排程(Schedule)

不必整場用固定學習率,可以讓它隨訓練動態變化,通常更穩更快:

🪜逐步衰減
每隔幾個 epoch 把學習率乘上係數變小,後期更精細。
🌊餘弦退火
依餘弦曲線平滑地從大降到小,收尾更漂亮。
🔥Warmup
初期先用小學習率暖身,避免一開始梯度不穩就發散。
🔎LR range test
從小到大掃描學習率、看損失變化,找到合適範圍。

🔥為什麼大模型要 warmup?

訓練初期參數是隨機的、梯度很不穩,若一開始就用大學習率,很容易直接發散。Warmup 先用很小的學習率「暖身」幾百步,等模型進入狀況後再拉到正常值、之後再衰減。這在大模型、大批次(如 Transformer)訓練中幾乎是標配。

自我檢測

Q1. 學習率在梯度下降公式裡是哪一個?
w ← w − η·梯度 裡的 η。梯度決定「往哪走」,學習率 η 決定「一步跨多大」。
Q2. 學習率太大、太小分別會怎樣?
太小:收斂很慢、浪費資源、易卡住。太大:跨過谷底來回震盪;再大會發散、誤差爆表。要找剛剛好的範圍或用排程。
Q3. 什麼是學習率排程?舉幾個例子。
訓練中動態調整學習率,例如逐步衰減、餘弦退火、warmup(先小後正常再衰減)。通常能更穩更快收斂、提升表現。
Q4. 為什麼大模型訓練常先 warmup?
初期參數隨機、梯度不穩,直接用大學習率容易發散。先用小學習率暖身,穩定後再提高,在大批次/大模型訓練尤其常見。

🎯重點整理

📝 iPAS 考點提醒

學習率是深度學習最重要的超參數,iPAS 高頻考點(中級科目三)。重點:每次參數更新的步伐大小,直接決定能否收斂與收斂速度。易混點:太大震盪或發散、太小收斂慢卡住;學習率排程(逐步衰減、餘弦退火、warmup)常能更穩更快。情境:大模型或大批次常先用 warmup 暖身(初期梯度不穩),Adam 常以 1e-3 起步再微調。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

學習率是什麼?

每次參數更新的步伐大小;是最重要的超參數之一,直接決定能否收斂與收斂速度,常以 1e-3 起步調。

太大或太小的後果?

太大會震盪、發散、錯過最低點;太小收斂慢、卡在不好的點。需找剛剛好的範圍,或用排程動態調整。

什麼是學習率排程?

訓練中動態調整學習率,如逐步衰減、餘弦退火、warmup(先小後大再衰減);常能更穩更快收斂、提升表現。

怎麼找好的學習率?

用學習率範圍測試(LR range test)、從小到大掃描看損失,或依經驗(Adam 常用 1e-3)再微調;搭配驗證集評估。

為什麼有時要 warmup?

訓練初期參數隨機、梯度不穩,先用小學習率暖身,避免一開始就發散;在大模型與大批次訓練尤其常見。

🧭 相關主題

← 返回 AI 學習與考證地圖