📊 Q 值 Q-value · iPAS RL 核心
Q 值:每個「狀態+動作」值幾分?又怎麼穩穩學到準?
Q 值是強化學習的核心——它幫每個「在某狀態做某動作」打一個分數,代表長期划不划算。學好整張 Q 表,每步挑分數最高的動作就是好策略。這頁也帶你看 Q 值怎麼收斂、學習率 α 如何影響穩定性。
Q(s,a)Q vs VBellman 更新學習率 α收斂穩定
📒 一、Q 值是什麼?
Q(s, a)=在狀態 s 採取動作 a、之後一路依策略走下去,所能拿到的預期累積獎勵。
🍜 比喻:一張「美食地圖評分」
Q 表就像一張評分地圖:在
某家店(狀態 s)點
某道菜(動作 a),預期會有多滿意(含這餐之後的後續發展)。分數越高=越值得做。
學好整張表後,
每個狀態都挑 Q 最大的動作,就是(近似)
最佳策略。Q 值衡量的是
長期價值——它估的正是
累積獎勵的期望。
⚖️ 二、Q 值 vs V 值(狀態價值)
| V(s) 狀態價值 | Q(s, a) 動作價值 |
| 問的問題 | 「在這個狀態有多好?」 | 「在這狀態先做某動作有多好?」 |
| 有沒有指定動作 | 否(看整體策略) | 是(多指定了動作 a) |
🧠 兩者的關係
V(s) 是「各動作 Q 值的策略加權平均」。若採貪心策略(每步挑最好),則 V(s) = maxa Q(s, a)。簡單說:Q 比 V 多了「先選哪個動作」這層資訊,所以能直接拿來選動作。
🔄 三、Q 值怎麼學?(Bellman / TD)
不是一次算好,而是邊試邊修。每走一步,用一個「目標」把舊估計往真值拉一點:
Q(s,a) ← Q(s,a) + α · [ 目標 − Q(s,a) ]
目標 = r + γ · max Q(s′, a′)
α=學習率(修多大) r=即時獎勵 γ=折扣因子
這就是 Q-Learning 的更新法。重點在那個 α——它決定每次「修多用力」,而這正是下面 demo 要玩的東西。
🎮 四、動手玩:學習率 α 怎麼影響「收斂」
📜 情境
有個動作的真實平均價值是 100,但每次嘗試的回報會在 70~130 之間隨機跳動(雜訊)。看不同的學習率 α,怎麼影響 AI 心中「預估 Q 值」的軌跡。橘色虛線是真值 100。
α=0.9 (不穩定)
α=0.05 (收斂慢)
遞減 α (完美收斂)
🗺️ 怎麼看(依序點三個按鈕疊著比較)
紅(α=0.9):反應太快,被每次雜訊牽著走、劇烈上下震盪,停不下來。
藍(α=0.05):太固執,每次只挪一點點,爬得超慢、半天到不了 100。
綠(遞減 α):一開始學得快、後期穩下來 → 漂亮地收斂、停在 100。這就是理想設定。
🎚️ 五、學習率 α 的取捨
α 大(快但抖)更新猛、學得快,但會追著雜訊跑、震盪不穩。
α 小(穩但慢)更新溫和、很穩,但收斂太慢,要跑很久。
α 遞減(最佳)先大後小:早期快速接近、後期細修穩定——Q 值收斂的關鍵技巧。
🎯 六、什麼叫「Q 值收斂」?穩定性靠什麼
收斂=估計值穩定逼近真值、不再大幅亂跳
除了學習率 α,Q 值能不能穩定收斂還受幾件事影響:探索是否充分(每個狀態動作都要試夠多次)、獎勵的雜訊大小、折扣因子 γ。
⚠️ 表格 vs 神經網路(DQN)
表格型 Q-Learning 在適當條件下保證收斂到最優 Q。但改用神經網路近似 Q(DQN)時容易不穩、發散,所以要靠 經驗回放(Experience Replay)和目標網路(Target Network)來穩定訓練。
🛠️ 七、學好 Q 之後怎麼用?
📌 選動作與大狀態空間
選動作:學好 Q 後,每個狀態挑 max Q 的動作就是近似最優策略;訓練中用 ε-greedy 偶爾隨機探索,以免錯過更好的動作。
狀態太多?用表格存每個狀態動作的 Q 值,狀態一多(如遊戲畫面)就存不下 → 改用 DQN 用神經網路近似 Q 函數,能泛化到沒見過的狀態。
🧪 八、觀念自我檢測
先想再點開。
Q1. Q(s, a) 代表什麼?
在狀態 s 採動作 a、之後依策略的預期累積獎勵,衡量這個狀態動作多划算。
Q2. Q 值和 V 值差在哪?
V(s) 不指定動作;Q(s,a) 多指定「先做 a」。V 是各動作 Q 的策略加權平均(貪心時 V=max Q)。
Q3. 學習率 α 太大會怎樣?
更新被雜訊牽著跑,估計劇烈震盪、不穩定,無法收斂。
Q4. 怎樣的 α 能穩定收斂?
遞減 α(先快後穩)——早期快速接近、後期細修。
Q5. 狀態太多、表格存不下怎麼辦?
用 DQN 以神經網路近似 Q,並加經驗回放、目標網路穩定訓練。
✅ 九、30 秒重點整理
Q(s,a)=動作價值該狀態動作的預期累積獎勵。
Q vs VQ 多指定動作;V=Q 的策略加權平均。
邊試邊修Q←Q+α(目標−Q),目標=r+γmaxQ′。
α 大抖、小慢遞減 α 最穩。
收斂估計穩定逼近真值。
大狀態用 DQN神經網路近似 Q。
📝 iPAS 考點提醒
Q 值是強化學習的核心概念(初級科目一 RL),代表在某狀態採取某行動的預期長期回報。重點:Q-learning 用 Bellman 方程迭代更新 Q 值,收斂後選 Q 最大的行動即最佳策略,屬離策略(off-policy)方法。易混點:Q-learning 用下一狀態的最大 Q 更新(較貪心)、SARSA 用實際採取的行動更新(較保守),兩者常被搞混。情境:格子世界、路徑規劃。
想練情境題與詳解 → AI 學習與考證地圖
❓ 常見問題
Q 值(Q-value)是什麼?
Q(s,a) 表示在狀態 s 採取動作 a、之後依某策略所能得到的期望累積獎勵;衡量在這個狀態做這個動作有多好。
Q 值和狀態價值 V 差在哪?
V(s) 是在狀態 s 依策略的期望回報(不指定動作);Q(s,a) 多指定了先做動作 a。關係:V(s) 是各動作 Q 的策略加權平均。
怎麼用 Q 值選動作?
學好 Q 後,每個狀態選 Q 最大的動作就是近似最優策略;探索時用 ε-greedy 偶爾隨機。
Q 值怎麼學?
用貝爾曼方程的時序差分更新(如 Q-learning):以即時獎勵加折扣乘下一狀態最佳 Q 當目標,逐步逼近真實 Q。
表格 Q 和函數近似差在哪?
表格存每個狀態動作的 Q、狀態多就不可行;用神經網路近似 Q(如 DQN)能泛化、處理高維狀態。