🤖 Q-Learning 強化學習 · iPAS 考點

Q-Learning:讓機器人靠「試錯+獎勵」自己學會走迷宮

沒有人教它正確路線。機器人在迷宮裡亂走、踩到陷阱扣分、找到寶藏加分,幾十回合後就自己學出最短路徑。這就是強化學習,而 Q-Learning 是它最經典的入門演算法。

強化學習 RL狀態·動作·獎勵Q 值Bellman 更新ε-greedy 探索

🐕 一、強化學習和「監督式」差在哪?

這是 RL 最該先搞懂的一件事。

監督式學習強化學習 (RL)
有標準答案?有(每筆資料附正確標籤)沒有,只有「獎勵」回饋
怎麼學照著標籤對答案與環境互動、試錯
目標預測對就好最大化長期累積獎勵

🦴 生活比喻:訓練狗狗

你不會給狗一本「動作標準答案」。牠做對 → 給零食(獎勵),做錯 → 沒零食。試幾次,狗就學會了。RL 的機器人(agent)就是這隻狗:靠獎勵自己摸索出該怎麼做。

🧩 二、RL 的五個關鍵詞(對照迷宮)

Agent 代理人學習的主角=迷宮裡的機器人
Environment 環境機器人身處的世界=迷宮地圖
State 狀態目前的處境=機器人所在的格子
Action 動作可做的選擇=上、下、左、右
Reward 獎勵環境的回饋=寶藏 +100、陷阱 −100、走一步 −1

📒 三、Q 值:機器人的「小抄」

Q(s, a)=在狀態 s 做動作 a,划不划算

Q(s, a) 代表:在格子 s、往方向 a 走,之後一路依最佳走法,預期能拿到的「長期總獎勵」。
機器人心裡有一張 Q 表(Q-Table),記著每格、每個方向的 Q 值。學好之後,每格都選 Q 最大的方向走,就是最佳策略。

🎮 四、動手玩:看「綠色通道」長出來

按「開始訓練」,機器人會一回合一回合地試。每格的三角形就是 Q 表:綠=往那走有好事、紅=那是死路或陷阱。

回合: 0 步數: 0 本局得分: 0
寶藏 (+100)
陷阱 (-100)
機器人

🗺️ 怎麼看這張圖

格子裡的三角形=機器人的大腦(Q-Table),每個三角形是往那個方向的「價值」:越綠/亮=認為那邊有好事,越紅/暗=死路或陷阱。一開始全是灰暗的(什麼都不知道);掉進陷阱 → 那條路徑變紅、吃到寶藏 → 回推路徑變綠。跑約 20~30 回合,你會看到一條明顯的「綠色通道」——那就是它學會的最短路!

🔄 五、Q 值怎麼更新?Bellman 方程

每走一步,機器人就用這條公式微調剛剛那格的 Q 值:

Q(s, a) ← Q(s, a) + α · [ r + γ · max Q(s′, a′) − Q(s, a) ] α=學習率 r=即時獎勵 γ=折扣因子 s′=下一個狀態

白話拆解

中括號裡是「目標 − 現況」:目標=這步拿到的即時獎勵 r + 折扣後的「下一格最好的 Q 值」(γ·maxQ)。把現在的 Q 往這個目標修一點點(修多少由 α 決定)。一步步修,整張 Q 表就越來越準。

🎛️ 六、兩個超參數:α 與 γ

α 學習率(Learning Rate)每次更新「修多大」。太大→學很快但不穩、來回震盪;太小→學很慢。
γ 折扣因子(Discount Factor)0~1有多重視「未來」。越接近 1 越看長遠(願為遠處寶藏忍受沿路扣分);越接近 0 越短視、只顧眼前。

🧭 七、探索 vs 利用(ε-greedy)

機器人的兩難

利用(Exploit):每次都走目前已知最好的路 → 但可能錯過更短的新路
探索(Explore):偶爾隨機亂走 → 才有機會發現更好的路
解法 ε-greedy:以小機率 ε 隨機探索,其餘時間選最佳動作。demo 上方的 Epsilon 滑桿就是它——調高會看到機器人更常「不走尋常路」。常見做法是「先大後小」:剛開始多探索,學會後再降低、專心利用。

🆚 八、延伸:SARSA 與 DQN

比較Q-LearningSARSA
更新用哪個動作下一格的 最大 Q(不管實際怎麼走)下一步實際採取的動作
策略類型Off-policy(離策略)On-policy(同策略)
風格較貪心、找最優較保守、考慮探索風險

📌 狀態太多怎麼辦?→ DQN

Q 表用「格子」存還行,但若狀態是遊戲畫面的每個像素,表格大到存不下。DQN 改用神經網路近似 Q 函數,再加「經驗回放、目標網路」穩定訓練,能處理超大狀態空間。相關:SARSA累積獎勵與 Q 值收斂

🧪 九、觀念自我檢測

先想再點開。

Q1. RL 和監督式學習最大的差別?

RL 沒有標籤,靠獎勵試錯,目標是最大化長期累積獎勵

Q2. Q(s, a) 代表什麼?

在狀態 s 採動作 a、之後依最佳策略所能得到的預期長期累積獎勵

Q3. Bellman 更新拿什麼當「目標」?

即時獎勵 r + γ × 下一狀態的最大 Q 值,再把現有 Q 往這目標修 α 比例。

Q4. γ(折扣因子)越大代表什麼?

重視長遠未來的獎勵;越小越短視、只顧眼前。

Q5. ε-greedy 在平衡什麼?

探索 vs 利用:以機率 ε 隨機探索新路、其餘選目前最佳。

Q6. Q-Learning 與 SARSA 差在哪?

Q-Learning 用下一格最大 Q 更新(off-policy、貪心);SARSA 用實際採取的動作更新(on-policy、保守)。

✅ 十、30 秒重點整理

RL=獎勵試錯無標籤,最大化長期累積獎勵。
五要素Agent/環境/狀態/動作/獎勵。
Q(s,a)=小抄該狀態動作的預期長期回報。
Bellman 更新目標=r+γ·maxQ′,修 α 比例。
ε-greedy平衡探索與利用。
延伸off-policy;SARSA(on-policy)、DQN(神經網路)。

📝 iPAS 考點提醒

Q-Learning 是強化學習的經典演算法,iPAS RL 考點(初級科目一)。重點:用 Bellman 方程迭代更新 Q 值(狀態與行動的預期長期回報),收斂後選 Q 最大的行動即最佳策略,屬離策略(off-policy)。易混點:Q-learning 用下一狀態的最大 Q 更新(較貪心)、SARSA 用實際採取的行動更新(較保守、on-policy),兩者常被對比。情境:格子世界、路徑規劃。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

強化學習(RL)和監督式學習差在哪?

監督式有正確答案(標籤)可學;RL 沒有標準答案,代理人透過與環境互動、依獎勵試錯,學會能最大化長期累積獎勵的策略。

Q 值(Q-value)是什麼?

Q(s,a) 代表在狀態 s 採取動作 a、之後依最佳策略所能獲得的預期累積獎勵。學好 Q 值後,每步選 Q 最大的動作就是好策略。

Q-learning 怎麼更新?

用時序差分更新:以「即時獎勵 r + 折扣 γ × 下一狀態的最佳 Q 值」當目標,修正目前的 Q(s,a)。α 是學習率(更新幅度)、γ 是折扣因子(越大越重視長期)。

探索與利用的取捨是什麼?

只利用目前已知最好的動作可能錯過更優解,需保留探索新動作。常用 ε-greedy:以小機率 ε 隨機探索、其餘時間選最佳。

Q-learning 和 DQN 的關係?

傳統 Q-learning 用表格存每個狀態動作的 Q 值,狀態太多就不可行;DQN 用神經網路近似 Q 函數,並加經驗回放與目標網路穩定訓練,能處理像素等大狀態空間。

🧭 相關主題

← 返回 AI 學習與考證地圖