A2C · A3C · AlphaGo

Actor-Critic

演員負責行動,評論家負責打分

深度 Actor-Critic 把強化學習拆成兩半:Actor 決定動作、Critic 評估好壞。
兩者邊演邊評、互相進步——AlphaGo 正是這套思路的巔峰。

Actor: π(a|s) · Critic: V(s) · 用 V 指導 π
01 — 白話直覺

一個負責行動,一個負責打分

深度 Actor-Critic 把強化學習拆成兩個角色:Actor(演員 / 策略)決定「現在該做什麼動作」;Critic(評論家 / 價值)則評估「這個狀態 / 動作有多好」。Actor 根據 Critic 的評分調整自己的策略,Critic 根據實際結果修正自己的評分——兩者邊演邊評、互相進步。

🎭 Actor(策略)

輸入狀態,輸出「動作的機率分布」。它想最大化 Critic 給的評分,逐步學會更聰明的下法。

🧮 Critic(價值)

輸入狀態,輸出「預期能拿多少獎勵」。它用實際回報校正自己,再回頭指導 Actor。

A2C / A3C 是它的同步 / 非同步版本;AlphaGo 則把這套思路 + 蒙特卡洛樹搜尋推到極致,在圍棋上擊敗世界冠軍。

02 — 核心互動

看 Actor 與 Critic 邊演邊學

一個探員要從左下走到右上的寶藏。按「學習一回合」:Actor 嘗試路線,Critic 給每格打分(顏色越綠=價值越高)。隨著回合增加,價值圖逐漸成形,Actor 的路線也越走越直。

回合數
0
本回合步數
Critic 已學格數
0

綠色越深=Critic 認為越接近寶藏(價值越高)。Actor 沿著價值升高的方向走,路線就越來越短——這就是「評論家指導演員」。

03 — 優缺點

深度 Actor-Critic 的特性

優點

  • 結合價值與策略,比純策略梯度穩定
  • 能處理連續動作與超大狀態空間
  • A3C 可平行加速;AlphaGo 等級的成就

缺點 / 限制

  • 兩個網路同時訓練,調參較難
  • 對超參數與獎勵設計敏感
  • 樣本需求大,訓練不穩時容易崩潰

典型應用場景

♟️
棋類 AI
AlphaGo / AlphaZero 圍棋、西洋棋
🎮
遊戲 AI
星海、Atari 等複雜環境
🤖
機器人控制
連續動作的運動控制

📝 iPAS 考點提醒

深度 Actor-Critic 用神經網路同時近似策略(Actor)與價值(Critic),是現代深度強化學習主流之一。重點:Critic 提供優勢(advantage)訊號指導 Actor 更新,兼顧策略法的彈性與價值法的穩定。易混點:深度版易不穩,需經驗回放、目標網路或裁剪等技巧;與 DQN(純價值法)路線不同。情境:複雜環境的連續控制與大型遊戲 AI。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

深度 Actor-Critic 是什麼?

用神經網路同時近似 Actor(策略)與 Critic(價值)的強化學習法,能處理高維狀態(如影像)與連續動作。

為什麼用深度網路?

狀態空間龐大或連續時無法用表格;深度網路能從原始輸入泛化、學出策略與價值函數,AlphaGo 等即用此思路。

訓練常見的不穩定怎麼處理?

用經驗回放、目標網路、優勢標準化、梯度裁剪、熵正則化等;PPO 用裁剪限制更新幅度提升穩定。

連續動作怎麼處理?

用 DDPG、TD3、SAC 等:Actor 直接輸出連續動作值或其分布、Critic 估 Q 值,適合機器人控制等。

和 DQN 差在哪?

DQN 只學價值、適合離散動作;Actor-Critic 同時學策略與價值、能處理連續動作,且策略可直接輸出機率。

🧭 相關主題

← 返回 AI 學習與考證地圖