深度 Actor-Critic 把強化學習拆成兩半:Actor 決定動作、Critic 評估好壞。
兩者邊演邊評、互相進步——AlphaGo 正是這套思路的巔峰。
深度 Actor-Critic 把強化學習拆成兩個角色:Actor(演員 / 策略)決定「現在該做什麼動作」;Critic(評論家 / 價值)則評估「這個狀態 / 動作有多好」。Actor 根據 Critic 的評分調整自己的策略,Critic 根據實際結果修正自己的評分——兩者邊演邊評、互相進步。
輸入狀態,輸出「動作的機率分布」。它想最大化 Critic 給的評分,逐步學會更聰明的下法。
輸入狀態,輸出「預期能拿多少獎勵」。它用實際回報校正自己,再回頭指導 Actor。
A2C / A3C 是它的同步 / 非同步版本;AlphaGo 則把這套思路 + 蒙特卡洛樹搜尋推到極致,在圍棋上擊敗世界冠軍。
一個探員要從左下走到右上的寶藏。按「學習一回合」:Actor 嘗試路線,Critic 給每格打分(顏色越綠=價值越高)。隨著回合增加,價值圖逐漸成形,Actor 的路線也越走越直。
綠色越深=Critic 認為越接近寶藏(價值越高)。Actor 沿著價值升高的方向走,路線就越來越短——這就是「評論家指導演員」。
深度 Actor-Critic 用神經網路同時近似策略(Actor)與價值(Critic),是現代深度強化學習主流之一。重點:Critic 提供優勢(advantage)訊號指導 Actor 更新,兼顧策略法的彈性與價值法的穩定。易混點:深度版易不穩,需經驗回放、目標網路或裁剪等技巧;與 DQN(純價值法)路線不同。情境:複雜環境的連續控制與大型遊戲 AI。
想練情境題與詳解 → AI 學習與考證地圖
用神經網路同時近似 Actor(策略)與 Critic(價值)的強化學習法,能處理高維狀態(如影像)與連續動作。
狀態空間龐大或連續時無法用表格;深度網路能從原始輸入泛化、學出策略與價值函數,AlphaGo 等即用此思路。
用經驗回放、目標網路、優勢標準化、梯度裁剪、熵正則化等;PPO 用裁剪限制更新幅度提升穩定。
用 DDPG、TD3、SAC 等:Actor 直接輸出連續動作值或其分布、Critic 估 Q 值,適合機器人控制等。
DQN 只學價值、適合離散動作;Actor-Critic 同時學策略與價值、能處理連續動作,且策略可直接輸出機率。