Deep Reinforcement Learning

深度強化學習

強化學習負責「怎麼做決定」,深度學習負責「看懂這團亂世界」。
兩個一合體,就生出了打爆人類棋王的 AlphaGo。

—— 犬蔥評論 · AI 打電動封神特輯

還記得強化學習那集嗎?Q-Learning 靠一張「Q 表」把每個狀態該幹嘛全記下來。聽起來很聰明,直到——你叫它去下圍棋。

圍棋的盤面有 10 的 170 次方種,比全宇宙的原子還多;電動畫面每一幀都長不一樣。這種 Q 表大到什麼程度?你把整個宇宙拿來當硬碟都存不下。查表流,當場破產。

怎麼救?把那張查不完的表,換成一個神經網路。不背了,改用深度網路去「感覺」——瞄一眼盤面,直接憑直覺估出該怎麼走。這就是深度強化學習:讓深度學習,當強化學習的那雙眼睛跟那顆直覺。這集我們看四位狠角色——把表換成網路的 DQN、穩到封神的 PPO、演員評論家深度版,以及那個名字你一定聽過的 AlphaGo

價值派 · 深度進化

第一步:把那張表,燒掉

Q 表存不下,那就別存了——改請一個神經網路,看畫面「憑感覺」估分數。

01

Deep Q-Learning

DQN · 深度 Q 網路
「別查表了,查到天荒地老——請個神經網路,瞄一眼畫面就估出每一招值幾分。」

DQN 是深度強化學習的開山祖師(DeepMind 拿它玩 Atari 電動,一戰成名)。它把那張塞不下的 Q 表,換成一個神經網路:輸入遊戲畫面,輸出每個動作的分數。畫面再複雜,網路都能「感覺」出來。

但把強化學習接上深度網路,超容易訓練到崩潰。DQN 靠兩個保命招穩住:經驗回放(把過去的經歷存進小本本,隨機抽出來複習,打破前後資料的相依),還有目標網路(留一個比較穩的分身當參考,免得自己一直追著自己的影子跑,越追越暈)。

評估指標 累積獎勵、遊戲分數、收斂穩定度、樣本效率
DQN 很猛,但它只擅長「選項有限」的場面——上、下、開火。
一旦遇到「轉幾度、油門踩多深」這種無限多選項,或你只是單純想要訓練更穩,
就得換策略派的深度版上場了。
策略派 · 深度主力

第二步:別估分了,直接學怎麼動

從「先幫每招打分」轉成「直接學一套身手」,還想盡辦法讓訓練別再暴起暴落、心電圖亂跳。

02

Actor-Critic (Deep)

深度演員—評論家
「一個負責演、一個負責在旁邊嫌——兩個都升級成神經網路的雙人組。」

還記得強化學習那集的演員評論家嗎?這是它的深度化身:Actor(演員)是一張網路,負責決定動作;Critic(評論家)是另一張網路,在旁邊即時打分、嫌東嫌西、糾正演員。兩張網路一起練,既吃到價值派的穩,又拿到策略派的靈活。

它是現代深度強化學習的萬用底盤——A2C、A3C、DDPG、SAC 全長在這架構上,能玩連續動作,是機器人控制、遊戲 AI 的中流砥柱。

評估指標 平均回報、Actor / Critic 損失、訓練穩定度、樣本效率
03

PPO

近端策略最佳化
「更新策略時,不准一步跨太大——穩,不激進,就是它稱霸江湖的秘訣。」

策略派最大的病是訓練不穩:一步更新太貪心,整套策略當場崩給你看。PPO 的解法優雅到不行——它幫每次更新繫上一條安全帶:新策略跟舊策略的差距,不准超過一個範圍(用裁剪硬拉住)。一小步一小步慢慢改,穩紮穩打,絕不暴衝。

簡單、穩定、又好用,PPO 幾乎成了深度強化學習的預設首選。冷知識:ChatGPT 用人類回饋調教自己(RLHF)的背後,靠的也是它。低調,但影響力大到嚇人。

評估指標 平均回報、KL 散度(策略變化量)、訓練穩定度
零件全湊齊了:深度網路當眼睛、策略最佳化當大腦。
把它們全兜起來,再加上一招「自己跟自己下到天亮」的狠勁——
一個震撼全世界的名字,就此誕生。
封神之作

第三步:集大成,然後改寫歷史

當所有技術兜在一起,深度強化學習交出了一張讓全人類倒抽一口氣的成績單。

04

AlphaGo

DeepMind · 圍棋封神
「深度網路 + 強化學習 + 自己跟自己下棋——然後,它把人類棋王打哭了。」

2016 年,AlphaGo 擊敗世界頂尖棋士李世乭,是深度強化學習寫進歷史課本的一刻。它把三樣東西縫在一起:深度神經網路(看懂盤面、估算勝率)、蒙地卡羅樹搜尋(往下推演幾十步)、以及強化學習的自我對弈

後來的 AlphaGo Zero 更狂——人類棋譜?一頁都不看,從零開始自己跟自己下,幾天內就把所有前輩踩在腳下。它證明了一件毛骨悚然的事:只要框架對了,機器能靠自我博弈,悟出連人類幾千年都沒想到的招。

評估指標 勝率、Elo 等級分、對頂尖人類 / AI 的戰績
Reality Check · 那排紅點

「看起來會了」跟「真的穩」,是兩回事

深度強化學習惡名昭彰的一點:它常常訓練到一半,毫無預警地把自己玩壞。

累積獎勵是根本

每一局撈到的總回報有沒有一路往上爬,是最直接的成績單——但要多跑幾次取平均,別被一次好運騙了。

穩定度才是死穴

深度 RL 最愛的戲碼:練到一半突然崩盤。學習曲線平不平順,比它衝出的最高分還重要。

樣本效率

要玩幾百萬局才學會?在真實機器人上,每次互動都是燒錢,越省越是真本事。

對局 / Elo

像 AlphaGo 這種對抗場,直接看勝率跟 Elo 等級分,跟人類或別的 AI 真刀真槍幹一場。