強化學習負責「怎麼做決定」,深度學習負責「看懂這團亂世界」。
兩個一合體,就生出了打爆人類棋王的 AlphaGo。
還記得強化學習那集嗎?Q-Learning 靠一張「Q 表」把每個狀態該幹嘛全記下來。聽起來很聰明,直到——你叫它去下圍棋。
圍棋的盤面有 10 的 170 次方種,比全宇宙的原子還多;電動畫面每一幀都長不一樣。這種 Q 表大到什麼程度?你把整個宇宙拿來當硬碟都存不下。查表流,當場破產。
怎麼救?把那張查不完的表,換成一個神經網路。不背了,改用深度網路去「感覺」——瞄一眼盤面,直接憑直覺估出該怎麼走。這就是深度強化學習:讓深度學習,當強化學習的那雙眼睛跟那顆直覺。這集我們看四位狠角色——把表換成網路的 DQN、穩到封神的 PPO、演員評論家深度版,以及那個名字你一定聽過的 AlphaGo。
Q 表存不下,那就別存了——改請一個神經網路,看畫面「憑感覺」估分數。
DQN 是深度強化學習的開山祖師(DeepMind 拿它玩 Atari 電動,一戰成名)。它把那張塞不下的 Q 表,換成一個神經網路:輸入遊戲畫面,輸出每個動作的分數。畫面再複雜,網路都能「感覺」出來。
但把強化學習接上深度網路,超容易訓練到崩潰。DQN 靠兩個保命招穩住:經驗回放(把過去的經歷存進小本本,隨機抽出來複習,打破前後資料的相依),還有目標網路(留一個比較穩的分身當參考,免得自己一直追著自己的影子跑,越追越暈)。
從「先幫每招打分」轉成「直接學一套身手」,還想盡辦法讓訓練別再暴起暴落、心電圖亂跳。
還記得強化學習那集的演員評論家嗎?這是它的深度化身:Actor(演員)是一張網路,負責決定動作;Critic(評論家)是另一張網路,在旁邊即時打分、嫌東嫌西、糾正演員。兩張網路一起練,既吃到價值派的穩,又拿到策略派的靈活。
它是現代深度強化學習的萬用底盤——A2C、A3C、DDPG、SAC 全長在這架構上,能玩連續動作,是機器人控制、遊戲 AI 的中流砥柱。
策略派最大的病是訓練不穩:一步更新太貪心,整套策略當場崩給你看。PPO 的解法優雅到不行——它幫每次更新繫上一條安全帶:新策略跟舊策略的差距,不准超過一個範圍(用裁剪硬拉住)。一小步一小步慢慢改,穩紮穩打,絕不暴衝。
簡單、穩定、又好用,PPO 幾乎成了深度強化學習的預設首選。冷知識:ChatGPT 用人類回饋調教自己(RLHF)的背後,靠的也是它。低調,但影響力大到嚇人。
當所有技術兜在一起,深度強化學習交出了一張讓全人類倒抽一口氣的成績單。
2016 年,AlphaGo 擊敗世界頂尖棋士李世乭,是深度強化學習寫進歷史課本的一刻。它把三樣東西縫在一起:深度神經網路(看懂盤面、估算勝率)、蒙地卡羅樹搜尋(往下推演幾十步)、以及強化學習的自我對弈。
後來的 AlphaGo Zero 更狂——人類棋譜?一頁都不看,從零開始自己跟自己下,幾天內就把所有前輩踩在腳下。它證明了一件毛骨悚然的事:只要框架對了,機器能靠自我博弈,悟出連人類幾千年都沒想到的招。
深度強化學習惡名昭彰的一點:它常常訓練到一半,毫無預警地把自己玩壞。
每一局撈到的總回報有沒有一路往上爬,是最直接的成績單——但要多跑幾次取平均,別被一次好運騙了。
深度 RL 最愛的戲碼:練到一半突然崩盤。學習曲線平不平順,比它衝出的最高分還重要。
要玩幾百萬局才學會?在真實機器人上,每次互動都是燒錢,越省越是真本事。
像 AlphaGo 這種對抗場,直接看勝率跟 Elo 等級分,跟人類或別的 AI 真刀真槍幹一場。