沒有標準答案,只有一直踩雷、一直吃獎勵。
這是機器學習裡最像「打電動練功」的一派。
前兩集聊的都是「有一堆資料擺在桌上讓你學」。強化學習不一樣——它沒有現成的題庫,而是把一個 AI(Agent)直接丟進一個環境裡,讓它自己動、自己踩雷、自己吃糖。做對了給獎勵,做錯了扣分,它就靠這點回饋慢慢摸出一套活法。
它跟監督式學習最大的差別是:獎勵來得又慢又稀疏。你這一步下的棋,可能要 50 步後才知道是神來一筆還是自殺。所以它得學會「延遲滿足」——為了以後的大獎,忍住眼前的小甜頭。AlphaGo、打電動的 AI、機器人走路,全是它的地盤。
它的門派主要分兩大流:一派信奉價值(先評估每個動作值多少分,再挑最高的),一派信奉策略(乾脆直接學「該怎麼做」)。下面這四位,就是這兩流的代表人物。
核心是學一張「Q 表」——記住在某個狀態下做某個動作,未來大概能撈到多少總獎勵。學會了,每次挑分數最高的那招就對了。
Q-Learning 是價值派的祖師爺。它一格一格更新 Q 值:這步拿到的獎勵,加上「下一步能拿到的最高分」,回頭修正這一步的估計。重點在那個「最高分」——它不管自己實際下一步會不會亂走,永遠拿理論最佳來更新。
這叫 Off-Policy(離策略):探索時可以大膽亂試,學到的卻是最貪心的最優解。膽子大、學得準,但也因此比較敢在懸崖邊冒險。
SARSA 長得跟 Q-Learning 幾乎一樣,只差一個關鍵:更新時它用的是「下一步我實際採取的動作」,而不是理論最高分。它誠實面對自己會亂探索的事實。
這叫 On-Policy(同策略)。結果就是——Q-Learning 敢貼著懸崖走最短路,SARSA 會主動繞遠一點避開危險。想要安全穩健,SARSA 常常更討喜。
不再維護一張 Q 表,而是直接訓練一個「策略」——輸入狀態,輸出「該做什麼動作的機率」。天生擅長處理連續、複雜的動作空間。
策略梯度不算 Q 值,它直接調整動作的機率:這局打得好,就把剛剛那串動作的機率往上推;打得爛,就往下壓。像在訓練直覺,而不是查表。天生能處理連續動作(轉幾度、踩多深),也能學「隨機策略」。
缺點很有名:它常要打完整局才更新一次,回饋雜訊大、抖動嚴重(高變異),學起來慢又不穩。
這是把兩大流派合體的絕招。Actor(演員)負責決定動作(策略派),Critic(評論家)負責即時打分、告訴演員這步好不好(價值派)。演員不用等整局結束,每一步都能被評論家糾正,學得又快又穩,大幅壓低了策略梯度的抖動。
A3C 更狠——開一堆分身平行探索、彼此共享心得,訓練效率再上一層。它是現代深度強化學習的主流骨架之一。
強化學習沒有標準答案,那要怎麼知道它到底變強了沒?答案是——盯著獎勵,而且要盯得夠聰明。
每一局能撈到的總回報(Return)有沒有一路往上走,是最直接的成績單。
學習曲線是平順爬升,還是暴起暴落?強化學習惡名昭彰的一點就是「訓練不穩」。
要玩幾百萬局才學會?同樣的成績,用更少互動達成的模型更值錢。
永遠的兩難:一直用舊招(利用)會錯過更好解,一直亂試(探索)又學不深。平衡好才是高手。