深度強化學習 (DRL) 指標新手村

用神經網路由像素學會神操作!秒懂從「Q表格」到「DQN 與 PPO 雙路線」的驚人躍遷!

從傳統表格到高維度神經網路大腦

白話說明:傳統強化學習(如 Q-learning)是用一張巨大的「Q表格」記錄每一個狀態下做什麼動作最好。但是當環境變成圍棋、或者直接輸入一張遊戲畫面(像素狀態)時,狀態總數多到連宇宙的硬碟都裝不下!此時我們就必須引進「神經網路」取代表格

👇 請切換場景,觀察 AI 大腦結構的進化:

Q表格記錄模式 (狀態極少)

💡 核心技術演進

DQN (Value-based) vs. PPO (Policy-based) 思考模式大不同

神經網絡就位後,科學家分成了兩大流派:Value-based(以 DQN 為首)專注於給動作打分數,選最高分的那個;而 Policy-based(以 PPO 為首)則是跳過分數,直接輸出一個做各動作的機率策略。

👇 點選不同的遊戲突發狀況,觀察兩大路線的內心思考運作:
🔷 Value-based (DQN 路線)
核心目標:估算「每個動作未來的期望總分」
💡 決策結果:選擇分數最高的動作!
🔮 Policy-based (PPO 路線)
核心目標:直接輸出一個「動作機率分佈」
💡 決策結果:依據概率分佈隨機抽樣動作!

🏎️ DQN (Deep Q-Network)

一句話記住:它是個「現實的分數計算機」。它不直接學策略,而是瘋狂地計算如果現在採取動作 A 會有多少甜頭。這種演算法在離散、動作少(如經典馬利歐、小精靈)的遊戲中非常強大。

🪁 PPO (Proximal Policy Optimization)

一句話記住:它是個「直覺的行動派」。它直接調整策略,讓好動作的機率變大、壞動作的機率變小。因為能處理連續動作(如控制機器人手臂旋轉 34.5°),它是目前 Open AI 等機構訓練大型 AI Agent、自駕車的黃金首選。

📝 iPAS 考點提醒

強化學習是 iPAS 機器學習三大類型之一(初級科目一必考),深度強化學習(DRL)用神經網路近似價值或策略。重點:代理人(agent)在環境中靠獎勵試錯,目標是最大化長期累積回報;DRL 讓 RL 能處理高維狀態(如影像、遊戲)。易混點:RL 沒有標籤(與監督式不同)、靠延遲獎勵學習;探索(嘗試新行動)與利用(選已知最佳)要權衡。情境:自駕、機器人、遊戲 AI、推薦排序。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

深度強化學習(DRL)是什麼?

把深度學習與強化學習結合——用神經網路近似策略或價值函數,讓 RL 能處理高維、原始輸入(如影像)的複雜決策問題。

為什麼需要「深度」?

傳統 RL 用表格、狀態一多(如遊戲畫面像素)就爆炸;深度網路能從原始輸入學特徵並泛化,才能應付真實複雜環境。

DRL 有哪些代表性成果?

DQN 玩 Atari、AlphaGo 與 AlphaZero 下圍棋、機器人控制,以及大型語言模型的 RLHF 微調。

DRL 訓練的主要挑戰?

樣本效率低(需大量互動)、訓練不穩、獎勵設計困難、探索難、結果難重現;需經驗回放、目標網路等技巧穩定。

主要演算法分類?

價值法(DQN)、策略法(REINFORCE、PPO)、Actor-Critic(A3C、DDPG、SAC);依動作離散或連續、樣本效率需求選擇。

🧭 相關主題

← 返回 AI 學習與考證地圖