🎲 策略熵 Policy Entropy · iPAS RL

策略熵:衡量 AI「有多猶豫」,並用它逼機器人多探索

策略熵幫你量化一件事:AI 現在的策略是什麼都想試(很隨機),還是只認定一個動作(很確定)。在訓練目標裡加一點熵,能逼它保持探索、別太早鎖死在「看起來最好」的選項上。

熵=不確定性探索 vs 利用Softmax 溫度熵正則化SAC · PPO · A2C

🧠 一、先用白話講:策略熵是什麼?

策略熵(Policy Entropy)衡量「策略有多隨機、多不確定」。

熵高 → 多探索動作機率很分散(各動作都有機會被選),代表 AI 還在「什麼都想試」。
熵低 → 多利用機率幾乎集中在一個動作,代表 AI 很確定、只想做它認為最好的那個。

🍽️ 生活比喻:點餐

熵高的人=菜單每樣都可能點、愛嘗鮮、拿不定主意;熵低的人=每次都點同一道、超級確定。剛到一家新餐廳該多試(高熵探索),吃熟了再固定愛店(低熵利用)。RL 訓練也是這節奏。

🔢 二、熵怎麼算?(Shannon 熵)

H = − Σ p · log₂(p) p 是每個動作的機率;把所有動作加總

兩個極端

最亂(熵最大):4 個動作各 25% 的均勻分布 → H = log₂4 = 2 bit
最確定(熵最小):某動作 100%、其餘 0% → H = 0
所以熵值就是一把「猶豫程度的尺」——越大越猶豫、越小越果斷。

🎮 三、動手玩:決策溫度實驗室

📜 情境

機器人面對 4 條路 A/B/C/D,系統內部的隱藏評分是 A、B、D=10 分,C=13 分(最佳)。拖動「決策溫度」,看它怎麼改變機率分布策略熵,下方光點會依機率四散或集中衝向 C。

*溫度高:無視分數差異,隨機亂走。
*溫度低:極度固執,只選分數最高的那條路。

目前策略熵 (不確定性):
2.00 bit (極度混亂)
路線 A (普通)25%
路線 B (普通)25%
路線 C (最佳解)25%
路線 D (普通)25%
A B C D AI

🗺️ 怎麼看

溫度調高:機率條變得四條差不多長、熵值衝到 2.0(粉紅=極亂),光點四面八方亂射(探索)。溫度調低:機率幾乎全集中到綠色 C、熵值掉到接近 0(變綠=果斷),光點全衝向 C(利用)。這就是「溫度」在控制探索/利用。

🌡️ 四、溫度 T 與 Softmax

demo 背後是加了「溫度」的 Softmax:

P(a) = exp( Q(a) / T ) ⁄ Σ exp( Q / T ) T=溫度
T 大(高溫)分數差被壓平 → 機率接近均勻 → 熵高、多探索
T 小(低溫)分數差被放大 → 幾乎只選最高分 → 熵低、多利用(趨近貪心)。

🎯 五、為什麼要「熵正則化」?

避免策略太早變得過度確定

如果策略太快把機率全押在「目前看起來最好」的動作上(熵驟降),它就不再嘗試別的——萬一還有更好的動作沒被發現,就永遠鎖死在次優(局部最優)
解法:在目標函數裡加一個「熵獎勵」(熵正則化),鼓勵 agent 保持一點隨機、繼續探索,別太早收斂。

⚖️ 六、熵 = 探索 vs 利用的旋鈕

高熵低熵
行為探索、什麼都試利用、只做最好的
好處不易錯過更好的動作穩定、果斷
風險不穩、可能不收斂易卡次優(局部最優)

常見做法:先高後低

訓練初期維持較高熵(大膽探索),後期逐步降低(收斂到穩定策略)——就像 demo 的溫度從高慢慢調低。

🧩 七、哪些演算法用到熵?

📌 熵正則化的常客

A2C/A3C:在損失函數裡加一個熵項,鼓勵探索。
PPO:也常加熵獎勵當輔助。
SAC(Soft Actor-Critic):更徹底——把「最大化回報 + 最大化熵」當作核心目標(最大熵 RL),要求策略「盡量隨機、但要有效」,在連續控制上很強。相關:Policy GradientActor-Critic

⚠️ 八、熵太高、太低都不行

太高一直亂試、學不穩、不收斂,浪費樣本。
太低過早收斂到次優、缺乏探索,可能永遠找不到更好解。
剛剛好初期高、後期降,動態平衡探索與利用。

🧪 九、觀念自我檢測

先想再點開。

Q1. 策略熵高、低各代表什麼?

=動作機率分散、多探索=集中在一個動作、多利用

Q2. 熵怎麼算?兩個極端值?

H = −Σ p·log₂ p。均勻(4 選項各 25%)= 2 bit 最大;集中一個 = 0

Q3. Softmax 溫度 T 大、小的效果?

T 大:機率均勻、熵高、探索;T 小:趨近貪心、熵低、利用。

Q4. 為什麼要加熵正則化?

鼓勵探索、避免策略太早過度確定而卡在次優

Q5. 哪些演算法用到熵?

A2C/A3C、PPO 加熵項SAC 以「回報+熵」為核心(最大熵 RL)。

✅ 十、30 秒重點整理

策略熵=猶豫程度高=隨機探索、低=確定利用。
H=−Σp log p均勻最大、集中為 0。
溫度 T大→均勻(探索)、小→貪心(利用)。
熵正則化加熵獎勵鼓勵探索、避免卡次優。
先高後低初期多探索、後期收斂。
用它的演算法A2C/A3C、PPO、SAC。

📝 iPAS 考點提醒

策略熵是強化學習鼓勵探索的關鍵機制。重點:熵衡量策略的隨機與不確定程度,在目標中加入熵獎勵(如 SAC、PPO)能讓代理人保持嘗試多種行動、避免太早收斂到次佳策略。易混點:高熵代表多探索但較不穩、低熵代表多利用但易卡局部最優,需權衡探索與利用的取捨。情境:訓練初期常維持較高熵、後期逐步降低。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

策略熵(policy entropy)是什麼?

衡量策略的隨機或不確定程度;熵高代表動作較分散(多探索)、熵低代表很確定(多利用)。

為什麼要在目標裡加熵?

鼓勵探索、避免策略太早變得過度確定而卡在次優;熵正則化讓代理人保持嘗試新動作的傾向。

這和探索與利用的取捨有關嗎?

有。熵正則化是控制探索的一種方式——加大熵權重就更多探索、減小就更多利用,需隨訓練調整。

哪些演算法用到熵正則化?

A3C 與 A2C 常在損失加熵項;SAC(Soft Actor-Critic)更把最大化回報加熵當核心目標,鼓勵盡量隨機但有效。

熵太高或太低會怎樣?

太高會一直亂試、學不穩、不收斂;太低會過早收斂到次優、缺乏探索;需適當平衡(常初期高、後期降)。

🧭 相關主題

← 返回 AI 學習與考證地圖