標準強化學習只想最大化期望報酬。但在輸不起的場景,好的決策還要看「會不會偶爾出大事」。風險規避=寧願選波動小、更安全的策略,就算期望一樣、甚至略低。
決策時不只看平均能拿多少,也在意「結果有多不確定、會不會偶爾慘賠」。
核心思路:不要「只最大化期望」,而是把風險也放進目標。常見做法:
先想再點開。
決策時不只看期望報酬,也考慮波動/不確定性,傾向避開高風險(即使期望相同或略高)。
會忽略偶爾的災難性結果;期望相同但變異差很多的兩策略,風險規避者選波動小的。
安全關鍵、損失不可逆:醫療、金融、自動駕駛——一次大失敗無法承受。
懲罰變異、風險敏感效用、CVaR、最壞情況優化,而非只最大化期望。
過度規避會抑制探索、可能卡在次優策略。
風險規避是強化學習在不確定環境下的決策考量。重點:標準 RL 最大化期望回報,但實務上有時要避免高變異或災難性結果,於是引入風險敏感目標(如懲罰變異、看最差情況)。易混點:期望最大不等於風險最低——兩策略期望相同但變異差很多時,風險趨避者會選較穩的。情境:金融、醫療、自駕等錯誤代價高的場景。
想練情境題與詳解 → AI 學習與考證地圖
決策時不只看期望報酬,還考慮報酬的不確定性與波動,傾向避開高風險(即使期望相同或略高)的選擇。
在安全關鍵或損失代價高的場景(醫療、金融、自駕),一次大失敗無法接受;此時穩定低變異的策略比追求最高期望更重要。
在目標中懲罰報酬變異、用風險敏感的效用函數(如 CVaR、指數效用)、或對最壞情況優化,而非只最大化期望。
過度風險趨避會抑制探索(不敢試新動作)、可能卡在次優策略;需在安全與探索新可能之間取捨。
只看期望會忽略偶爾的災難性結果;兩個期望相同的策略,風險趨避者會選波動小的那個。