🎲 蒙地卡羅 Monte Carlo · iPAS 機率/RL

蒙地卡羅方法:與其猜一次未來,不如模擬一千個平行宇宙

有些數值很難直接算(未來會怎樣、一個怪形狀的面積…)。蒙地卡羅的招數是:大量隨機取樣、跑很多很多次,再統計結果。樣本越多,估計越準——不求「唯一答案」,而是掌握整個機率分布與風險

隨機取樣大數法則估期望·積分·機率平行宇宙模擬MC vs TD

🧠 一、先用白話講:蒙地卡羅在做什麼?

大量隨機取樣去估計「難以直接計算」的數值(期望值、積分、機率)。依大數法則,樣本越多、估計通常越準。

🎰 名字的由來 + 生活比喻

這方法以摩納哥的「蒙地卡羅賭場」命名——因為它的核心就是「靠隨機、擲骰子」。
比喻:想知道一個不規則池塘的面積,與其精算彎曲的邊界,不如往整塊地隨機丟一千顆小石頭,數「落在池塘裡的比例 × 總面積」≈ 池塘面積。用隨機取樣換掉困難的計算,這就是蒙地卡羅。

🥧 二、經典例子:用灑點估圓周率 π

在正方形裡隨機灑點

在一個正方形內畫出內接圓,然後隨機灑很多點。落在圓內的點數 ÷ 總點數 ≈ 圓與正方形的面積比 = π/4
所以 π ≈ 4 × (圓內點數 / 總點數)。點灑得越多,估出來的 π 越接近 3.14159……——這就是蒙地卡羅「越多樣本越準」的最直觀示範。

🎮 三、動手玩:模擬一千個平行宇宙

情境:預測一座太陽能電廠未來 90 天的累積發電量。天氣是隨機的——依序點 ①②③,看「只猜一次」到「模擬一千次」的差別。

應對氣候隨機性:不要只猜一次未來,讓我們模擬一千個平行宇宙!

未來三個月 (天數 0 ~ 90) 累積發電量 (kWh)
機率分佈

🗺️ 怎麼看

一條線=一個單一預測(幾乎必錯的豪賭)。 十條線「散開」=看見不確定性。 上千條隨機軌跡交疊,右側把「最終結果」統計起來,長出一條漂亮的鐘形常態分布重點不是猜中「絕對數字」,而是掌握「風險區間與機率」——例如「有 95% 信心發電量不低於某區間」。

💡 四、核心精神:不求單一答案,求「分布」

面對隨機性,單一預測幾乎一定錯

與其執著「明天剛好是多少」,蒙地卡羅跑很多次、看結果怎麼分布,於是同時得到期望值風險區間。這也符合大數法則:模擬次數越多,樣本平均越逼近真值(誤差大約以 1/√N 的速度縮小——想準 10 倍,樣本要多 100 倍)。

🤖 五、蒙地卡羅在強化學習裡怎麼用?

用「完整一回合的實際回報」估價值

RL 要估「某狀態/動作有多好」。蒙地卡羅法:把一整局(episode)玩到底,用實際拿到的累積回報來更新估計,多玩幾局取平均。
特點:不需要環境模型(model-free)、用的是真實回報;但缺點是要等整回合結束才能更新。

⚖️ 六、蒙地卡羅 vs 時序差分(TD)— 必考對比

比較蒙地卡羅 (MC)時序差分 (TD)
何時更新整回合結束、用實際回報每一步就用估計值更新
用什麼當目標真實累積回報r + γ×下一步的估計值(bootstrapping)
偏差 / 變異無偏、但變異大有偏、但變異小
能否線上學否(要完整回合)可以(每步都能學)
代表MC 價值估計Q-LearningSARSA

🧠 一句話

MC=「等答案揭曉再學」(準但要等、抖);TD=「邊走邊用猜的更新」(快、可線上、較穩但有偏)。這兩者的取捨是 RL 常考題。

📋 七、優點與缺點

優點概念簡單、無偏、不需轉移機率模型。
缺點變異大、需要完整回合(不適合持續性任務)、收斂較慢。

🛠️ 八、實務都用在哪?

📌 蒙地卡羅的舞台

風險模擬(金融投組、氣候、工程可靠度——就像 demo)、積分/期望估計(高維難算的積分)、RL 價值估計,以及蒙地卡羅樹搜尋(MCTS)——用隨機模擬評估棋步,AlphaGo 就結合了 MCTS 與神經網路。凡是「解析解難算、但能重複隨機取樣」的問題,蒙地卡羅都能上場。

🧪 九、觀念自我檢測

先想再點開。

Q1. 蒙地卡羅方法在做什麼?

大量隨機取樣估計難以直接計算的數值;依大數法則,樣本越多越準

Q2. 怎麼用灑點估 π?

正方形內灑點,圓內比例 × 4 ≈ π;點越多越準。

Q3. 為什麼不只做一次模擬?

隨機性下單次幾乎必錯;要看結果分布、風險區間而非單一數字。

Q4. 蒙地卡羅在 RL 怎麼估價值?

完整回合的實際累積回報更新估計,多局取平均(model-free)。

Q5. MC 和 TD 差在哪?

MC:等整回合、用實際回報、無偏但變異大;TD:每步用估計值更新、有偏但變異小、可線上學。

✅ 十、30 秒重點整理

蒙地卡羅=隨機取樣估計難算的期望/積分/機率。
大數法則樣本越多越準,誤差 ~ 1/√N。
求分布不求單一數掌握風險區間與機率。
RL 用法完整回合的實際回報估值。
vs TDMC 無偏變異大要等回合;TD 有偏變異小可線上。
應用風險模擬、估 π、MCTS/AlphaGo。

📝 iPAS 考點提醒

蒙地卡羅方法用大量隨機取樣估計數值,iPAS 機率與 RL 考點(中級科目二與三)。重點:當解析解難算時,靠重複隨機模擬取平均逼近期望或機率,樣本越多越準(大數法則)。易混點:在強化學習中,蒙地卡羅用完整回合的實際回報估值(與時序差分 TD 用估計值逐步更新不同);誤差隨樣本數平方根下降、收斂較慢。情境:風險模擬、積分估計、RL 價值估計。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

蒙地卡羅方法是什麼?

用大量隨機取樣來估計難以直接計算的數值(如期望值、積分、機率);依大數法則,樣本越多估計通常越準。

能舉個直觀例子嗎?

估計圓周率 π:在正方形內隨機灑點,落在內接圓內的比例約等於圓與正方形的面積比,反推即可估 π,點越多越準。

在強化學習中怎麼用?

用完整一回合(episode)的實際累積回報來估計狀態或動作的價值,等回合結束才更新;不需環境模型,但要等回合走完。

蒙地卡羅和時序差分(TD)差在哪?

蒙地卡羅等整回合結束、用實際回報更新(無偏但變異大);TD 每步就用估計值更新(有偏但變異小、可線上學),Q-learning 即屬 TD。

蒙地卡羅的優缺點?

優點:概念簡單、無偏、不需轉移機率模型。缺點:變異大、需要完整回合(不適合持續性任務)、收斂可能較慢。

🧭 相關主題

← 返回 AI 學習與考證地圖