🗺️ AI 學習與考證地圖
MOCHI 研究筆記 · 平行宇宙篇

蒙地卡羅:與其猜一次未來,不如探索一千個平行宇宙

有些數值很難直接算,例如未來會怎樣、一個怪形狀的面積。貓老師 Mochi 的方法是:大量隨機取樣、跑很多很多次,再統計結果。樣本越多,估計越準;不求唯一答案,而是掌握整個機率分布與風險。

隨機取樣大數法則估期望 · 積分 · 機率平行宇宙模擬MC vs TD
貓老師 Mochi 擲骰探索蒙地卡羅的平行宇宙
擲一次骰子是一條未來;重複擲很多次,才看得見整片可能性。

先用白話講蒙地卡羅在做什麼

蒙地卡羅是用大量隨機取樣去估計難以直接計算的數值,例如期望值、積分、機率。依大數法則,樣本越多,估計通常越準。

它以摩納哥的蒙地卡羅賭場命名,因為核心就是靠隨機擲骰子,讓大量偶然逐漸顯露穩定規律。

貓老師 Mochi 用隨機投石估計不規則池塘面積
不知道池塘的公式沒關係,先數落在池塘裡的小石頭。

不規則池塘怎麼量?

想知道一個不規則池塘的面積,與其精算彎曲邊界,不如往整塊地隨機丟一千顆小石頭。落在池塘裡的比例 × 總面積,就能估出池塘面積。這就是用隨機取樣換掉困難的計算

研究頁 02 · 灑點實驗

經典例子:用灑點估圓周率 π

貓老師 Mochi 在正方形內灑點估算圓周率
不是瞄準,而是故意隨機;點的比例會把 π 說出來。

在正方形裡隨機灑點

在一個正方形內畫出內接圓,然後隨機灑很多點。落在圓內的點數 ÷ 總點數,約等於圓與正方形的面積比=π/4。

π ≈ 4 × 圓內點數 / 總點數

點灑得越多,估出來的 π 越接近 3.14159。這就是蒙地卡羅「越多樣本越準」的直觀示範。

研究頁 03 · 互動模擬

動手玩:模擬一千個平行宇宙

情境:預測一座太陽能電廠未來 90 天的累積發電量。天氣是隨機的,依序切換三種模式,看只猜一次到模擬一千次的差別。

貓老師 Mochi 模擬太陽能發電量的多種未來
把晴雨輪盤重轉很多次,就能看見發電量的可能分布。

應對氣候隨機性:不要只猜一次未來,讓我們模擬一千個平行宇宙!

未來三個月(天數 0~90) 累積發電量(kWh)
機率分布

怎麼看這張圖?

一條線=一個單一預測,幾乎必錯的豪賭。十條線散開=看見不確定性。上千條隨機軌跡交疊,最終結果統計起來長出一條漂亮的鐘形常態分布

重點不是猜中絕對數字,而是掌握風險區間與機率,例如「有 95% 信心發電量不低於某區間」。

研究頁 04 · 分布觀點

核心精神:不求單一答案,求分布

面對隨機性,單一預測幾乎一定錯

蒙地卡羅的核心精神是不求單一答案,求分布。與其執著明天剛好是多少,不如跑很多次,看結果怎麼分布,同時得到期望值和風險區間。

模擬次數越多,樣本平均越逼近真值。誤差大約以 1/√N 的速度縮小;想準 10 倍,樣本要多 100 倍。這是大數法則的實際代價。

研究頁 05 · 強化學習

蒙地卡羅在強化學習裡怎麼用?

冒險者 Mochi 走完整回合後用累積回報更新價值
寶箱打開後才知道整趟旅程拿了多少回報,再把功勞分回沿途狀態。

用完整一回合的實際回報估價值

RL 要估某狀態/動作有多好。蒙地卡羅法會把一整局 episode 玩到底,再用實際拿到的累積回報來更新估計,多玩幾局取平均。

不需要環境模型(model-free),用的是真實回報;代價是要等整回合結束才能更新

研究頁 06 · 必考對比

蒙地卡羅 vs 時序差分 TD:必考對比

貓老師 Mochi 比較蒙地卡羅與時序差分的更新方式
左邊等完整答案,右邊每走一步就更新;兩種學法各有取捨。
比較蒙地卡羅(MC)時序差分(TD)
何時更新等整回合結束,用實際回報每一步就用估計值更新
學習目標真實累積回報r+γ×下一步的估計值(bootstrapping)
偏差/變異無偏但變異大有偏但變異小
線上學習否,要完整回合可以,每步都能學
代表方法MC 價值估計Q-Learning、SARSA

一句話記憶

MC=等答案揭曉再學,準但要等、抖。TD=邊走邊用猜的更新,快、可線上、較穩但有偏。這兩者的取捨是 RL 常考題。

研究頁 07 · 取捨清單

優點與缺點

優點概念簡單、無偏,不需轉移機率模型。
缺點變異大、需要完整回合,不適合持續性任務,而且收斂較慢。
研究頁 08 · 實務地圖

蒙地卡羅實務都用在哪?

分析師 Mochi 複習蒙地卡羅的風險分析與應用
金融、工程、棋局都能變成大量可重複的隨機實驗。

解析解難算,就讓樣本上場

風險模擬(金融投組、氣候、工程可靠度);積分/期望估計(高維難算的積分);也能做 RL 價值估計。

蒙地卡羅樹搜尋 MCTS會用隨機模擬評估棋步,AlphaGo 就結合了 MCTS 與神經網路。凡是解析解難算但能重複隨機取樣的問題,蒙地卡羅都能上場。

研究頁 09 · 自我檢測

觀念自我檢測

先想再點開;也可以先把答案收起來,逐題口述給貓老師聽。

Q1. 蒙地卡羅方法在做什麼?

用大量隨機取樣估計難以直接計算的數值;依大數法則,樣本越多越準。

Q2. 怎麼用灑點估 π?

正方形內灑點,圓內比例 × 4 ≈ π;點越多越準。

Q3. 為什麼不只做一次模擬?

隨機性下單次幾乎必錯;要看結果分布、風險區間而非單一數字。

Q4. 蒙地卡羅在 RL 怎麼估價值?

用完整回合的實際累積回報更新估計,多局取平均(model-free)。

Q5. MC 和 TD 差在哪?

MC:等整回合、用實際回報、無偏但變異大;TD:每步用估計值更新、有偏但變異小、可線上學。

研究頁 10 · 考前回顧

30 秒重點整理

方法蒙地卡羅=隨機取樣估計難算的期望/積分/機率。
收斂大數法則:樣本越多越準,誤差 ~ 1/√N。
觀點求分布不求單一數,掌握風險區間與機率。
RL 用法完整回合的實際回報估值。
MC vs TDMC 無偏、變異大、要等回合;TD 有偏、變異小、可線上。
應用風險模擬、估 π、MCTS/AlphaGo。

iPAS 考點提醒

蒙地卡羅方法用大量隨機取樣估計數值,是 iPAS 機率與 RL 考點(中級科目二與三)。當解析解難算時,靠重複隨機模擬取平均逼近期望或機率;樣本越多越準(大數法則)。

易混點:蒙地卡羅用完整回合的實際回報估值,時序差分 TD 用估計值逐步更新。誤差隨樣本數平方根下降,收斂較慢。常見情境是風險模擬、積分估計、RL 價值估計。想練情境題與詳解 → AI 學習與考證地圖

常見問題

蒙地卡羅方法是什麼?

用大量隨機取樣來估計難以直接計算的數值(如期望值、積分、機率);依大數法則,樣本越多估計通常越準。

能舉個直觀例子嗎?

估計圓周率 π:在正方形內隨機灑點,落在內接圓內的比例約等於圓與正方形的面積比,反推即可估 π,點越多越準。

在強化學習中怎麼用?

用完整一回合(episode)的實際累積回報來估計狀態或動作的價值,等回合結束才更新;不需環境模型,但要等回合走完。

蒙地卡羅和時序差分(TD)差在哪?

蒙地卡羅等整回合結束、用實際回報更新(無偏但變異大);TD 每步就用估計值更新(有偏但變異小、可線上學),Q-learning 即屬 TD。

蒙地卡羅的優缺點?

優點:概念簡單、無偏、不需轉移機率模型。缺點:變異大、需要完整回合(不適合持續性任務)、收斂可能較慢。