不教數學系那套。iPAS 從來不叫你證明大數法則——它只考六件事:P(A|B) 的分母是誰、獨立跟互斥差在哪、貝氏定理的四個字母、PDF 與 CDF 的關係、情境該配哪個分布、Z-score 怎麼讀。這頁就把這六件事用三個互動實驗室講完。
這頁會用到的符號全部列在下面,一行一個。數學的困難常常不是概念難,而是沒人告訴你那個圖案怎麼念、代表什麼——看不懂符號,整條式子就等於空白。
| 符號 | 怎麼念 | 在這頁的意思 |
|---|---|---|
| ∩ ∪ | cap / cup 交集、聯集 | ∩=兩邊都要(交集);∪=兩邊任一即可(聯集)。 |
| |x| | absolute value 絕對值 | 只看大小、不管正負。|−2| = 2。 |
| × · | multiplication 乘號兩種寫法 | 都是乘。差別純粹是歷史與排版習慣。 |
| ± | plus-minus 正負號 | 兩個都要算。x̄ ± 1.96×SE=上下各抓一段,就是信賴區間。 |
| = | equals 等號 | 兩邊相等。 |
| ≠ | not equal 不等於 | 兩邊不相等。 |
| ≤ ≥ | less/greater than or equal 小於等於、大於等於 | 包含「剛好等於」的那個邊界。 |
| ≈ | approximately equal 約等於 | 差不多相等(四捨五入或近似之後)。 |
| ÷ | division 除號 | 除。 |
| μ | mu 謬(母體平均) | 整個母體的真實平均值(相對於樣本平均 x̄)。 |
| σ σ² | sigma 西格瑪(標準差、變異數) | σ=標準差(資料多分散,單位同原資料);σ²=變異數(平方單位)。 |
| α | alpha 阿爾法(顯著水準) | 你願意承擔的誤判機率上限,通常設 0.05。也就是第一類錯誤(偽陽性)的機率。 |
| P(A|B) | given 條件機率的那條豎線 | 「已知 B 發生的前提下,A 發生的機率」。豎線讀作「given」。 |
| ~ | tilde 波浪號(服從某分布) | 「服從」。X ~ N(0,1) 讀作「X 服從標準常態分布」。 |
| N(μ, σ²) | Normal 常態分布 | 平均是 μ、變異數是 σ² 的常態(鐘形)分布。 |
| E[X] | expectation 期望值 | 長期平均下來會是多少。 |
| Φ φ | phi 斐(常態的 CDF 與 PDF) | Φ=累積到某點的面積(機率);φ=某一點的高度(密度)。 |
| Z | Z-score 標準分數 | 距離平均幾個標準差。Z = (x − μ) / σ。 |
| ← | assignment 賦值箭頭 | 「用右邊的結果取代左邊」,不是「等於」。 |
點每顆骰子下面的 A / B 決定它屬於哪個事件,右邊的機率會即時重算。重點在看懂條件機率的分母換了誰,以及「獨立」和「互斥」根本是兩回事。
A_and_B.sum() / B.sum()。因為 \(P(A|B)=\dfrac{P(A\cap B)}{P(B)}\)——已經知道 B 發生了,分母就從「全部」縮小成「B」。錯誤選項把分母寫成 A.sum()(那是 P(B|A))或 A.sum()+B.sum()、A.sum()*B.sum()(根本不是機率定義)。
上圖是機率密度函數 PDF,陰影面積就是機率;下圖是累積分佈函數 CDF,也就是把 PDF 一路積分累加起來的曲線。拖動 z 看兩張圖怎麼連動。
二項分布數的是「n 次嘗試中成功幾次」。當 n 夠大、p 不要太極端時,它的形狀會逼近常態——但有條件,而那個條件正是考題本身。拖動 n 與 p,看鐘形什麼時候才真的貼合。
這是機率題出現頻率最高的一種:給你一段業務情境,問「最適合用哪個分布描述」。抓關鍵字就好。
| 分布 | 在數什麼 | 情境關鍵字 | 典型考題 |
|---|---|---|---|
| 二項 Binomial | n 次獨立嘗試中成功幾次 | 固定次數、每次成敗、機率相同 | 推播 5000 人,點擊人數的分布 |
| 卜瓦松 Poisson | 單位時間/空間內發生幾次 | 平均每小時 20 通、事件獨立、與時間長短成正比 | 客服中心每分鐘接到幾通來電 |
| 指數 Exponential | 下一次事件要等多久 | 間隔時間、等待時間、壽命 | 兩通來電之間相隔幾分鐘 |
| 常態 Normal | 大量因素疊加後的連續數值 | 身高、量測誤差、平均值、鐘形對稱 | 感測器溫度 μ=25、σ=2 |
| 均勻 Uniform | 每個結果機會完全一樣 | 隨機亂數、無偏好 | 隨機初始化、隨機抽樣 |
期望值 E[X]=長期平均會是多少(\(\sum x_i P(x_i)\))。變異數 Var(X)=離平均值有多散(平方單位),開根號就是標準差(回到原本的單位,所以報表都報標準差)。
x * mask / p,那個「除以 p」是 Inverted Dropout——隨機關掉一部分神經元後,把剩下的放大回去,讓輸出的期望值維持不變,這樣訓練和推論才對得起來。| 右偏(正偏) | 左偏(負偏) | |
|---|---|---|
| Skewness | > 0 | < 0 |
| 長尾方向 | 尾巴拖向右邊(高值) | 尾巴拖向左邊(低值) |
| 大小關係 | 平均數 > 中位數 | 平均數 < 中位數 |
| 盒鬚圖長相 | 中位數線偏向盒子下方、上鬚較長 | 中位數線偏向盒子上方、下鬚較長 |
| 常見例子 | 所得、房價、等待時間 | 考試高分群、壽命資料 |
| 概念 | 它在做的機率的事 | 考點 |
|---|---|---|
| Softmax | 把一堆分數(logits)轉成總和為 1 的機率分布 | 多類別互斥單標籤用 softmax;多標籤各自獨立要用 sigmoid |
| 交叉熵 Cross Entropy | 衡量「預測的機率分布」離「真實標籤」多遠 | PyTorch 的 CrossEntropyLoss 內建 softmax,輸出層別再加一次 |
| KL 散度 | 兩個機率分布的差異程度 | 偵測資料漂移 Data Drift——比較新舊輸入分布 |
| Temperature | 調整 softmax 的「陡峭程度」 | 溫度高→機率變平均→輸出更隨機有創意;溫度低→更確定、更保守 |
| 蒙地卡羅 | 用大量隨機抽樣逼近機率、期望值、分布 | 沒有解析解時使用(風險值模擬、估 P(A|B)) |
| 信賴區間 / p 值 | 從樣本推論母體的不確定性 | 虛無假設值落在信賴區間內 → 無法拒絕虛無假設(與 p > α 一致) |
B = {4,5,6},A∩B = {4,6},所以 \(P(A|B)=\frac{2/6}{3/6}=\frac{2}{3}\approx 0.667\)。程式碼是 A_and_B.sum() / B.sum()——條件機率的分母是被條件的那個事件。
一定不獨立。互斥代表 \(P(A\cap B)=0\),但獨立要求 \(P(A\cap B)=P(A)P(B)\),兩個非零數相乘不可能是 0。直覺上:A 一發生,B 就完全不可能了——這叫影響超大,怎麼會是獨立。
PDF(機率密度函數)的積分。CDF 從 0 單調爬升到 1,F(z) = P(X ≤ z);PDF 是每一點的密度高度,本身可以大於 1,但曲線下總面積等於 1。
「每分鐘幾通」=數次數 → 卜瓦松分布。「相隔多久」=量等待時間 → 指數分布。同一個隨機過程的兩種問法。
可以。判準是 np > 5 且 n(1−p) > 5:np = 2000、n(1−p) = 3000,都遠大於 5。注意不是「n 夠大就一定可以」——p 極小時(如 0.001)np 只有 5,分布仍嚴重右偏。
該值低於歷史平均 2 個標準差。負號是方向(在平均下方),絕對值是距離。若監控規則是 |Z| ≥ 2 觸發警示,這筆剛好踩到邊界。
信賴度 Confidence = P(B|A) 才是條件機率(支援度是 P(A∩B))。提升度 Lift = 1 代表 A 與 B 獨立,>1 正相關、<1 負相關;Lift 的範圍不限在 [0,1]。
右偏(正偏,Skewness > 0)。中位數靠下代表上半部資料延伸得更長,長尾在右邊。
A_and_B.sum()/B.sum()。初級停在觀念層:機率是什麼、平均/中位數/標準差怎麼讀、常態分布長什麼樣、softmax 輸出是機率。中級才進到選型與計算:科目二最常出分布選型、CDF 定義、偏態與盒鬚圖判讀、常態近似條件、信賴區間與 p 值;科目三出條件機率程式碼、貝氏定理機制、蒙地卡羅、Dropout 期望值、交叉熵與 softmax 搭配。近兩屆固定班底:P(A|B) 的分母、CDF=PDF 的積分、卜瓦松 vs 指數、np>5、Z-score 負號判讀、Lift=1 代表獨立。
只有四個要背:條件機率 P(A|B)=P(A∩B)/P(B)、貝氏 P(Y|X)=P(X|Y)P(Y)/P(X)、Z-score z=(x−μ)/σ、常態近似條件 np>5 且 n(1−p)>5。其餘全是「讀情境選工具」的判讀題。
可以。PDF 是密度不是機率——連續分布中單一點的機率是 0,機率來自「面積」。只要整條曲線下的總面積等於 1 就合法,例如區間 [0, 0.5] 的均勻分布,密度就是 2。
題目問「幾次」(每分鐘幾通、每平方公尺幾個瑕疵)→ 卜瓦松;問「多久」(下一通要等幾分鐘、零件壽命)→ 指數。它們描述的是同一個隨機過程的兩種切法。
softmax 會強制所有類別機率加起來等於 1,適合「只能是其中一類」的互斥情境;多標籤(一張圖同時有貓也有狗)各標籤是獨立的,要用 sigmoid 讓每個輸出各自介於 0~1,彼此不搶額度。