iPAS AI 應用規劃師 · 初級+中級

🎲 iPAS 專用機率速成

不教數學系那套。iPAS 從來不叫你證明大數法則——它只考六件事:P(A|B) 的分母是誰、獨立跟互斥差在哪、貝氏定理的四個字母、PDF 與 CDF 的關係、情境該配哪個分布、Z-score 怎麼讀。這頁就把這六件事用三個互動實驗室講完。

🟢 綠標=初級也會考🔵 藍標=中級才考🧪 3 個互動實驗室📌 全部對到歷屆真題

💡 先講白話:AI 模型吐出來的其實都是機率

分類模型說「這是貓」,內部其實是說「貓 0.93、狗 0.05、兔 0.02」——softmax 把分數轉成一組加起來等於 1 的機率。所以:門檻怎麼切是機率問題、損失函數(交叉熵)是機率問題、資料漂移偵測(KL 散度)是機率問題、異常值判定(3σ)也是機率問題。機率不是背公式,是 AI 的通用語言。
📌 考試心態校正:iPAS 的機率題幾乎都是「讀懂情境 → 選對工具」:客服每分鐘幾通來電該用哪個分布?CDF 是 PDF 的什麼?P(A|B) 的程式碼該除以誰?要動筆的計算只有像 2/3、0.686 這種一步到位的小數字。

🔤 看到符號就卡住?先把這張表放旁邊

這頁會用到的符號全部列在下面,一行一個。數學的困難常常不是概念難,而是沒人告訴你那個圖案怎麼念、代表什麼——看不懂符號,整條式子就等於空白。

符號怎麼念在這頁的意思
∩ ∪cap / cup
交集、聯集
∩=兩邊要(交集);∪=兩邊任一即可(聯集)。
|x|absolute value
絕對值
只看大小、不管正負。|−2| = 2
× ·multiplication
乘號兩種寫法
都是乘。差別純粹是歷史與排版習慣。
±plus-minus
正負號
兩個都要算。x̄ ± 1.96×SE=上下各抓一段,就是信賴區間。
=equals
等號
兩邊相等。
not equal
不等於
兩邊不相等。
≤ ≥less/greater than or equal
小於等於、大於等於
包含「剛好等於」的那個邊界。
approximately equal
約等於
差不多相等(四捨五入或近似之後)。
÷division
除號
除。
μmu
謬(母體平均)
整個母體的真實平均值(相對於樣本平均 x̄)。
σ σ²sigma
西格瑪(標準差、變異數)
σ=標準差(資料多分散,單位同原資料);σ²=變異數(平方單位)。
αalpha
阿爾法(顯著水準)
你願意承擔的誤判機率上限,通常設 0.05。也就是第一類錯誤(偽陽性)的機率。
P(A|B)given
條件機率的那條豎線
已知 B 發生的前提下,A 發生的機率」。豎線讀作「given」。
~tilde
波浪號(服從某分布)
「服從」。X ~ N(0,1) 讀作「X 服從標準常態分布」。
N(μ, σ²)Normal
常態分布
平均是 μ、變異數是 σ² 的常態(鐘形)分布。
E[X]expectation
期望值
長期平均下來會是多少。
Φ φphi
斐(常態的 CDF 與 PDF)
Φ=累積到某點的面積(機率);φ=某一點的高度(密度)。
ZZ-score
標準分數
距離平均幾個標準差。Z = (x − μ) / σ
assignment
賦值箭頭
「用右邊的結果取代左邊」,不是「等於」。
🔍 想知道「為什麼是這個符號」?例如 Σ 其實是希臘文的 S,來自拉丁文 Summa(和)∫ 是一個被拉長的 S∂ 是圓體的 d——完整的 50 個符號來源、發明者與年代,都整理在 數學符號解碼器
那頁還會誠實標出哪些符號根本查不到出處(像機器學習學習率的 η,翻遍符號史文獻都沒人記載為什麼是它)——看不懂不是你的問題,是真的沒人寫下來。

🎲 實驗室 1:骰子事件實驗室 初級中級

點每顆骰子下面的 A / B 決定它屬於哪個事件,右邊的機率會即時重算。重點在看懂條件機率的分母換了誰,以及「獨立」和「互斥」根本是兩回事

只在 A 只在 B A ∩ B(都在) 都不在
A =  P(A) =
B =  P(B) =
A ∩ B =  P(A∩B) =
A ∪ B =  P(A∪B) =
P(A|B) = P(A∩B) ÷ P(B) =  分母只剩 B
P(B|A) = P(A∩B) ÷ P(A) =  分母只剩 A
獨立檢查:P(A)×P(B) = ↔ P(A∩B) =
🎯 真題還原(114 年第 2 回 中級 科目三):用蒙地卡羅估 \(P(A|B)\),事件 A=擲出偶數、事件 B=擲出大於 3,程式碼該寫哪個?
正解 A_and_B.sum() / B.sum()。因為 \(P(A|B)=\dfrac{P(A\cap B)}{P(B)}\)——已經知道 B 發生了,分母就從「全部」縮小成「B」。錯誤選項把分母寫成 A.sum()(那是 P(B|A))或 A.sum()+B.sum()A.sum()*B.sum()(根本不是機率定義)。
⚠️ 全站最愛考的觀念混淆:獨立 ≠ 互斥
互斥(Mutually Exclusive)=兩件事不可能同時發生,\(P(A\cap B)=0\)。
獨立(Independent)=一件事發生不影響另一件的機率,\(P(A\cap B)=P(A)P(B)\)。
關鍵推論:兩個機率都不為 0 的互斥事件,一定「不獨立」——因為 A 一旦發生,B 就完全不可能了,這影響大到極點。按上面的「互斥範例」按鈕自己驗一次。
🎯 冷門但考過(115 年第 1 回 中級 科目二):關聯規則的三個指標其實就是機率換個名字——
支援度 Support = \(P(A\cap B)\)(同時出現占全部交易的比例)
信賴度 Confidence = \(P(B|A)\)(買了 A 的人裡有幾成也買 B)← 它才是條件機率
提升度 Lift = \(\dfrac{P(A\cap B)}{P(A)P(B)}\),等於 1 代表獨立、>1 正相關、<1 負相關,範圍不限在 [0,1]

🧮 貝氏定理:把「看到的證據」換算成「更新後的信念」 中級

\[ P(Y \mid X) = \frac{P(X \mid Y)\, P(Y)}{P(X)} \] 白話:看到特徵 X 之後,這筆資料屬於類別 Y 的機率。右邊三塊各有名字——\(P(Y)\) 是先驗(還沒看資料前的信念)、\(P(X|Y)\) 是概似(如果真是 Y,會看到 X 的機率)、\(P(Y|X)\) 是後驗(看完資料後更新的信念)。
🎯 真題還原(114 年第 2 回 中級 科目三):電商用瀏覽紀錄推估「觀察到這些行為後、該顧客會購買的機率」,問貝氏定理的核心運作機制 → 正解是「以條件機率方式計算顧客屬於會購買/不會購買的分類機率」
看到「貝氏定理」就想到「條件機率」和 P(A|B)。錯誤選項通常混進分群(非監督)、MSE 迴歸、強化學習回饋——都不是條件機率。
⚠️ 樸素貝氏(Naive Bayes)的「樸素」在哪?它假設所有特徵彼此獨立,才能把 \(P(X|Y)\) 拆成一堆相乘。現實中特徵當然會相關(這假設「很天真」),但它訓練極快、在文字分類/垃圾郵件過濾上意外好用——這是它的固定考點。

想看完整的先驗→後驗動畫與疾病篩檢的直覺陷阱,走這兩頁:貝氏定理互動教學樸素貝氏分類器

📈 實驗室 2:常態面積尺(PDF vs CDF) 初級中級

上圖是機率密度函數 PDF,陰影面積就是機率;下圖是累積分佈函數 CDF,也就是把 PDF 一路積分累加起來的曲線。拖動 z 看兩張圖怎麼連動。

機率(陰影面積): CDF F(z) = P(Z ≤ z):

三個一定要背的數字

±1σ ≈ 68% ② ±2σ ≈ 95%(更精確是 ±1.96σ) ③ ±3σ ≈ 99.7%
所以「超過 3 個標準差」大約是 千分之 3 的事——這就是 3σ 離群值判定的由來。
🎯 真題還原(114 年第 2 回 中級 科目二):問「累積分佈函數 CDF 的數學定義」→ 正解「機率密度函數 PDF 的積分」
記法:PDF 是每一點的高度、CDF 是從左邊累積到現在的面積。CDF 一定是遞增、從 0 爬到 1;PDF 本身可以大於 1(它是密度不是機率),但整條曲線下的總面積必定等於 1。
🎯 Z-score 判讀真題(115 年第 1 回 中級 科目一):監控設 |Z| ≥ 2 觸發警示,某特徵 Z-score = −2 → 代表該值低於歷史平均 2 個標準差(負號=在平均值下方,絕對值 2=距離兩個標準差),剛好踩到警示邊界。別看到負號就選「超出常態分布範圍」。
公式:\(z=\dfrac{x-\mu}{\sigma}\)。上面實驗室右邊那顆膠囊會用真題情境(溫度感測器 μ=25°C、σ=2°C)幫你換算成實際數值。

🎯 實驗室 3:二項分布什麼時候能用常態近似 中級

二項分布數的是「n 次嘗試中成功幾次」。當 n 夠大、p 不要太極端時,它的形狀會逼近常態——但有條件,而那個條件正是考題本身。拖動 n 與 p,看鐘形什麼時候才真的貼合。

平均 np: 變異數 np(1−p): 標準差:
np > 5 ?n(1−p) > 5 ?
🎯 真題還原(中級 科目二):推播給 5,000 位顧客、單次點擊率 p=0.4,想用常態分布近似二項分布,哪個判斷合理?→ 正解「只有當 np 與 n(1−p) 皆大於 5 時,才能以常態分布作近似」
不是「樣本數夠大就一定可以」——如果 p 極小(例如 0.001),就算 n=1000,np 才 1,分布仍嚴重右偏、貼不上鐘形。這種「稀有事件」該用的是卜瓦松分布

🗂️ 分布選型速查:讀情境、挑分布 中級高頻

這是機率題出現頻率最高的一種:給你一段業務情境,問「最適合用哪個分布描述」。抓關鍵字就好。

分布在數什麼情境關鍵字典型考題
二項 Binomialn 次獨立嘗試中成功幾次固定次數、每次成敗、機率相同推播 5000 人,點擊人數的分布
卜瓦松 Poisson單位時間/空間內發生幾次平均每小時 20 通、事件獨立、與時間長短成正比客服中心每分鐘接到幾通來電
指數 Exponential下一次事件要等多久間隔時間、等待時間、壽命兩通來電之間相隔幾分鐘
常態 Normal大量因素疊加後的連續數值身高、量測誤差、平均值、鐘形對稱感測器溫度 μ=25、σ=2
均勻 Uniform每個結果機會完全一樣隨機亂數、無偏好隨機初始化、隨機抽樣
🔑 卜瓦松 vs 指數是同一件事的兩面:「一小時內來 20 通」用卜瓦松(數次數,離散);「下一通要等幾分鐘」用指數(量時間,連續)。題目問幾次就選卜瓦松,問多久就選指數。詳細動畫在 卜瓦松與指數分布

📊 期望值、變異數、偏態與盒鬚圖 初級

期望值與變異數

期望值 E[X]=長期平均會是多少(\(\sum x_i P(x_i)\))。變異數 Var(X)=離平均值有多散(平方單位),開根號就是標準差(回到原本的單位,所以報表都報標準差)。

🎯 期望值在 AI 裡的真題:Dropout 的程式碼 x * mask / p,那個「除以 p」是 Inverted Dropout——隨機關掉一部分神經元後,把剩下的放大回去,讓輸出的期望值維持不變,這樣訓練和推論才對得起來。

偏態 Skewness:看長尾在哪一邊

右偏(正偏)左偏(負偏)
Skewness> 0< 0
長尾方向尾巴拖向右邊(高值)尾巴拖向左邊(低值)
大小關係平均數 > 中位數平均數 < 中位數
盒鬚圖長相中位數線偏向盒子下方、上鬚較長中位數線偏向盒子上方、下鬚較長
常見例子所得、房價、等待時間考試高分群、壽命資料
🎯 盒鬚圖真題(115 年第 1 回 中級 科目三):「盒子很短但鬚很長」=中間 50% 集中但有極端值;「中位數明顯偏向盒子下方」=右偏分布。另一題直接給分布圖問 Skewness 正負——長尾在左就是負偏。這兩題都是純判讀,不用計算。

🤖 機率在 AI 裡長什麼樣(考題都藏在這) 中級

概念它在做的機率的事考點
Softmax把一堆分數(logits)轉成總和為 1 的機率分布多類別互斥單標籤用 softmax;多標籤各自獨立要用 sigmoid
交叉熵 Cross Entropy衡量「預測的機率分布」離「真實標籤」多遠PyTorch 的 CrossEntropyLoss 內建 softmax,輸出層別再加一次
KL 散度兩個機率分布的差異程度偵測資料漂移 Data Drift——比較新舊輸入分布
Temperature調整 softmax 的「陡峭程度」溫度高→機率變平均→輸出更隨機有創意;溫度低→更確定、更保守
蒙地卡羅大量隨機抽樣逼近機率、期望值、分布沒有解析解時使用(風險值模擬、估 P(A|B))
信賴區間 / p 值從樣本推論母體的不確定性虛無假設值落在信賴區間內 → 無法拒絕虛無假設(與 p > α 一致)
⚠️ 中級真題易錯:單樣本 t 檢定 p 值 = 0.08、95% 信賴區間 [95, 108] 萬,檢定值 100 萬。正解是「因 100 萬落在信賴區間內,無法拒絕虛無假設」——信賴區間與 p 值必然一致,別被「p 值 < 0.05 可拒絕」這種自相矛盾的選項騙了。細節在 信賴區間型一/型二錯誤

✅ 自我檢測

Q1:擲一顆公正骰子,A=擲出偶數、B=擲出大於 3。P(A|B) 是多少?程式碼要除以誰?

B = {4,5,6},A∩B = {4,6},所以 \(P(A|B)=\frac{2/6}{3/6}=\frac{2}{3}\approx 0.667\)。程式碼是 A_and_B.sum() / B.sum()——條件機率的分母是被條件的那個事件

Q2:A 和 B 互斥,且 P(A)、P(B) 都不為 0。它們是獨立的嗎?

一定不獨立。互斥代表 \(P(A\cap B)=0\),但獨立要求 \(P(A\cap B)=P(A)P(B)\),兩個非零數相乘不可能是 0。直覺上:A 一發生,B 就完全不可能了——這叫影響超大,怎麼會是獨立。

Q3:CDF(累積分佈函數)的數學定義是什麼?

PDF(機率密度函數)的積分。CDF 從 0 單調爬升到 1,F(z) = P(X ≤ z);PDF 是每一點的密度高度,本身可以大於 1,但曲線下總面積等於 1。

Q4:客服中心平均每小時 20 通來電,想描述「每分鐘接到幾通」的機率分布,該用哪個?如果改問「兩通之間相隔多久」呢?

「每分鐘幾通」=數次數 → 卜瓦松分布。「相隔多久」=量等待時間 → 指數分布。同一個隨機過程的兩種問法。

Q5:推播 5,000 人、單次點擊率 p = 0.4,可以用常態分布近似二項分布嗎?判準是什麼?

可以。判準是 np > 5 且 n(1−p) > 5:np = 2000、n(1−p) = 3000,都遠大於 5。注意不是「n 夠大就一定可以」——p 極小時(如 0.001)np 只有 5,分布仍嚴重右偏。

Q6:某特徵的 Z-score = −2,代表什麼?

該值低於歷史平均 2 個標準差。負號是方向(在平均下方),絕對值是距離。若監控規則是 |Z| ≥ 2 觸發警示,這筆剛好踩到邊界。

Q7:關聯規則裡,哪一個指標才是條件機率?提升度等於 1 代表什麼?

信賴度 Confidence = P(B|A) 才是條件機率(支援度是 P(A∩B))。提升度 Lift = 1 代表 A 與 B 獨立,>1 正相關、<1 負相關;Lift 的範圍不限在 [0,1]

Q8:盒鬚圖中,某城市的中位數線明顯偏向盒子下方,資料是什麼偏態?

右偏(正偏,Skewness > 0)。中位數靠下代表上半部資料延伸得更長,長尾在右邊。

🎯 重點整理(考前 5 分鐘掃這裡)

條件機率:\(P(A|B)=\dfrac{P(A\cap B)}{P(B)}\)。分母是被條件的那一個,程式碼寫成 A_and_B.sum()/B.sum()
互斥 vs 獨立:互斥 \(P(A\cap B)=0\);獨立 \(P(A\cap B)=P(A)P(B)\)。非零機率的互斥事件必定不獨立。
貝氏:\(P(Y|X)=\dfrac{P(X|Y)P(Y)}{P(X)}\)=先驗×概似÷證據=後驗。看到貝氏就想條件機率;樸素貝氏的「樸素」=假設特徵互相獨立。
PDF vs CDF:CDF 是 PDF 的積分,遞增且 0→1;PDF 可大於 1,總面積 = 1。
分布選型:數次數→二項(固定 n)/卜瓦松(單位時間);量等待→指數;連續對稱→常態;機會均等→均勻。
常態近似二項:條件是 np > 5 且 n(1−p) > 5,不是「n 大就好」。
Z-score:\(z=\frac{x-\mu}{\sigma}\);±1σ≈68%、±2σ≈95%、±3σ≈99.7%;負號只代表在平均下方。
偏態:長尾在右→Skew>0 右偏、平均>中位數、盒鬚圖中位線偏下。
AI 應用:softmax→機率分布(互斥用它、多標籤用 sigmoid);交叉熵比較分布;KL 散度抓資料漂移;蒙地卡羅在沒解析解時用隨機抽樣逼近。