🎲 機率推論 · iPAS 常考
貝氏定理:看到證據後,如何更新你的信念
貝氏定理是一條「更新機率」的規則:原本相信某件事的機率(先驗),看到新證據後,更新成新的機率(後驗)。它是樸素貝氏、垃圾信過濾、醫療判讀的數學核心,也藏著一個讓很多人跌破眼鏡的直覺陷阱。
先驗→後驗P(A|B)=P(B|A)P(A)/P(B)偽陽性悖論自然頻率基本率謬誤
🤔 一、貝氏定理在說什麼?
一句話:用新證據,把「舊的機率」更新成「新的機率」。
💡 白話定義
你本來對某件事有個機率猜測(例如「這封信是垃圾信的機率 20%」)。看到新證據(信裡有「免費、中獎」)後,貝氏定理告訴你怎麼把這個機率
更新成更合理的數字。核心一句:
後驗 Posterior ∝ 概似 Likelihood × 先驗 Prior
P(A | B) =
P(B | A) · P(A)P(B)
| 先驗 Prior | P(A) | 看到證據前,事件本來的機率(如疾病盛行率)。 |
| 概似 Likelihood | P(B | A) | 假設 A 成立時,看到證據 B 的機率(如有病時驗出陽性的機率=敏感度)。 |
| 證據 Evidence | P(B) | 證據 B 整體出現的機率(不分 A 真假,全部陽性的比例)。 |
| 後驗 Posterior | P(A | B) | 看到證據後更新的機率——我們要的答案(如驗出陽性、真的有病的機率)。 |
😵 二、最有名的例子:檢測很準,陽性卻不一定有病
先猜一個數字,等下用 demo 驗證。
🩺 情境題
某疾病盛行率 1%(每 100 人有 1 人得病)。有個檢測準確率 99%(有病的人 99% 驗出陽性、健康的人 99% 驗出陰性)。
現在你驗出陽性——請問你真的有病的機率是多少?
🤯 答案:只有約 50%,不是 99%!
直覺會說「檢測 99% 準,那當然 99% 有病」。錯!因為健康的人實在太多了:1000 人裡只有 10 人有病,卻有 990 人健康。就算健康人只有 1% 被誤判,那也是約 10 個偽陽性,剛好跟 10 個真陽性差不多。所以「陽性的人」裡,真有病的只佔一半。下面親手調調看。
🎮 三、動手玩:1000 人檢測模擬
每個方格 = 1 個人(共 1000 人)。拖動三個滑桿,看「陽性的人裡到底多少真有病」。
🗺️ 怎麼看
真陽性 TP:有病 + 驗出陽性
偽陽性 FP:健康卻被誤報
偽陰性 FN:有病卻沒驗到(漏診)
真陰性 TN:健康 + 陰性
重點看:所有「陽性」的人(紅 + 黃)裡,紅色(真有病)佔多少= P(病 | 陽)。把盛行率調很低,會看到黃色偽陽暴增、紅色比例變小——這就是悖論。
驗出陽性,真的有病的機率 P(病 | 陽)
50%
所有陽性的人裡,紅色(真陽)佔的比例
🔴 真陽性 TP10
🟡 偽陽性 FP10
🟠 偽陰性 FN0
⚪ 真陰性 TN980
🔢 四、訣竅:用「自然頻率」想最簡單
機率很容易讓人頭暈。改用「1000 個人裡有幾個」來想,貝氏定理瞬間變清楚。
用 1000 人重算上面那題(盛行率 1%、敏感度 99%、特異度 99%)
① 1000 人中,有病的 = 10 人,健康的 = 990 人。
② 10 個有病的:99% 驗出陽性 → 真陽性 ≈ 10 人。
③ 990 個健康的:1% 被誤判 → 偽陽性 ≈ 10 人。
④ 驗出陽性的總共 = 10 + 10 = 20 人,其中真有病 = 10 人。
P(病 | 陽) = 真陽 10真陽 10 + 偽陽 10 = 50%
是不是比硬背公式好懂多了?研究也證實,
用「自然頻率」教貝氏,比用百分比好懂非常多。
🧮 五、把公式對回來
剛剛的「20 人」其實就是公式分母 P(陽)。
P(病|陽) =
P(陽|病)·P(病)
P(陽|病)·P(病) + P(陽|健康)·P(健康)
分母 P(陽) 怎麼來
「總共多少人陽性」=「有病又陽性」+「健康卻陽性」= P(陽|病)·P(病) + P(陽|健康)·P(健康)(這叫全機率公式)。代入數字:0.99×0.01 + 0.01×0.99 = 0.0198,分子 0.99×0.01 = 0.0099,相除=50%。和數人頭完全一樣。
⚠️ 六、兩個經典陷阱(考試最愛)
① 基本率謬誤(Base Rate Fallacy)
只看「檢測多準」(概似),忽略了盛行率(先驗)。當事件本身很罕見,先驗很小,再準的證據也拉不高後驗——這就是上面悖論的本質。先驗很重要,不能忽略。
② 混淆 P(A|B) 與 P(B|A)(檢方謬誤)
P(陽|病)(有病時驗出陽性的機率,可能 99%)≠ P(病|陽)(驗出陽性時真有病的機率,可能只有 50%)。把這兩個當成一樣,是法庭、醫療裡常見的嚴重錯誤。兩者要用貝氏定理轉換,而且必須考慮先驗。
🌍 七、用在哪裡?
🩺 醫療判讀陽性結果到底代表什麼,要用盛行率校正。
📨 垃圾信過濾樸素貝氏就是把貝氏定理用在文字分類。
🔬 貝氏推論用資料持續更新對參數的信念(先驗→後驗)。
⚖️ 風險與證據評估金融風控、刑事證據都需要正確的條件機率。
🔗 和樸素貝氏的關係
樸素貝氏分類器就是把貝氏定理套到分類上:算每個類別的後驗機率、選最大的;再加上「特徵條件獨立」假設來簡化概似計算。所以貝氏定理是它的數學地基。
🧪 八、觀念自我檢測
先想再點開。
Q1. 先驗、概似、後驗分別是什麼?
先驗 P(A)=看證據前的機率;概似 P(B|A)=A 成立時看到證據的機率;後驗 P(A|B)=看到證據後更新的機率。關係:後驗 ∝ 概似 × 先驗。
Q2. 檢測 99% 準,盛行率 1%,驗出陽性真有病的機率約多少?
約 50%。因為健康人基數大(990 人),1% 偽陽就有約 10 人,和約 10 個真陽相當,所以陽性裡真有病的只佔一半。
Q3. P(A|B) 和 P(B|A) 一樣嗎?
不一樣!把兩者混為一談是「檢方謬誤」。例如 P(陽|病)≈99% 但 P(病|陽) 可能只有 50%。要用貝氏定理轉換,並考慮先驗。
Q4. 什麼是基本率謬誤?
做機率判斷時忽略了基本率(先驗/盛行率),只看眼前證據的準確度,導致嚴重高估。低盛行率時尤其明顯。
✅ 九、30 秒重點整理
貝氏定理 = 更新機率後驗 ∝ 概似 × 先驗;用證據修正信念。
P(A|B)=P(B|A)P(A)/P(B)分母 P(B) 用全機率公式算。
偽陽性悖論檢測很準,但低盛行率時陽性也常是偽陽。
用自然頻率想「1000 人裡有幾個」比百分比好懂。
別犯兩個謬誤基本率謬誤、混淆 P(A|B) 與 P(B|A)。
是樸素貝氏的地基分類器就是把它套到分類上。
📝 iPAS 考點提醒
貝氏定理用新證據更新機率,是樸素貝氏與貝氏推論的基礎,iPAS 中級科目二/三考點。重點:P(A|B)=P(B|A)P(A)/P(B);後驗正比於概似乘先驗,分母用全機率公式。易混點:別把 P(A|B) 與 P(B|A) 搞混(檢方謬誤);忽略先驗/基本率會嚴重高估(基本率謬誤),低盛行率時即使檢測很準、陽性也常是偽陽。情境:醫療檢測判讀、垃圾信過濾、風險評估。
想練情境題與詳解 → AI 學習與考證地圖
❓ 常見問題
貝氏定理在說什麼?
用新證據更新機率:後驗正比於概似乘先驗,公式為 P(A|B)=P(B|A)P(A)/P(B),把看證據前的信念修正成看證據後的信念。
先驗、概似、後驗分別是什麼?
先驗 P(A) 是看證據前的機率;概似 P(B|A) 是 A 成立時看到證據的機率;後驗 P(A|B) 是看到證據後更新的機率。
為什麼檢測很準、陽性卻常是偽陽?
當盛行率(先驗)很低,健康人基數大,即使偽陽性率低,偽陽人數仍可能與真陽相當,使 P(病|陽)不高;這就是基本率謬誤。
P(A|B) 和 P(B|A) 一樣嗎?
不一樣!混為一談是常見的檢方謬誤。例如 P(陽|病) 可能 99%,但 P(病|陽) 可能只有 50%;兩者要用貝氏定理轉換並考慮先驗。
貝氏定理和樸素貝氏的關係?
樸素貝氏就是把貝氏定理用在分類:計算各類後驗、選最大者,並加上特徵條件獨立假設來簡化概似計算。