Hypothesis Testing · p-value

假設檢定

p-value 到底在說什麼?

假設檢定的核心是 p-value:假設『沒差異』時,純靠運氣也看到這種結果的機率。
p 很小 → 不像巧合 → 認定有顯著差異。但顯著 ≠ 重要。

p < α(0.05) → 拒絕 H₀(有顯著差異)
01 — 白話直覺

p-value 到底在說什麼?

假設檢定是統計的核心,但 p-value 最常被誤解。白話說:先假設「沒差異」(虛無假設 H₀),p-value 是「如果真的沒差異,卻看到這麼大差異的機率」。p 很小(通常<0.05)→「巧合機率太低」→ 推翻「沒差異」,認定有顯著差異。

一句話記住

p-value 不是「假設為真的機率」。它是:假設沒差異時,純靠運氣也能看到這種結果的機率。p 越小,越不像是運氣。

門檻 α(顯著水準,常設 0.05)是事先講好的界線。p < α → 拒絕 H₀(有顯著差異);p ≥ α → 證據不足,無法拒絕。

02 — 核心互動

看 p-value 怎麼隨差異與樣本變

調整兩組的差異樣本數,看 p-value 如何變化。差異越大、樣本越多,p 越小、越「顯著」。體會「顯著」是怎麼來的。

30
100
p-value
結論(α=0.05)

注意陷阱:樣本超大時,連「微不足道的差異」也會變顯著(p<0.05)。所以除了 p-value,還要看「效果量」——差異大到有實務意義嗎?

03 — 注意

假設檢定的眉角

優點

  • 客觀判斷差異是否超出隨機波動
  • 流程標準化,可重現
  • 搭配效果量,兼顧統計與實務

缺點 / 限制

  • p<0.05 不代表『重要』,只代表『不太像巧合』
  • p-hacking:偷看資料、反覆檢定
  • 大樣本讓無意義差異也顯著

常見檢定

📊
t 檢定
比較兩組平均
📈
ANOVA
比較三組以上
🎲
卡方檢定
類別變數關聯
04 — 速記與對照

假設檢定要素

概念意思
虛無假設 H0預設沒有效果/沒有差異
p 值H0 為真下、看到此或更極端結果的機率
顯著水準 α拒絕 H0 的門檻(常 0.05)
型一錯誤假陽性:H0 真卻拒絕
型二錯誤假陰性:H0 假卻沒拒絕

自我檢測

p 值是什麼、常見誤解?
p 值是「H0 為真時看到此或更極端結果的機率」;它不是「H0 為真的機率」,也不代表效果大小。
顯著水準與型一、型二錯誤?
α 是可接受的假陽性率(常 0.05);型一錯誤=誤拒真 H0(假陽性)、型二錯誤=沒拒假 H0(假陰性),兩者需權衡。
統計顯著等於實務重要嗎?
不等於。大樣本下微小差異也可能顯著;要同時看效果量(實務意義),別只看 p<0.05。

🎯 重點整理

  1. 檢定:用資料判斷是否拒絕虛無假設。
  2. p 值=H0 下看到此結果的機率(非 H0 為真機率)。
  3. α=顯著門檻;型一(假陽)、型二(假陰)。
  4. 統計顯著≠實務重要,要看效果量。
  5. 多重檢定要校正(如 Bonferroni)。

📝 iPAS 考點提醒

假設檢定判斷觀察到的差異是否並非偶然,iPAS 中級科目二考點。重點:設虛無假設(H0,無差異)與對立假設,用 p 值與顯著水準(常 0.05)決定是否拒絕 H0。易混點:p 值小代表顯著、但不等於效果大(要看效果量);型一錯誤(冤枉好人)與型二錯誤(放走壞人)要分清;不顯著不等於沒差異。情境:A/B 測試判斷新版是否真的更好。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

假設檢定在做什麼?

用樣本判斷關於母體的假設是否成立;設虛無假設 H0(通常為沒差異)與對立假設 H1,看資料是否有足夠證據拒絕 H0。

p 值是什麼、常見誤解?

p 值是「假設 H0 為真時,觀察到目前或更極端結果的機率」;誤解:它不是 H0 為真的機率,也不代表效果大小。

顯著水準與型一、型二錯誤?

α(常 0.05)是允許的型一錯誤率(H0 真卻誤拒、假陽性);型二錯誤是 H0 假卻沒拒(假陰性),兩者需權衡。

統計顯著等於實務重要嗎?

不等於。大樣本下微小差異也可能顯著但無實務意義;要同時看效果量(effect size)與信賴區間。

常見檢定有哪些?

t 檢定(比較平均)、卡方檢定(類別關聯)、ANOVA(多組平均)、相關檢定等,依資料型態與問題選擇。

🧭 相關主題

← 返回 AI 學習與考證地圖