🗺️ AI 學習與考證地圖
統計基礎 · 假設檢定

統計檢定家族 t/F/卡方 χ²

驚喜睜大眼的 Mochi 貓老師面對藍紫綠三組統計檢定道具

三者的目的完全一樣——看到差異時,判斷這是真的,還是只是運氣。差別只在你要檢查的「差異」是哪一種:平均數、多組平均、還是類別次數。

t → 兩組平均F → 多組平均 / ANOVAχ² → 類別、次數、比例p < α 才有證據ANOVA 後要事後比較

💡一句話定義

好奇歪頭的 Mochi 貓老師把三種資料卡分類到彩色抽屜
t、F、卡方是統計學裡三個最常用的檢定家族。它們回答的是同一個問題——這個差異是真的,還是隨機造成的?——只是針對不同的資料型態,用不同的統計量去衡量。
📏t 檢定
平均數。A、B 兩組平均有沒有不同?
One-sample t、Independent t、Paired t
📊F 檢定
多組平均/變異/整體模型。A、B、C 三組至少一組不同嗎?
ANOVA、迴歸的整體 F 檢定
🔢卡方 χ²
類別、次數、比例。性別跟購買與否有沒有關係?
獨立性檢定、適合度檢定
共同的語法:先立一個虛無假設 H₀(「其實沒有差」),算出在 H₀ 成立的世界裡、出現眼前這種資料的機率=p 值,再跟事先訂好的門檻 α(通常 0.05)比。p < α → 有證據推翻「沒有差」;p ≥ α → 證據不足,不是「證明沒差」。

🧭互動一:三秒選型決策樹

偵探般專注的 Mochi 貓老師拿放大鏡查看分岔選型路牌

大部分的題目只要問兩三個問題就能定案。跟著回答,或直接按下面的例題讓它自己跑一遍。

檢定選型決策樹

先看 Y(你關心的結果)是數字還是類別,再看要比幾組

一鍵帶入例題:

📏t 檢定:比較「平均」

吐小舌專注的 Mochi 貓老師用尺比較兩籃分數圓片

兩種教學方法,A 班平均 80 分、B 班平均 85 分。你不能看到 85 > 80 就宣布 B 比較好——有可能只是剛好 B 班學生比較強。

所以做 t 檢定,先立 H₀:兩班平均其實相同。假設算出 p = 0.01、而 α = 0.05,因為 p < α,結論是:如果兩班真的沒差,出現這麼大差異的機率只有 1%,太不合理了,所以有證據認為兩班平均確實不同。

關鍵直覺:p 值不是只看「差多少」。同樣是差 5 分,如果班內同學成績很集中、人數又多,那 5 分就很難用運氣解釋;如果班內本來就參差不齊、人數又少,5 分根本不算什麼。下面自己拉拉看。

t 檢定判決台:差距一直都是 5 分

A 班平均 80、B 班平均 85 固定不動,只調整「班內離散程度」與「每班人數」

平均差距5.00 分
t 統計量2.635
自由度 df38
p 值(雙尾)0.0121
t 家族的三個成員:
· One-sample t:一組 vs 一個固定標準(這批燈泡平均壽命有沒有到宣稱的 1000 小時?)
· Independent t:兩批不同的人(男生 vs 女生的平均薪資)
· Paired t同一批人前後兩次(同一群病人治療前 vs 治療後的血壓)
配對的資料如果誤用獨立版,等於把「每個人自己前後的變化」這個最重要的資訊丟掉,檢定力會掉一大截。

📊F 檢定:三組以上就換武器

嚴肅戴端正圓眼鏡的 Mochi 貓老師比較三組圓片與波動

現在有三種教學法:A 80 分、B 85 分、C 92 分。如果硬要兩兩做 t 檢定(A vs B、A vs C、B vs C),做越多次、至少誤判一次的機率就越高。所以改用 ANOVA(變異數分析),而 ANOVA 的核心統計量就是 F。

F 的概念非常直覺,就是一個比值:
F = 組間差異 ÷ 組內差異
如果 A 班大家都在 79~81、B 班都在 84~86、C 班都在 91~93——每組自己內部很整齊、三組彼此拉很開,F 就會很大,「三組完全相同」這個假設就顯得很不合理。

F = 組間 ÷ 組內

三組平均固定在 80 / 85 / 92,只調整組內波動與每組人數

組間 MSbetween363.33
組內 MSwithin100.00
F = 組間÷組內3.633
自由度(2, 27)
p 值0.0401

為什麼不能兩兩硬做 t 檢定?族系誤差率(α=0.05):

3 組 → 3 對 → 14.26%
4 組 → 6 對 → 26.49%
5 組 → 10 對 → 40.13%
10 組 → 45 對 → 90.06%

計算方式 1 −(1 − 0.05)對數。10 組兩兩比完,幾乎保證至少誤判一次。

ANOVA 顯著只說了一半。p < 0.05 的意思是「至少有一組不一樣」,它不會告訴你是 A vs B、A vs C 還是 B vs C。想知道兇手是誰,一定要再做 事後比較(Post-hoc test),例如 Tukey HSD。上面的預設情境就是典型例子:ANOVA p = 0.0401 顯著,但校正後其實只有 A vs C 撐得住。

🔢卡方 χ²:資料是「人數」不是「平均」

懷疑側眼的 Mochi 貓老師用格狀對帳板清點類別積木

卡方跟前兩個很不一樣。它比的不是平均身高、平均成績、平均收入,而是人數/次數/比例符不符合預期。看到男/女、iPhone/Android、買/不買、是/否、A/B/C 類別,就往卡方想。

卡方的想法只有一句話:把實際觀察到的次數 O 跟「如果兩者完全沒關係、理論上該出現的次數 E」擺在一起比。
χ² = Σ (O − E)² ÷ E
差越大 → χ² 越大 → 越不像只是隨機造成的。

卡方 O vs E 對帳台

直接改格子裡的人數,期望值 E、每格貢獻與 χ² 會即時重算

買 iPhone買 Android列總和
100
100
欄總和 11090 200

每一格的對帳(O = 實際、E = 如果沒關係該有的、下方是這格對 χ² 的貢獻):

買 iPhone買 Android
χ² 統計量50.505
自由度 df1
p 值1.19e-12
最小期望值45.0
兩個實務注意事項:
· 期望值不能太小。一般要求每格 E ≥ 5(至少 80% 的格子),否則卡方近似會失準,改用 Fisher 精確檢定。
· 2×2 表的 Yates 連續性校正。scipy.stats.chi2_contingency 對 2×2 表預設會校正:上面手算的 50.505 在校正後會變成 48.505(p 從 1.19e-12 變 3.29e-12)。想拿到跟公式一致的數字要傳 correction=False

🧠最簡單的記法

閉眼開心笑的 Mochi 貓老師拋接藍紫綠三組記憶工具
t → 兩組平均數  F → 多組平均數 / ANOVA  χ² → 類別、次數、比例
題目第一反應為什麼
男生女生「平均薪資」是否不同Independent tY 是數字、兩組、兩批不同的人
A/B/C 三種廣告的「平均銷售額」是否不同ANOVA(F 檢定)Y 是數字、三組以上
性別與「購買/不購買」是否有關卡方 χ²兩邊都是類別,資料是人數
治療前後「平均血壓」是否不同Paired tY 是數字、同一批人前後測
四個地區的品牌偏好是否不同卡方 χ²地區與品牌都是類別,資料是次數

一張圖收尾

你的 Y(結果)是數字嗎?
│
├─ 是(平均、金額、分數)
│   │
│   ├─ 跟一個固定標準比 ────────→ One-sample t
│   │
│   ├─ 比兩組平均
│   │   ├─ 同一批人前後測 ──────→ Paired t
│   │   └─ 兩批不同的人 ────────→ Independent t
│   │
│   └─ 比三組以上平均 ──────────→ ANOVA(F 檢定)
│                                    └─ 顯著後再做 Post-hoc
│
└─ 不是,是類別/人數 ────────────→ 卡方 χ²
                                      (獨立性檢定/適合度檢定)

🧬再往下一層:它們其實是一家人

恍然大悟的 Mochi 貓老師把兩組與多組卡片連成同一家族

t 檢定、ANOVA、線性迴歸是同一個框架的三種長相——都屬於一般線性模型(General Linear Model)。卡方則走另一條路,專攻類別資料。

🔗t = 只有兩組的 ANOVA
兩組時 F = t²,兩個檢定的 p 值完全相同。
📈ANOVA = 用類別當自變數的迴歸
把組別做成虛擬變數丟進迴歸,整體 F 檢定就是 ANOVA 的 F。
🤖χ² 走進機器學習
SelectKBest(chi2) 的特徵選擇、A/B 測試的轉換率比較,用的都是同一套。
這個關係對理解機器學習很有用:Logistic Regression 處理的是類別型的 Y,正是「線性模型」往類別資料延伸的產物;特徵選擇裡的 f_classif 用的是 ANOVA 的 F、chi2 用的是卡方;A/B 測試比轉換率用卡方、比客單價用 t 檢定。選錯武器,整個結論就不成立。

📌常見誤解

警覺豎耳的 Mochi 貓老師拿紅色小旗阻止錯誤統計判讀
p = 0.01 是不是代表「H₀ 為真的機率只有 1%」?
不是。p 是「假設 H₀ 為真的前提下,觀察到目前這麼極端(或更極端)結果的機率」,方向剛好相反。它是「在 H₀ 世界裡這批資料有多罕見」,不是「H₀ 有多可能是對的」。
p ≥ 0.05 是不是就證明兩組沒有差別?
不是。只能說證據不足。樣本太少、變異太大,都會讓真實存在的差異驗不出來。上面的判決台就是例子:同樣差 5 分,n=10、s=15 時 p = 0.4657,但差距明明存在。
ANOVA 顯著了,是不是三組互相都不一樣?
不是。只代表至少有一組跟別人不同。預設情境的 ANOVA p = 0.0401 顯著,但 Bonferroni 校正後只有 A vs C(差 12 分)站得住,A vs B 與 B vs C 都不顯著。
顯著是不是就代表這個差異很重要?
兩回事。樣本一大,再小的差距都會顯著。所以除了 p 值,還要看效果量(t 家族看 Cohen's d、ANOVA 看 η²、卡方看 Cramér's V)和信賴區間,才知道差異在實務上值不值得在意。
卡方可以用在「平均值」上嗎?
不行。卡方吃的是次數(人數、件數),不是平均或百分比本身。如果手上是「男生平均花 3,200 元、女生平均花 2,800 元」,那是平均數的問題,該用 t 檢定;要用卡方就得先把資料變成「高消費/低消費」的人數格子。
α 為什麼常常是 0.05?
純屬慣例,不是天條。α 是你願意承受的型一錯誤(沒差卻說有差)比率。醫療或高風險場景會壓到 0.01,探索性研究可能放寬到 0.1。重點是事先訂好,不是看到 p 值再回頭決定門檻。

📝 iPAS 考點提醒

t/F/卡方的選型是 iPAS 中級科目二統計基礎的高頻考點。三句話定生死:t 看兩組平均(One-sample/Independent/Paired)、F 看三組以上平均(ANOVA、迴歸整體檢定)、χ² 看類別次數(獨立性檢定、適合度檢定)。判斷順序:先問 Y 是數字還是類別 → 數字再問幾組 → 兩組再問是否配對。四個易錯點:(1) ANOVA 顯著只代表「至少一組不同」,要做事後比較(Tukey HSD)才知道是哪幾組;(2) 三組兩兩硬做 t 檢定,族系誤差率從 5% 膨脹到 14.26%;(3) p 值不是「H₀ 為真的機率」,p ≥ α 也不等於「證明沒差」;(4) 卡方吃次數不吃平均,且每格期望值要 ≥ 5,2×2 表在 scipy 預設會做 Yates 校正。

延伸:統計檢定選型速成Welch t 檢定判讀假設檢定與 p 值

❓ 常見問題

t 檢定、F 檢定、卡方檢定差在哪?

目的相同,都是判斷「差異是真的還是隨機造成的」,差別在資料型態:t 比兩組平均、F(ANOVA)比三組以上平均、卡方比類別的次數與比例。

什麼時候該用 ANOVA 而不是 t 檢定?

要比三組以上的平均時。兩兩硬做 t 檢定會讓誤判機率膨脹——三組要比 3 對,至少誤判一次的機率從 5% 升到 14.26%;十組要比 45 對,膨脹到 90.06%。

ANOVA 顯著之後還要做什麼?

做事後比較(Post-hoc test),例如 Tukey HSD 或 Bonferroni 校正的兩兩比較。ANOVA 只告訴你「至少有一組不同」,不會指出是哪幾組。

Paired t 和 Independent t 怎麼選?

看是不是同一批對象量兩次。治療前後的血壓是同一批人 → Paired;男生 vs 女生的薪資是兩批不同的人 → Independent。誤用獨立版會丟掉配對資訊、檢定力大幅下降。

卡方檢定的期望值 E 怎麼算?

E = 該列總和 × 該欄總和 ÷ 總人數。例如男生 100 人、買 iPhone 共 110 人、總共 200 人,則「男 × iPhone」的期望值是 100×110÷200 = 55。χ² = Σ(O−E)²÷E。

p 值小是不是就代表差異很重要?

不是。樣本一大,再小的差距都會顯著。除了 p 值還要看效果量(t 看 Cohen's d、ANOVA 看 η²、卡方看 Cramér's V)與信賴區間,才知道差異在實務上有沒有意義。

🧭 相關主題

← 返回 AI 學習與考證地圖