iPAS AI 應用規劃師 · 中級科目二核心

📊 iPAS 統計檢定選型速成

近兩屆科目二連著考同一種題型:給你一段情境,問「最適合採用哪一種統計方法」,選項把 t 檢定、雙比例 Z 檢定、卡方、ANOVA、Wilcoxon 全丟進來讓你分不清。這頁用一棵三步決策樹把它變成送分題,再加上 Z 檢定判決台與相關係數實驗室。

🧭 檢定選型決策樹⚖️ Z 檢定拒絕域與 p 值🔗 Pearson vs Spearman vs Kendall📌 全部對到歷屆真題

💡 先講白話:檢定到底在回答什麼

統計檢定只回答一句話:「我看到的差異,有沒有可能只是抽樣運氣?」
先假設沒有差異(虛無假設 H₀),再算「如果真的沒差異,出現我手上這種資料的機率有多低」——那個機率就是 p 值。p 值小於事先訂好的門檻 α(通常 0.05),就說「運氣解釋不了,拒絕 H₀」。
⚠️ 最常錯的一句話:p 值沒有小於 α 時,正確說法是「無法拒絕虛無假設」不是「接受虛無假設」、更不是「證明兩者沒有差異」。
這正是「女士品茶」真題的陷阱選項:「若女士未完全答對,則接受虛無假說,代表確認女士無此能力」——這句是錯的。沒證據 ≠ 證明沒有。

🔤 看到符號就卡住?先把這張表放旁邊

這頁會用到的符號全部列在下面,一行一個。數學的困難常常不是概念難,而是沒人告訴你那個圖案怎麼念、代表什麼——看不懂符號,整條式子就等於空白。

符號怎麼念在這頁的意思
Σsigma
西格瑪(大寫)
把一串東西全部加起來。下面寫從哪開始、上面寫到哪結束。
radical sign
根號
開根號。問「什麼數自己乘自己會得到它」。
|x|absolute value
絕對值
只看大小、不管正負。|−2| = 2
× ·multiplication
乘號兩種寫法
都是乘。差別純粹是歷史與排版習慣。
±plus-minus
正負號
兩個都要算。x̄ ± 1.96×SE=上下各抓一段,就是信賴區間。
=equals
等號
兩邊相等。
not equal
不等於
兩邊不相等。
≤ ≥less/greater than or equal
小於等於、大於等於
包含「剛好等於」的那個邊界。
if and only if
若且唯若
兩件事完全等價,一個成立另一個就成立,反之亦然。
μmu
謬(母體平均)
整個母體的真實平均值(相對於樣本平均 x̄)。
σ σ²sigma
西格瑪(標準差、變異數)
σ=標準差(資料多分散,單位同原資料);σ²=變異數(平方單位)。
ρ rrho / r
相關係數
兩個變數的線性關係強度,範圍 −1 到 1。
τtau
陶(Kendall 等級相關)
看「每一對資料的大小順序一不一致」算出的相關係數,比 Pearson 抗離群值。
αalpha
阿爾法(顯著水準)
你願意承擔的誤判機率上限,通常設 0.05。也就是第一類錯誤(偽陽性)的機率。
βbeta
貝塔(第二類錯誤機率)
該抓到卻沒抓到的機率(偽陰性)。檢定力 = 1 − β
χ²chi-square
卡方(念「卡」不念「柴」)
檢定兩個類別變數有沒有關聯的統計量。
~tilde
波浪號(服從某分布)
「服從」。X ~ N(0,1) 讀作「X 服從標準常態分布」。
N(μ, σ²)Normal
常態分布
平均是 μ、變異數是 σ² 的常態(鐘形)分布。
H₀ H₁null / alternative hypothesis
虛無假設、對立假設
H₀=「沒有差異」的預設立場;H₁=你想證明的那個。
pp-value
p 值
假設 H₀ 為真時,看到目前這種(或更極端)資料的機率。
x-bar
樣本平均
手上這批樣本的平均(相對於母體平均 μ)。
ZZ-score
標準分數
距離平均幾個標準差。Z = (x − μ) / σ
x₁ x₂subscript
下標
編號用。x₁, x₂, x₃ 是「第 1、2、3 個」,不是次方。
√ᵢ Σᵢindices
求和的上下界與指標 i
Σ 底下的 i=1、頂上的 n:從第 1 個加到第 n 個。i 是「跑號」。
🔍 想知道「為什麼是這個符號」?例如 Σ 其實是希臘文的 S,來自拉丁文 Summa(和)∫ 是一個被拉長的 S∂ 是圓體的 d——完整的 50 個符號來源、發明者與年代,都整理在 數學符號解碼器
那頁還會誠實標出哪些符號根本查不到出處(像機器學習學習率的 η,翻遍符號史文獻都沒人記載為什麼是它)——看不懂不是你的問題,是真的沒人寫下來。

🧭 實驗室 1:檢定選型決策樹 中級高頻

照著回答,三步之內告訴你該用哪個檢定,並附上對應的歷屆真題。這棵樹涵蓋了科目二出過的全部檢定選項。

📋 檢定方法一覽(選型的完整地圖) 中級

檢定在比什麼關鍵情境線索考過的題目
單樣本 t / Z 檢定一組平均數 vs 一個標準值「是否與原本的 100 萬元不同」「聲稱平均 36 分鐘」✅ 行銷策略月銷售額、咖啡外送時間
成對樣本 t 檢定同一批對象的前後兩次測量「同一批患者導入前後各測一次」✅ 40 位患者血壓前後測
獨立樣本 t 檢定兩組不同對象的平均數兩群人/兩台機器,彼此獨立常作為干擾選項
雙比例 Z 檢定兩組比例/百分比「良率 95% vs 97%」「轉換率 A vs B」✅ 兩條產線良率
One-Way ANOVA三組以上平均數「三種學習率」「避免多次兩兩比較膨脹型一錯誤」✅ 三組學習率驗證損失
卡方獨立性檢定兩個類別變數有沒有關聯「性別與是否購買」「地區與方案選擇」常作為干擾選項
Wilcoxon 符號等級成對資料,但不符合常態成對+序位資料/小樣本非常態常作為干擾選項
Mann-Whitney U兩組獨立,但不符合常態獨立+序位/偏態嚴重
🔑 三個一秒判斷的關鍵字:
看到「比例/百分比/良率/轉換率」→ 想比例 Z 檢定,不是 t 檢定。
看到「三組以上」或「避免多次兩兩比較」→ 想 ANOVA(多做幾次 t 檢定會把型一錯誤累積放大)。
看到「同一批人前後各測一次」→ 想成對,不是獨立樣本。

⚖️ 實驗室 2:Z 檢定判決台 中級

調整下面的數字,看檢定統計量落在拒絕域裡還是外面,同時對照 p 值與信賴區間——它們一定會給出同樣的結論

標準誤 σ/√n
檢定統計量 Z
臨界值
p 值
95% 信賴區間
🎯 真題還原(中級 科目二・計算題):咖啡店宣稱平均外送 36 分鐘、母體標準差 16 分鐘,抽 9 筆平均 40 分鐘,右尾檢定 α=0.05(臨界值 1.645)。
\( Z=\dfrac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}=\dfrac{40-36}{16/\sqrt{9}}=\dfrac{4}{5.333}=0.75 \)。0.75 < 1.645 → 落在拒絕域外 → 不拒絕虛無假設。
這題唯一的坑是分母:要除以標準誤 σ/√n,不是 σ。忘了開根號 n 就會算成 0.25。
🎯 p 值與信賴區間一定一致(中級 科目二):單樣本 t 檢定 p=0.08、95% 信賴區間 [95, 108] 萬,檢定值 100 萬 → 正解是「因 100 萬落在信賴區間內,無法拒絕虛無假設」
規則:雙尾檢定下,「μ₀ 落在 (1−α) 信賴區間內」⟺「p > α」⟺「不拒絕 H₀」。上面按第二顆 preset 可以自己驗證這條等價關係。

🎚️ α、型一型二錯誤與檢定力 中級

H₀ 其實是真的H₀ 其實是假的
拒絕 H₀型一錯誤(α)
偽陽性:沒效說成有效
✅ 正確(檢定力 1−β)
不拒絕 H₀✅ 正確型二錯誤(β)
偽陰性:有效卻沒抓到
🎯 真題還原(新藥試驗):把 α 從 0.05 降到 0.01,直接影響是什麼?→ 降低型一錯誤(偽陽性)的機率,減少把無效藥物誤判為有效、白花後續高成本試驗的風險
代價要記住:α 調小 → β 變大、檢定力下降(更容易錯過真的有效的藥)。兩者只能取捨,除非加大樣本數——那是唯一能同時改善兩邊的做法。
🎯 女士品茶真題:8 杯選 4 杯全對的機率是 \(1/\binom{8}{4}=1/70\approx0.014 < 0.05\),可以拒絕 H₀。但注意陷阱選項:「未完全答對就接受 H₀、確認女士無此能力」是錯的——統計只說「證據不足」,永遠不會證明 H₀ 為真。

完整的 α/β 互動拉扯在 型一與型二錯誤,信賴區間的 95% 到底在講什麼在 信賴區間互動模擬

🔗 實驗室 3:相關係數三兄弟 中級

Pearson、Spearman、Kendall 都在 [−1, 1] 之間,但抗打擊能力差很多。拖動下面兩根滑桿,看誰先崩。

Pearson r(線性關係)
Spearman ρ(排名相關)
Kendall τ(配對一致性)
長條長度代表絕對值強度。三者的理論範圍都是 [−1, 1]。
🎯 真題還原(中級 科目二):客戶滿意度 1–5 分(含明顯離群值)與退款率的相關性,問下列敘述何者不正確 → 答案是「與肯德爾相比,斯皮爾曼對離群值的穩健度更強」。
正確關係是反過來:Kendall τ 只看「每一對資料的大小順序一不一致」,比 Spearman 更穩健、也更適合小樣本與大量同分(tie)的情況。
其餘三句都是對的:Pearson 衡量線性;Spearman 就是「把數值換成排名後再算 Pearson」;三者範圍都在 [−1, 1]。
⚠️ 相關 ≠ 因果,而且相關係數 = 0 也不代表無關——它只代表「沒有那一種關係」。Pearson = 0 可能藏著漂亮的 U 型曲線。看到「明顯離群值」「序位/等第資料」「單調但非線性」這三個關鍵字,就該把 Pearson 換掉。

📦 敘述統計與圖形判讀(送分題區) 中級

指標意思被離群值影響?
平均數 Mean全部加總除以個數非常敏感(一筆 999 就拉走)
中位數 Median排序後正中間那個穩健,幾乎不動
眾數 Mode出現次數最多的值穩健;類別資料唯一能用的
標準差 SD資料離平均值的平均距離非常敏感
四分位距 IQRQ3 − Q1,中間 50% 的寬度穩健,離群值偵測的基礎
🎯 盒鬚圖三連問(都考過):
① 盒子但鬚 → 中段集中,但有極端值
② 中位數線偏向盒子下方 → 上半部拉得長 → 右偏(Skewness > 0)
③ IQR 極小、上鬚很長、高金額區一堆離群值,要凸顯消費層級差異 → 用對數刻度繪圖(不是刪掉離群值,那會丟失真實的高消費族群)。
🎯 離群值偵測兩把尺:IQR 法(低於 Q1−1.5×IQR 或高於 Q3+1.5×IQR)適合偏態資料;3σ 法(|Z| > 3)前提是資料近似常態。細節在 離群值偵測

🧪 抽樣、切分與資料洩漏 中級

做法什麼時候用
分層抽樣 Stratified類別比例不平衡時,確保每層在樣本中的比例與母體一致
分層 K-fold / 分層留一法樣本少又極度不平衡(如 150 筆、陽性 8%),要兼顧資料利用率與各折的類別比例——真題答案
時間序列切分有時間順序的資料,不能隨機打散,要用 Walk-Forward
⚠️ 資料洩漏真題(中級 科目二):團隊「在全體資料(含測試集)上計算相關係數並移除高度相關特徵」,之後測試 AUC 從 0.68 升到 0.81。正解是「在全體資料上做特徵篩選會造成資料洩漏,且線性相關無法捕捉非線性關係」
鐵律:任何用到 y 或全體統計量的處理(標準化、編碼、特徵篩選、填補),都必須在切分之後、只用訓練集算。測試集分數變好,有時候只是因為它偷看過答案。

延伸:資料洩漏分層留一法交叉驗證時間序列切分取樣偏差

✅ 自我檢測

Q1:兩條產線各抽 100 件,良率分別 95% 與 97%,要檢定差異是否顯著,該用哪個檢定?

雙比例 Z 檢定(Two-proportion Z-test)。關鍵字是「良率=比例」而不是平均數。t 檢定比的是平均數、卡方比的是類別關聯、ANOVA 要三組以上——全都不對。

Q2:三種學習率各重複訓練 10 次,想比較三組平均損失是否有顯著差異,而且要避免多次兩兩比較膨脹型一錯誤,該用什麼?

單因子變異數分析(One-Way ANOVA)。它一次檢定三組以上平均數是否相同。若改用兩兩 t 檢定要做 3 次,每次都有 5% 誤判風險,累積下來型一錯誤會遠超 5%。

Q3:40 名患者在導入 AI 用藥推薦「前後各測一次」血壓,資料近似常態,該用哪個檢定?

成對樣本 t 檢定(Paired Samples t-test)。同一批人的前後測是成對資料,不是兩群獨立的人。若資料不符常態,才換成 Wilcoxon 符號等級檢定。

Q4:μ₀=36、σ=16、n=9、x̄=40,右尾檢定 α=0.05(臨界值 1.645)。Z 是多少?結論?

\(Z=\frac{40-36}{16/\sqrt{9}}=\frac{4}{5.333}=0.75\)。0.75 < 1.645,不拒絕虛無假設。最常見的錯是分母忘了除以 √n(會算成 0.25)。

Q5:單樣本 t 檢定 p 值 = 0.08、95% 信賴區間 [95, 108]、檢定值 100。下列哪句對?

「因 100 落在信賴區間內,無法拒絕虛無假設」。p = 0.08 > 0.05 與「μ₀ 落在 95% CI 內」是同一件事的兩種說法,兩者必然一致。

Q6:把顯著水準從 α=0.05 降到 0.01,直接影響是什麼?付出什麼代價?

直接影響是降低型一錯誤(偽陽性)——比較不會把無效的東西誤判成有效。代價是型二錯誤 β 上升、檢定力下降,更容易漏掉真的有效的。想兩邊都改善只能加大樣本數

Q7:關於 Pearson / Spearman / Kendall,哪句是錯的?

錯的是「Spearman 比 Kendall 對離群值更穩健」——實際上Kendall 更穩健。其餘正確:Pearson 衡量線性;Spearman 等於把數值換成排名後算 Pearson;三者範圍都在 [−1, 1]。

Q8:在切分訓練/測試集之前,用全體資料算相關係數來篩掉高相關特徵,有什麼問題?

資料洩漏(Data Leakage)。測試集的資訊被帶進了特徵決策,評估分數會過度樂觀。此外線性相關係數也抓不到非線性關係,可能誤刪有用特徵。

🎯 重點整理(考前 5 分鐘掃這裡)

比例(良率、轉換率)→ 比例 Z 檢定;平均數 → t 檢定;三組以上平均數 → ANOVA;兩個類別變數 → 卡方獨立性檢定。
同一批對象前後測 → 成對 t 檢定;兩群不同對象 → 獨立 t 檢定;不符常態 → Wilcoxon(成對)/Mann-Whitney(獨立)。
Z 檢定公式:\(Z=\frac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}\),分母是標準誤,別忘了 √n。
p ≤ α 才拒絕 H₀;沒過只能說「無法拒絕」,不能說接受、更不能說證明沒差異
雙尾檢定下:μ₀ 落在 (1−α) 信賴區間內 ⟺ p > α ⟺ 不拒絕 H₀。三者必然一致。
α 調小 → 型一錯誤↓、型二錯誤↑、檢定力↓;唯一能同時改善兩邊的是加大樣本數
相關係數:Pearson 看線性、Spearman 是排名版 Pearson、Kendall 最穩健;三者都在 [−1, 1]。
敘述統計:平均數與標準差怕離群值,中位數與 IQR 穩健;盒子短鬚長=有極端值,中位線偏下=右偏。
資料洩漏:標準化、編碼、特徵篩選、填補都要在切分之後、只用訓練集算