做完才想證明因果,往往來不及。實驗規劃要事前決定:
要不要 A/B、需要多少樣本、如何設對照組——樣本太少,真實差異會被雜訊蓋過。
很多人做完分析才想「欸我能不能證明是這個原因造成的?」——往往已經來不及,因為當初沒收對資料、沒設對照組。實驗規劃就是在動手前先想好:要不要做 A/B 測試、需要多少樣本、要不要證明因果。
「相關」很容易看到,「因果」卻很難證明。想宣稱「是 A 造成 B」,幾乎都需要事前設計的實驗(隨機對照),事後補資料通常救不回來。
實驗規劃最關鍵的數字是樣本量。下面模擬一個 A/B 測試:B 版本其實比 A 好一點點。拖動每組樣本數,看樣本太少時,結果會因為隨機波動而根本看不出差異(甚至誤判 A 比較好)。
真實差異固定是 A=10%、B=12%。樣本少時多按幾次「重新抽樣」,會發現結果忽上忽下、不可靠;樣本夠大,B 才會穩定勝出。這就是為什麼要事先算樣本量。
| 要素 | 做什麼 | 沒做好的後果 |
|---|---|---|
| 假設 | 事前寫下要驗證的因果假設 | 事後找故事、p-hacking |
| 對照組 | 設沒受介入的基準組 | 無法歸因效果來自這招 |
| 隨機分組 | 隨機分配實驗單位 | 選擇偏差、結論不可信 |
| 樣本數/檢定力 | 事前用檢定力分析估樣本數 | 樣本太少偵測不到效果 |
| 控制變因 | 固定其他影響因素 | 混淆因子污染結論 |
良好的實驗規劃讓結論可信,iPAS 中級科目二考點。重點:動工前先定義假設、要量的指標、樣本數(檢定力分析)、對照組與隨機分組,並控制變因。易混點:沒先規劃就看資料找差異容易得到假陽性(p-hacking);樣本太小檢定力不足、看不出真實效果。情境:A/B 測試與商業實驗的設計、判斷某實驗設計是否嚴謹。
想練情境題與詳解 → AI 學習與考證地圖
要可靠判斷某改變是否真的有效,需事先規劃如何控制變因、分組、衡量,才不會被雜訊或偏差誤導。
實驗組接受新處理、對照組維持現狀;兩組其他條件盡量相同,差異才能歸因於處理本身。
隨機分組能平均掉年齡、習慣等未知干擾因素,讓兩組可比、差異可歸因,是能談因果的關鍵。
事前用效果量、顯著水準 α 與目標檢定力(常 0.8)做功效分析(power analysis),算出需要多少樣本,避免做了卻測不出。
偷看結果就停(peeking)、多重比較未校正、樣本不足、組間不可比、外部效度不足(實驗情境不代表真實)。