A/B 測試把使用者隨機分兩組,比較新舊版本的指標。
隨機分組是精髓;樣本不足時,真實優勢會被雜訊蓋過——所以要先算樣本量。
A/B 測試是業界最常用的線上實驗:把使用者隨機分成兩組,A 組看舊版、B 組看新版,比較哪個的轉換率(或其他指標)較高。隨機分組是精髓——它讓兩組除了「看到的版本」之外,其他條件都相當,差異才能歸因於改版。
用戶隨機進 A 或 B。
轉換率、點擊率誰高。
樣本太少結論不可靠。
和「實驗規劃」呼應:A/B 測試一定要先算好樣本量、定好實驗期,中途偷看就停(peeking)會大幅增加誤判。
B 版真的比 A 版好一點(轉換率 10% vs 12%)。設定每組樣本數並開始收集,看結果是否達到統計顯著。樣本不足時,B 的優勢會被雜訊蓋過。
多按幾次「收集資料」:小樣本時結果忽上忽下、有時甚至 A 贏;放大樣本,B 才會穩定且顯著地勝出。這就是為什麼上線前要算樣本量。
| 要素 | 做什麼 |
|---|---|
| 隨機分流 | 使用者隨機分 A/B 兩組 |
| 單一變因 | 一次只改一個要素 |
| 樣本數/時長 | 事前算樣本、跑滿週期 |
| 顯著性 | 用檢定判斷差異是否顯著 |
A/B 測試用實驗科學驗證改版成效,iPAS 中級科目二高頻考點。重點:把使用者隨機分成對照組與實驗組、只改一個變因,再用假設檢定看差異是否顯著。易混點:隨機分組是能談因果的關鍵;要避免偷看提早下結論(peeking)、樣本數不足、或同時改太多變因;統計顯著要配合效果量。情境:判斷新功能或頁面是否真的更好。
想練情境題與詳解 → AI 學習與考證地圖
線上實驗的一種:把使用者隨機分成 A(對照)與 B(新版),比較關鍵指標,判斷新版是否真的更好。
隨機分流讓兩組除了版本不同、其他條件相近,指標差異就能歸因於版本改變,而非其他干擾因素。
事前用功效分析定樣本與時長;達到預定樣本前別偷看就下結論(避免假陽性);看主要指標與護欄指標(guardrail)。
提早停止、同時測太多變因、忽略新奇效應與週期性、樣本污染(同一人跨組)、只看顯著不看效果量。
A/B 固定分流、測完才決定;bandit 邊測邊把更多流量導向表現好的版本,較快獲利但分析較複雜。