A/B Testing · 線上實驗

A/B 測試

改版到底有沒有比較好?

A/B 測試把使用者隨機分兩組,比較新舊版本的指標。
隨機分組是精髓;樣本不足時,真實優勢會被雜訊蓋過——所以要先算樣本量。

隨機分組 + 足夠樣本 + 統計檢定 = 可信結論
01 — 白話直覺

網站改版,到底有沒有比較好?

A/B 測試是業界最常用的線上實驗:把使用者隨機分成兩組,A 組看舊版、B 組看新版,比較哪個的轉換率(或其他指標)較高。隨機分組是精髓——它讓兩組除了「看到的版本」之外,其他條件都相當,差異才能歸因於改版。

隨機分組
公平

用戶隨機進 A 或 B。

比指標
看數字

轉換率、點擊率誰高。

夠樣本
才可信

樣本太少結論不可靠。

和「實驗規劃」呼應:A/B 測試一定要先算好樣本量、定好實驗期,中途偷看就停(peeking)會大幅增加誤判。

02 — 核心互動

跑一場 A/B 測試

B 版真的比 A 版好一點(轉換率 10% vs 12%)。設定每組樣本數並開始收集,看結果是否達到統計顯著。樣本不足時,B 的優勢會被雜訊蓋過。

500
A 轉換率
B 轉換率
判定

多按幾次「收集資料」:小樣本時結果忽上忽下、有時甚至 A 贏;放大樣本,B 才會穩定且顯著地勝出。這就是為什麼上線前要算樣本量。

03 — 設計

A/B 測試要點

優點

  • 隨機分組,排除其他干擾
  • 事前算樣本量與實驗期
  • 用統計檢定判斷是否顯著

缺點 / 限制

  • 偷看就停(peeking)→ 假陽性暴增
  • 樣本太少 → 看不出真實差異
  • 只看轉換率,忽略其他副作用指標

關鍵要素

🎲
隨機
用戶公平分流
📏
樣本量
事前用 MDE 計算
⏱️
實驗期
跑滿,不中途喊停
04 — 速記與對照

A/B 測試要點

要素做什麼
隨機分流使用者隨機分 A/B 兩組
單一變因一次只改一個要素
樣本數/時長事前算樣本、跑滿週期
顯著性用檢定判斷差異是否顯著

自我檢測

為什麼 A/B 測試能證明因果?
隨機分流讓兩組除了「被測的改動」外其他條件平均一致,差異可歸因於該改動,是線上因果的黃金作法。
要跑多久、看什麼?
事前用檢定力分析定樣本數,跑滿完整週期(避開週末效應),看核心指標差異與統計顯著性,別偷看提早停。
A/B 測試和多臂拉霸差在哪?
A/B 固定分流、跑完再決定(重推論);多臂拉霸邊測邊把流量導向較優者(重即時收益),適合持續優化。

🎯 重點整理

  1. 隨機分流→可歸因、證因果。
  2. 一次只改一個變因。
  3. 事前定樣本數、跑滿週期。
  4. 別偷看提早停(peeking)。
  5. 拉霸邊測邊導流、A/B 跑完再決定。

📝 iPAS 考點提醒

A/B 測試用實驗科學驗證改版成效,iPAS 中級科目二高頻考點。重點:把使用者隨機分成對照組與實驗組、只改一個變因,再用假設檢定看差異是否顯著。易混點:隨機分組是能談因果的關鍵;要避免偷看提早下結論(peeking)、樣本數不足、或同時改太多變因;統計顯著要配合效果量。情境:判斷新功能或頁面是否真的更好。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

A/B 測試是什麼?

線上實驗的一種:把使用者隨機分成 A(對照)與 B(新版),比較關鍵指標,判斷新版是否真的更好。

為什麼能證明因果?

隨機分流讓兩組除了版本不同、其他條件相近,指標差異就能歸因於版本改變,而非其他干擾因素。

要跑多久、看什麼?

事前用功效分析定樣本與時長;達到預定樣本前別偷看就下結論(避免假陽性);看主要指標與護欄指標(guardrail)。

常見錯誤有哪些?

提早停止、同時測太多變因、忽略新奇效應與週期性、樣本污染(同一人跨組)、只看顯著不看效果量。

A/B 測試和多臂拉霸(bandit)差在哪?

A/B 固定分流、測完才決定;bandit 邊測邊把更多流量導向表現好的版本,較快獲利但分析較複雜。

🧭 相關主題

← 返回 AI 學習與考證地圖