我們很少有全部資料,都是抽樣分析。但抽樣方式有偏,樣本就不能代表母體。
取樣偏差是資料工作最隱形、最致命的坑。
我們很少能拿到「全部」資料,多半是抽一部分來分析。但如果抽樣方式有偏,樣本就不能代表母體,再厲害的分析也會得到錯誤結論。這叫取樣偏差(Sampling Bias),是資料工作最隱形、最致命的坑。
每個樣本機會均等,最具代表性。
只抽到某一群,以偏概全。
只看到成功/留下的,忽略失敗的。
經典案例:二戰只看飛回來的飛機彈孔來補強,其實該補強的是「沒飛回來」那些被打中的部位——倖存者偏差。
母體裡有藍和橘兩群,真實比例各半。切換抽樣方式,看抽出的樣本比例——偏差抽樣會讓你以為某一群特別多,做出錯誤判斷。
真實母體是 50:50。隨機抽樣的樣本會接近 50:50;偏差抽樣(只抽右半邊,那裡橘色多)會嚴重高估橘色,讓你誤判。
| 方法 | 怎麼做 | 適合/風險 |
|---|---|---|
| 簡單隨機 | 每筆等機率抽 | 簡單;小樣本可能不均 |
| 分層抽樣 | 依類別分層再各抽 | 保留比例、更具代表性 |
| 過抽樣 | 複製或合成少數類(SMOTE) | 平衡不平衡;可能過擬合 |
| 欠抽樣 | 減少多數類 | 平衡但損失資料 |
取樣偏差會讓結論失真,iPAS 中級科目二高頻陷阱題。重點:樣本必須具代表性,抽樣方法(隨機、分層、叢集)影響結果能否推論到母體。易混點:倖存者偏差(只看活下來的)、選擇偏差、自我選擇偏差是常見陷阱;樣本再大、有系統性偏差也救不回。情境:給一個調查或資料蒐集情境,問結論為何不可靠、或哪種抽樣較適當。
想練情境題與詳解 → AI 學習與考證地圖
全量資料太大難處理時,用具代表性的樣本能加速分析與建模;也用於切分資料集與處理不平衡。
隨機抽樣每筆等機率;分層抽樣先依重要屬性(如類別)分層、各層按比例抽,確保樣本結構與母體一致,尤其重要於不平衡資料。
處理類別不平衡:過抽樣增加少數類(複製或 SMOTE 合成)、欠抽樣減少多數類,目的是讓模型別只學多數類。
樣本不具母體代表性(如只抽到某族群)會讓結論與模型偏誤;設計抽樣時要確保涵蓋與隨機性。
切分本身就是抽樣;不平衡時用分層切分維持各折類別比例,時間序列則用時序切分而非隨機。