分布描述資料怎麼散開。偏態是關鍵:右偏資料(收入、房價)的平均會被少數高值拉高,
這時用中位數才能反映多數人的真實狀況。
分布(Distribution)描述資料怎麼散開。最重要的概念是偏態(Skewness):資料是對稱的鐘形,還是歪向一邊?收入、房價這類資料通常右偏(少數超有錢的把尾巴拉很長),這時「平均」會騙人,要看「中位數」。
左右平衡,平均≈中位數。
少數大值拉長右尾(如收入)。
少數小值拉長左尾。
右偏資料:平均 > 中位數(被高值拉高)。報「平均薪資」常讓人覺得「我怎麼沒這麼多」——因為被少數高薪拉高了,中位數才是多數人的真實感受。
拖動偏態程度,觀察平均和中位數怎麼分開。對稱時兩者重合;越偏,平均被尾巴拉得越遠,這時用中位數才能反映「典型值」。
記法:平均「重心」會被長尾那邊拉過去;中位數是「正中間那個人」,不受極端值影響。偏態大時,中位數更能代表多數人。
| 概念 | 意思 | 處理 |
|---|---|---|
| 常態分布 | 對稱鐘形 | 許多方法的前提假設 |
| 右偏(正偏) | 長尾在右(如收入) | log 轉換拉正 |
| 左偏(負偏) | 長尾在左 | 反射後轉換 |
| 類別不平衡 | 某類遠多於其他 | 重抽樣、調權重 |
資料分布與偏態影響分析與建模,iPAS 統計考點(中級科目二)。重點:看資料是常態、偏態還是長尾;許多方法假設常態,偏態資料(如收入、理賠額)常需轉換(取對數、Box-Cox)。易混點:平均數對偏態與離群敏感、會被拉偏,此時中位數更有代表性;常態假設不成立會讓某些檢定或模型失準。情境:判斷該不該轉換、用平均還是中位數描述。
想練情境題與詳解 → AI 學習與考證地圖
分布決定該用什麼統計量、轉換與模型假設;常態與否影響某些檢定是否適用,偏態會影響均值的代表性。
許多統計方法假設常態(部分檢定、線性迴歸殘差);近似常態時均值與標準差才好用。可用直方圖、Q-Q 圖或檢定判斷。
分布不對稱(右偏常見於金額、次數)。可用對數、平方根、Box-Cox 等轉換使其較對稱,讓模型與統計更穩。
目標類別比例懸殊會讓模型偏向多數類、Accuracy 失真;需用重抽樣、調整權重或改看 F1 與 PR-AUC。
會,這就是資料漂移;上線後輸入分布改變會讓模型退化,需持續監控並在必要時再訓練。