Distribution & Skewness

分布 / 偏態

對稱還是歪一邊?

分布描述資料怎麼散開。偏態是關鍵:右偏資料(收入、房價)的平均會被少數高值拉高,
這時用中位數才能反映多數人的真實狀況。

右偏:平均 > 中位數 | 對稱:平均 ≈ 中位數
01 — 白話直覺

資料是『對稱』還是『歪一邊』?

分布(Distribution)描述資料怎麼散開。最重要的概念是偏態(Skewness):資料是對稱的鐘形,還是歪向一邊?收入、房價這類資料通常右偏(少數超有錢的把尾巴拉很長),這時「平均」會騙人,要看「中位數」。

對稱
正態

左右平衡,平均≈中位數。

右偏
尾巴在右

少數大值拉長右尾(如收入)。

左偏
尾巴在左

少數小值拉長左尾。

右偏資料:平均 > 中位數(被高值拉高)。報「平均薪資」常讓人覺得「我怎麼沒這麼多」——因為被少數高薪拉高了,中位數才是多數人的真實感受。

02 — 核心互動

拖動偏態,看平均與中位數如何分家

拖動偏態程度,觀察平均中位數怎麼分開。對稱時兩者重合;越偏,平均被尾巴拉得越遠,這時用中位數才能反映「典型值」。

右偏
平均
中位數
該用哪個?

記法:平均「重心」會被長尾那邊拉過去;中位數是「正中間那個人」,不受極端值影響。偏態大時,中位數更能代表多數人。

03 — 應用

分布與偏態的用途

優點

  • 看偏態決定用平均還是中位數
  • 偏態大時考慮做對數轉換
  • 直方圖/箱型圖一眼看出分布

缺點 / 限制

  • 右偏資料用平均 → 高估典型值
  • 假設常態卻是偏態 → 統計檢定失準
  • 忽略雙峰 → 把兩群當成一群

觀察工具

📊
直方圖
看整體形狀與峰
📦
箱型圖
看中位數、四分位、離群
📈
Q-Q圖
檢查是否接近常態
04 — 速記與對照

分布與偏態

概念意思處理
常態分布對稱鐘形許多方法的前提假設
右偏(正偏)長尾在右(如收入)log 轉換拉正
左偏(負偏)長尾在左反射後轉換
類別不平衡某類遠多於其他重抽樣、調權重

自我檢測

為什麼要看資料分布?
分布決定該用什麼統計方法與轉換;偏態、離群、多峰都會影響均值代表性與模型表現。
偏態是什麼、怎麼處理?
分布不對稱:右偏長尾在右(收入)、左偏在左。常用 log/開根號等轉換拉近常態,穩定變異。
為什麼類別不平衡也是分布問題?
目標類別分布極不均(如 99:1),會讓模型偏向多數類;需重抽樣、調類別權重或改看 F1/AUC。

🎯 重點整理

  1. 先看分布:對稱、偏態、多峰、離群。
  2. 右偏常用 log 轉換拉正。
  3. 偏態影響均值代表性與模型。
  4. 類別不平衡是分布問題,需處理。
  5. 上線後分布會漂移(drift),要監控。

📝 iPAS 考點提醒

資料分布與偏態影響分析與建模,iPAS 統計考點(中級科目二)。重點:看資料是常態、偏態還是長尾;許多方法假設常態,偏態資料(如收入、理賠額)常需轉換(取對數、Box-Cox)。易混點:平均數對偏態與離群敏感、會被拉偏,此時中位數更有代表性;常態假設不成立會讓某些檢定或模型失準。情境:判斷該不該轉換、用平均還是中位數描述。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

為什麼要看資料分布?

分布決定該用什麼統計量、轉換與模型假設;常態與否影響某些檢定是否適用,偏態會影響均值的代表性。

常態分布有什麼重要性?

許多統計方法假設常態(部分檢定、線性迴歸殘差);近似常態時均值與標準差才好用。可用直方圖、Q-Q 圖或檢定判斷。

偏態(skewness)是什麼、怎麼處理?

分布不對稱(右偏常見於金額、次數)。可用對數、平方根、Box-Cox 等轉換使其較對稱,讓模型與統計更穩。

為什麼類別不平衡也是分布問題?

目標類別比例懸殊會讓模型偏向多數類、Accuracy 失真;需用重抽樣、調整權重或改看 F1 與 PR-AUC。

分布在上線後會變嗎?

會,這就是資料漂移;上線後輸入分布改變會讓模型退化,需持續監控並在必要時再訓練。

🧭 相關主題

← 返回 AI 學習與考證地圖