假設你在做電商會員分群,看到「消費金額」直方圖右邊拖很長,代表少數大戶把數值拉很高。這時直接做 KMeans 或線性模型,常會被大戶支配。
- 先畫直方圖看偏態。
- 若極度右偏,可試 Log1p。
- 轉換前後都再畫一次,確認是否更平衡。
這版可以直接互動:點圖卡可切換右側解說面板、按分類可篩選核心或延伸圖表、 展開實戰例子可看更貼近資料分析情境的說明。
假設你在做電商會員分群,看到「消費金額」直方圖右邊拖很長,代表少數大戶把數值拉很高。這時直接做 KMeans 或線性模型,常會被大戶支配。
如果你在分析「折扣幅度 vs 毛利率」,可能不是折扣越多毛利越低這麼簡單,而是某一段最有效,過頭反而更差。
你在比較不同門市的客單價時,平均數可能被少數超大單扭曲,但箱型圖可以直接看到每家店的中位數與離群值數量。
你做房價模型時,若「室內坪數」和「房間數」高度相關,兩者一起放進線性模型,係數可能會亂跳。
你在比較不同廣告渠道的轉單數時,長條圖會比圓餅圖更快看出誰最高、誰第二、差距多少。
你在預測每日訂單量時,如果隨機切 train/test,模型可能偷看到未來的節慶波峰,測試分數會虛高。
如果只想表達「A 類佔一半以上」,圓餅圖還可以;但若要比較 18%、21%、24% 這種細差,直接改長條圖比較快。
如果你在比較兩個 AI 模型:速度、成本、精度、穩定性、維護性,雷達圖很適合快速看出「誰偏哪一型」。
如果兩個客群的平均消費差不多,但其中一群其實有兩種人:超低消費與超高消費,小提琴圖比箱型圖更容易看出這種雙峰。
資料視覺化是 EDA 與溝通的關鍵,iPAS 考點(初級科目一、中級科目二)。重點:依資料型態選圖——分布用直方圖或箱形圖、關係用散布圖、比較用長條圖、趨勢用折線圖。易混點:Anscombe 四重奏提醒——統計量相同的資料畫出來可能天差地遠,只看摘要數字不夠;Y 軸不從 0 會誤導。情境:建模前先用圖看懂資料、誠實呈現結果。
想練情境題與詳解 → AI 學習與考證地圖
圖表能快速揭露趨勢、分布、離群與關係,比看數字表格更直覺;是探索分析(EDA)與溝通結果的關鍵。
比較類別用長條圖、看趨勢用折線圖、看分布用直方圖或箱形圖、看關係用散布圖、看占比用圓餅(類別少時)。
四組統計量幾乎相同的資料,畫出來卻完全不同;提醒只看摘要數字不夠,一定要視覺化看資料長相。
Y 軸不從 0 開始誇大差異、3D 與花俏效果失真、用圓餅比太多類別、色彩無障礙不佳;應力求誠實清楚。
一圖一重點、標題與軸標清楚、去除多餘裝飾(高資料墨水比)、顏色有意義且色盲友善、適當標註關鍵數值。