EDA 是建模前用圖表摸清資料長相:分布、關係、異常。
新手常只看平均——但平均一樣,分布可能天差地遠,所以一定要畫圖。
EDA(探索性資料分析)就是在做模型之前,先用圖表和統計摸清楚資料的長相:分布是什麼樣、變數之間有沒有關係、有沒有怪東西。這一步幫你提早發現問題、產生假設,避免後面白做。
資料集中在哪、有沒有偏。
變數之間有沒有相關。
離群值、缺失、錯誤。
這頁是 EDA 總覽。下面三個子題(分布/偏態、相關/關聯、視覺化)各有專頁。
新手常只看「平均數」,但平均一樣的資料,分布可能完全不同!切換下面四組資料(平均都≈50),看 EDA 為什麼一定要畫圖、不能只看一個數字。
四組平均都接近 50,但形狀完全不同。「只看平均」會錯過雙峰(其實是兩群人)、離群值(被拉高的假象)。這就是 EDA 的價值。
| 面向 | 看什麼 | 常用工具 |
|---|---|---|
| 單變量 | 分布、集中與離散、偏態 | 直方圖、箱型圖 |
| 雙變量 | 相關、關聯、趨勢 | 散佈圖、熱力圖 |
| 缺失/異常 | 缺失比例、離群 | 缺失矩陣、箱型圖 |
| 類別 | 各類佔比、不平衡 | 長條圖、次數表 |
探索性資料分析(EDA)在建模前先看懂資料,iPAS 考點(初級科目一、中級科目二)。重點:用敘述統計與視覺化看分布、缺值、離群、相關性與類別比例,形成假設、指導後續清理與建模。易混點:EDA 是理解資料、不是驗證假設(那是後續統計檢定);跳過 EDA 直接建模常踩坑(如沒發現嚴重不平衡)。情境:CRISP-DM 的資料理解階段、選對圖表看資料。
想練情境題與詳解 → AI 學習與考證地圖
正式建模前用統計摘要與視覺化認識資料——看分布、關係、缺失、異常,形成假設並指引後續清理與特徵工程。
單變數(分布、集中與離散、偏態)、雙變數(相關、交叉表)、缺失與離群、類別比例(是否不平衡),以及目標與特徵的關係。
直方圖與箱型圖看分布、散點圖看關係、熱力圖看相關矩陣、長條圖看類別、折線圖看時間趨勢。
能及早發現資料品質問題、避免錯誤假設、找出有用特徵與風險(洩漏、不平衡),省下後面大量返工。
EDA 是開放式探索、產生假設、重視視覺與直覺;統計推論是用檢定驗證特定假設、給出顯著性結論,兩者互補。