EDA · 探索性資料分析

探索分析 EDA

建模前,先跟資料聊聊天

EDA 是建模前用圖表摸清資料長相:分布、關係、異常。
新手常只看平均——但平均一樣,分布可能天差地遠,所以一定要畫圖。

看分布 + 看關係 + 找異常 = 產生假設
01 — 白話直覺

建模之前,先跟資料『聊聊天』

EDA(探索性資料分析)就是在做模型之前,先用圖表和統計摸清楚資料的長相:分布是什麼樣、變數之間有沒有關係、有沒有怪東西。這一步幫你提早發現問題、產生假設,避免後面白做。

看分布
長相

資料集中在哪、有沒有偏。

看關係
關聯

變數之間有沒有相關。

找異常
怪點

離群值、缺失、錯誤。

這頁是 EDA 總覽。下面三個子題(分布/偏態、相關/關聯、視覺化)各有專頁。

02 — 核心互動

同樣的平均值,分布卻天差地遠

新手常只看「平均數」,但平均一樣的資料,分布可能完全不同!切換下面四組資料(平均都≈50),看 EDA 為什麼一定要畫圖、不能只看一個數字。

平均值
標準差
洞察

四組平均都接近 50,但形狀完全不同。「只看平均」會錯過雙峰(其實是兩群人)、離群值(被拉高的假象)。這就是 EDA 的價值。

03 — EDA 心法

探索分析要看什麼

優點

  • 先看圖再建模,提早抓問題
  • 產生假設,指引後續分析方向
  • 發現資料品質問題(缺失、離群)

缺點 / 限制

  • 只看平均/總和,被單一數字誤導
  • 沒做 EDA 直接建模,垃圾進垃圾出
  • 過度解讀雜訊,看到不存在的模式

EDA 三大重點

📊
分布
直方圖、箱型圖、偏態
🔗
關係
散佈圖、相關矩陣
👁️
視覺化
用對圖表傳達洞察
04 — 速記與對照

EDA 看什麼

面向看什麼常用工具
單變量分布、集中與離散、偏態直方圖、箱型圖
雙變量相關、關聯、趨勢散佈圖、熱力圖
缺失/異常缺失比例、離群缺失矩陣、箱型圖
類別各類佔比、不平衡長條圖、次數表

自我檢測

EDA 是什麼?
探索性資料分析:動手建模前先「看懂資料」——分布、關係、缺失、異常,形成假設與清理方向。
EDA 通常看哪些東西?
各欄分布與偏態、變數間相關、缺失與離群、類別比例與不平衡,並用圖快速發現問題。
EDA 和統計推論差在哪?
EDA 是開放探索、找模式與假設(描述);統計推論是用樣本檢驗特定假設、推論母體(驗證)。

🎯 重點整理

  1. EDA=建模前先看懂資料。
  2. 看分布、關係、缺失、異常、類別比例。
  3. 多用圖:直方、箱型、散佈、熱力圖。
  4. EDA 產生假設,推論再驗證。
  5. 發現的問題導引清理與特徵工程。

📝 iPAS 考點提醒

探索性資料分析(EDA)在建模前先看懂資料,iPAS 考點(初級科目一、中級科目二)。重點:用敘述統計與視覺化看分布、缺值、離群、相關性與類別比例,形成假設、指導後續清理與建模。易混點:EDA 是理解資料、不是驗證假設(那是後續統計檢定);跳過 EDA 直接建模常踩坑(如沒發現嚴重不平衡)。情境:CRISP-DM 的資料理解階段、選對圖表看資料。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

EDA(探索性資料分析)是什麼?

正式建模前用統計摘要與視覺化認識資料——看分布、關係、缺失、異常,形成假設並指引後續清理與特徵工程。

EDA 通常看哪些東西?

單變數(分布、集中與離散、偏態)、雙變數(相關、交叉表)、缺失與離群、類別比例(是否不平衡),以及目標與特徵的關係。

常用哪些圖?

直方圖與箱型圖看分布、散點圖看關係、熱力圖看相關矩陣、長條圖看類別、折線圖看時間趨勢。

EDA 為什麼重要?

能及早發現資料品質問題、避免錯誤假設、找出有用特徵與風險(洩漏、不平衡),省下後面大量返工。

EDA 和統計推論差在哪?

EDA 是開放式探索、產生假設、重視視覺與直覺;統計推論是用檢定驗證特定假設、給出顯著性結論,兩者互補。

🧭 相關主題

← 返回 AI 學習與考證地圖