🗺️ AI 學習與考證地圖

EDA 資料視覺化圖表解析|可互動版

開心亮眼的 Mochi 貓老師用圖表羅盤挑選適合的資料視覺化方法

這版可以直接互動:點圖卡可切換右側解說面板、按分類可篩選核心或延伸圖表、 展開實戰例子可看更貼近資料分析情境的說明。

01 · 先問問題,再選圖

你想看的是分布、關係、趨勢,還是比較?

好奇歪頭的 Mochi 貓老師比較分布、關係、趨勢與類別四種問題卡

圖表沒有絕對的最好,只有是否回答你的問題。先判斷資料型態與目的,再挑最短路徑。

看分布直方圖、箱型圖、小提琴圖
看關係散布圖、相關熱力圖
看趨勢依時間排序的折線圖
看類別比較長條圖通常比圓餅圖清楚
02 · 九種圖表互動圖鑑

每張圖卡都能收合重點、展開例子

戴端正圓眼鏡的 Mochi 貓老師專注操作九種圖表的互動圖鑑

從圖形、適用情境、陷阱到建模幫助一次看懂;原有動畫與卡片操作完整保留。

📊
直方圖 Histogram
看單一數值特徵的分佈形狀:常態、偏態、長尾、多峰。
核心探勘
頻數 數值大小 → 右偏長尾
重點:先看資料是不是歪的。右偏很嚴重時,常要做 Log 轉換。
看偏態 看長尾 決定是否 Log 轉換
實務重點: 如果資料嚴重右偏,像收入、消費額、停留時間,直接餵模型很容易讓少數超大值主導結果。這時常做 Log 轉換 或 Robust Scaling,讓分佈更穩。
實戰例子

假設你在做電商會員分群,看到「消費金額」直方圖右邊拖很長,代表少數大戶把數值拉很高。這時直接做 KMeans 或線性模型,常會被大戶支配。

  • 先畫直方圖看偏態。
  • 若極度右偏,可試 Log1p。
  • 轉換前後都再畫一次,確認是否更平衡。
🫧
散佈圖 Scatter Plot
看兩個變數之間的關係、群聚、離群點與非線性型態。
核心探勘
Y X 非線性 離群點
重點:除了正相關、負相關,更要找非線性和離群點。
看相關性 找離群點 注意 U 型/曲線關係
實務重點: 很多人只看正相關或負相關,但真正容易害模型失準的是 非線性關係。若資料呈 U 型、拋物線型,線性模型會失真,常要加入 多項式特徵 或直接改用樹模型。
實戰例子

如果你在分析「折扣幅度 vs 毛利率」,可能不是折扣越多毛利越低這麼簡單,而是某一段最有效,過頭反而更差。

  • 先畫散佈圖,確認關係是否像曲線。
  • 若非線性明顯,可考慮 polynomial features。
  • 若看到幾個超怪點,也要懷疑資料品質或特殊事件。
📦
箱型圖 Box Plot
看中位數、四分位距、鬚鬚範圍與離群值。
核心探勘
中位數 離群值 上鬚 IQR 核心區 下鬚
重點:快速看中位數、核心 50% 區間,以及離群值。
看中位數 看 IQR 抓 Outlier
實務重點: 箱型圖很適合資料清整。極端離群值可能來自輸入錯誤,也可能是真實但稀有事件。不要一律刪掉,先判斷業務意義,再決定要 剔除、截斷、保留 或改用 robust 方法。
實戰例子

你在比較不同門市的客單價時,平均數可能被少數超大單扭曲,但箱型圖可以直接看到每家店的中位數與離群值數量。

  • 門市 A 中位數高,代表平常表現就穩定。
  • 門市 B 離群值多,可能常出現大單或資料異常。
  • 比起只看平均數,箱型圖更能看出結構。
🔥
熱力圖 Heatmap
最常用來看相關係數矩陣,也能看缺失值分佈。
核心探勘
縱軸:特徵名稱 橫軸:特徵名稱 年齡 收入 消費額 年齡 收入 消費額 高度相關 → 共線性風險 對角線 = 自己和自己比 所以通常最深
重點:橫軸縱軸都是欄位名稱,不是在畫地圖座標。
看相關係數 找共線性 橫軸縱軸都是特徵
實務重點: 熱力圖的橫軸和縱軸通常都放同一組特徵名稱,每一格代表「某特徵和另一特徵的相關程度」。所以像「年齡 vs 年齡」這種對角線位置,一定是自己和自己比,相關性最高,顏色通常最深。真正要注意的是不同特徵之間如果也很深,代表可能有 共線性 問題。
實戰例子

你做房價模型時,若「室內坪數」和「房間數」高度相關,兩者一起放進線性模型,係數可能會亂跳。

  • 先用熱力圖找出高度相關欄位。
  • 若兩欄位資訊太重複,可考慮保留其中一個。
  • 也可搭配 VIF 或特徵重要度再判斷。
📚
長條圖 Bar Chart
專門比較類別資料的高低差異,簡單但實用。
延伸圖表
A 類 B 類 C 類 最高類別
重點:類別比較幾乎都該先畫長條圖。
比較類別高低 適合看轉換率 比圓餅圖更好比較
實務重點: 類別資料幾乎都該先畫長條圖。它比圓餅圖更容易比較細小差異。若想看每類別對目標值的影響,可以進一步畫 grouped barstacked bar
實戰例子

你在比較不同廣告渠道的轉單數時,長條圖會比圓餅圖更快看出誰最高、誰第二、差距多少。

📈
折線圖 Line Chart
時間序列分析基本功:看趨勢、波動、季節性。
延伸圖表
上升趨勢 + 明顯波動 過去 現在
重點:時間順序不能亂,否則會資料洩漏。
時間順序很重要 找季節性 避免資料洩漏
實務重點: 時間序列資料不能亂切 train/test。必須依照時間先後切分,否則會看到未來資料,造成 data leakage。另外也要注意滾動平均、趨勢線與異常波峰。
實戰例子

你在預測每日訂單量時,如果隨機切 train/test,模型可能偷看到未來的節慶波峰,測試分數會虛高。

🥧
圓餅圖 Pie Chart
適合展示少量類別的結構佔比,但不利精準比較。
少用
A 55% B 25% C 20%
重點:能看比例,但不擅長比較細微差距。
只適合少量類別 不易比較細差 通常可改長條圖
實務重點: 圓餅圖不是不能用,但當類別超過 3 個、差異又不大時,人眼很難比較角度大小。若目的是分析而不是簡報裝飾,通常 長條圖更好
實戰例子

如果只想表達「A 類佔一半以上」,圓餅圖還可以;但若要比較 18%、21%、24% 這種細差,直接改長條圖比較快。

🕸️
雷達圖 Radar Chart
適合看多維指標輪廓,例如產品、模型、學生能力面向。
延伸圖表
速度 成本 精度 穩定性 可維護 彈性
重點:適合看輪廓,不適合一次比很多組。
多維輪廓比較 適合少量對象 不適合很多系列同時畫
實務重點: 雷達圖很適合做「輪廓感」比較,例如比較兩台設備、兩種模型、兩位學生在不同能力向度的強弱。但它不適合太多系列一起疊,否則會變成蜘蛛網打架。
實戰例子

如果你在比較兩個 AI 模型:速度、成本、精度、穩定性、維護性,雷達圖很適合快速看出「誰偏哪一型」。

🎻
小提琴圖 Violin Plot
箱型圖進階版,同時看中位數與分佈密度。
延伸圖表
中位數 密度較低 密度較高
重點:比箱型圖多了密度資訊,能看出哪段資料最多。
分佈密度 看多峰現象 比箱型圖更完整
實務重點: 箱型圖只能告訴你範圍與中位數,但小提琴圖還能看出哪一段資料最密集、甚至是否有 雙峰分佈。在比較不同群組分佈時非常有用。
實戰例子

如果兩個客群的平均消費差不多,但其中一群其實有兩種人:超低消費與超高消費,小提琴圖比箱型圖更容易看出這種雙峰。

溫柔擔心的 Mochi 貓老師檢查被截短座標軸誇大的圖表差異
03 · 誠實圖表避坑

圖畫得漂亮,不代表說得誠實

看圖時先檢查尺度、基準線、類別數與顏色語意,避免視覺效果把小差異放大成大結論。

Y 軸截短:小差距看起來像翻倍。
3D 與裝飾:透視會扭曲面積與長度。
圓餅類別過多:人眼難比較相近角度。
只看平均:可能漏掉偏態、雙峰與離群值。
04 · 典型應用場景

把圖表放進真實工作問題

溫柔自信的 Mochi 貓老師展示營運、品管、行銷與模型溝通工具箱

同一張圖會因問題不同而有不同價值;下面四張 Mochi 場景圖直接取代傳統 emoji icon。

興奮圓眼但不兇的 Mochi 貓老師查看電商營收趨勢與類別比較儀表板
電商與營運監控
折線圖看營收趨勢,長條圖比較渠道,直方圖檢查客單價長尾。
認真可愛的 Mochi 貓老師用箱型圖找出製造品質資料中的離群值
製造品質與異常
箱型圖抓離群值,折線圖監看漂移,熱力圖找設備參數共線性。
眼神好奇的 Mochi 貓老師用散布圖探索廣告投入與轉換之間的關係
行銷與顧客洞察
散布圖看投入與轉換關係,小提琴圖比較客群分布,長條圖呈現類別差異。
托腮思考的 Mochi 貓老師用清楚圖表向團隊說明模型表現
模型評估與溝通
用簡單、誠實、可比較的圖表說明模型表現,避免只報一個總分。
安心閉眼微笑的 Mochi 貓老師揮手並展示資料視覺化考點檢核板
05 · Mochi 考點複習

選圖前最後確認

  • 分布:直方圖、箱型圖、小提琴圖;關係:散布圖、熱力圖。
  • 趨勢一定保留時間順序;類別精準比較優先用長條圖。
  • 離群值不一定是錯誤,先查業務意義再決定保留或處理。
  • Anscombe 四重奏提醒:摘要統計相同,資料形狀仍可能完全不同。

📝 iPAS 考點提醒

資料視覺化是 EDA 與溝通的關鍵,iPAS 考點(初級科目一、中級科目二)。重點:依資料型態選圖——分布用直方圖或箱形圖、關係用散布圖、比較用長條圖、趨勢用折線圖。易混點:Anscombe 四重奏提醒——統計量相同的資料畫出來可能天差地遠,只看摘要數字不夠;Y 軸不從 0 會誤導。情境:建模前先用圖看懂資料、誠實呈現結果。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

為什麼資料視覺化重要?

圖表能快速揭露趨勢、分布、離群與關係,比看數字表格更直覺;是探索分析(EDA)與溝通結果的關鍵。

常見圖表怎麼選?

比較類別用長條圖、看趨勢用折線圖、看分布用直方圖或箱形圖、看關係用散布圖、看占比用圓餅(類別少時)。

Anscombe 四重奏的啟示?

四組統計量幾乎相同的資料,畫出來卻完全不同;提醒只看摘要數字不夠,一定要視覺化看資料長相。

視覺化常見的誤導?

Y 軸不從 0 開始誇大差異、3D 與花俏效果失真、用圓餅比太多類別、色彩無障礙不佳;應力求誠實清楚。

好圖表的原則?

一圖一重點、標題與軸標清楚、去除多餘裝飾(高資料墨水比)、顏色有意義且色盲友善、適當標註關鍵數值。

🧭 相關主題

← 返回 AI 學習與考證地圖