Data Cleaning · 資料品質

資料清理

垃圾進,垃圾出

資料科學第一鐵律 GIGO:資料髒,模型再強也沒用。
清理缺失、異常、不一致、重複——這佔了資料工作者 6-8 成的時間。

完整性 + 一致性 + 即時性 = 資料品質
01 — 白話直覺

垃圾進,垃圾出(GIGO)

資料科學界第一鐵律:Garbage In, Garbage Out。資料髒,模型再強也沒用。資料清理就是把缺失、異常、不一致、重複的資料整理乾淨。據統計,資料工作者有 60-80% 的時間花在清理資料上。

缺失值
空格

有些欄位是空的,要補或刪。

離群值
怪數字

異常極端值,是錯誤還是真實?

不一致
格式亂

日期/單位/重複,要統一去重。

這頁是「資料清理」的總覽。下面三個子主題(缺失值、一致性、離群值)各有專頁深入。

02 — 核心互動

看髒資料變乾淨的過程

下面是一張髒資料表,有缺失、重複、格式不一、離群值。逐步點「清理」,看每種問題如何被處理,最後得到一張乾淨的表。

真實的清理會反覆來回。重點是每一步都要記錄「做了什麼」,讓整個過程可重現、可追溯。

03 — 清理面向

資料品質的維度

優點

  • 清乾淨才有可信的分析與模型
  • 建立可重現的清理流程(寫成程式)
  • 記錄每步處理,方便追溯

缺點 / 限制

  • GIGO:髒資料 → 錯誤結論
  • 手動清理不可重現、易出錯
  • 過度清理可能刪掉有意義的資料

品質維度

完整性
沒有該有卻缺的資料
🎯
一致性
格式、單位、跨表統一
⏱️
即時性
資料夠新、反映現況
04 — 速記與對照

資料清理處理項目

問題怎麼處理
缺失值補值(均值/中位/模型)、刪除或標記
重複資料依主鍵去重、合併
格式不一致統一日期/單位/大小寫/編碼
離群值偵測後修正、蓋帽或保留
型別錯誤轉正確型別、修正錯字

自我檢測

資料清理為什麼重要?
「垃圾進、垃圾出」——髒資料會讓分析與模型全錯;清理常佔資料專案最多時間。
重複資料怎麼處理?
依主鍵或關鍵欄位判定重複,保留一筆或合併;注意「看似重複但實為不同事件」的情況。
清理要注意什麼陷阱?
別把真實極端值當錯誤刪掉、別用含測試集的統計量填補(洩漏)、清理規則要一致且可重現。

🎯 重點整理

  1. 垃圾進垃圾出——清理決定成敗。
  2. 處理缺失、重複、格式、離群、型別。
  3. 去重看主鍵、當心假性重複。
  4. 清理規則要一致、可重現、記錄。
  5. 只用訓練資料統計量,避免洩漏。

📝 iPAS 考點提醒

資料清理是建模前最根本也最耗時的工,iPAS 高頻考點(初級科目一、中級科目二)。重點:處理缺漏值、重複、錯誤、格式不一與異常值,讓資料乾淨可用。易混點:髒資料訓出的模型再強也沒用(垃圾進、垃圾出);清理常佔專案大半時間,別低估。情境:CRISP-DM 的資料準備階段、題目問清理步驟或某做法是否恰當。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

資料清理為什麼重要?

垃圾進、垃圾出——髒資料會讓分析與模型結果失真;實務上資料清理常佔資料專案最多時間。

資料清理通常處理哪些問題?

缺失值、重複紀錄、格式不一致、異常與離群值、錯字與編碼問題、單位不一、邏輯矛盾的值。

重複資料怎麼處理?

先定義「重複」的判準(完全相同或關鍵欄相同),去重時保留最完整或最新一筆,注意別誤刪真實相似紀錄。

清理要注意什麼陷阱?

別在切分前用全資料統計來填補或縮放(會資料洩漏);清理規則要記錄、可重現,並避免引入新偏差。

和特徵工程的關係?

清理是把資料變正確可用,特徵工程是把乾淨資料變對模型有用;通常先清理再做特徵工程。

🧭 相關主題

← 返回 AI 學習與考證地圖