資料科學第一鐵律 GIGO:資料髒,模型再強也沒用。
清理缺失、異常、不一致、重複——這佔了資料工作者 6-8 成的時間。
資料科學界第一鐵律:Garbage In, Garbage Out。資料髒,模型再強也沒用。資料清理就是把缺失、異常、不一致、重複的資料整理乾淨。據統計,資料工作者有 60-80% 的時間花在清理資料上。
有些欄位是空的,要補或刪。
異常極端值,是錯誤還是真實?
日期/單位/重複,要統一去重。
這頁是「資料清理」的總覽。下面三個子主題(缺失值、一致性、離群值)各有專頁深入。
下面是一張髒資料表,有缺失、重複、格式不一、離群值。逐步點「清理」,看每種問題如何被處理,最後得到一張乾淨的表。
真實的清理會反覆來回。重點是每一步都要記錄「做了什麼」,讓整個過程可重現、可追溯。
| 問題 | 怎麼處理 |
|---|---|
| 缺失值 | 補值(均值/中位/模型)、刪除或標記 |
| 重複資料 | 依主鍵去重、合併 |
| 格式不一致 | 統一日期/單位/大小寫/編碼 |
| 離群值 | 偵測後修正、蓋帽或保留 |
| 型別錯誤 | 轉正確型別、修正錯字 |
資料清理是建模前最根本也最耗時的工,iPAS 高頻考點(初級科目一、中級科目二)。重點:處理缺漏值、重複、錯誤、格式不一與異常值,讓資料乾淨可用。易混點:髒資料訓出的模型再強也沒用(垃圾進、垃圾出);清理常佔專案大半時間,別低估。情境:CRISP-DM 的資料準備階段、題目問清理步驟或某做法是否恰當。
想練情境題與詳解 → AI 學習與考證地圖
垃圾進、垃圾出——髒資料會讓分析與模型結果失真;實務上資料清理常佔資料專案最多時間。
缺失值、重複紀錄、格式不一致、異常與離群值、錯字與編碼問題、單位不一、邏輯矛盾的值。
先定義「重複」的判準(完全相同或關鍵欄相同),去重時保留最完整或最新一筆,注意別誤刪真實相似紀錄。
別在切分前用全資料統計來填補或縮放(會資料洩漏);清理規則要記錄、可重現,並避免引入新偏差。
清理是把資料變正確可用,特徵工程是把乾淨資料變對模型有用;通常先清理再做特徵工程。