資料庫、API、檔案、日誌、爬蟲——來源百百種。
先用大數據 5V(量、速、雜、真、值)幫資料把脈,才知道用什麼工具、會踩什麼坑。
資料來源百百種:資料庫、API、檔案、日誌、爬蟲。在動手取得前,先用大數據的 5V 判斷你面對的是什麼樣的資料,才知道要用什麼工具、會踩什麼坑(尤其是取樣偏差)。
SQL 查詢、REST API 取得。
CSV、JSON、Log 收集。
網頁抓取,注意法律規範。
下面互動讓你用 5V(量、速、雜、真、值)幫一筆資料把脈,判斷它是不是「大數據」、該怎麼處理。
點下面五個 V,看每個維度在問什麼。5V 越極端,越需要大數據工具(分散式儲存、串流處理);反之普通資料庫就夠。
| 類型 | 例子 | 特點 |
|---|---|---|
| 一手資料 | 自家 App/交易/感測器紀錄 | 貼近需求、可控但要自建 |
| 二手資料 | 公開資料集、政府開放資料、第三方 | 便宜快、但未必貼合 |
| 內部資料 | 資料庫、日誌、CRM | 現成、需整合與清理 |
| 外部/爬蟲 | 網站爬蟲、購買、公開 API | 廣但有法規與品質風險 |
資料來源的品質與合法性是資料專案的根本,iPAS 考點(初級科目一、中級科目二)。重點:資料可能來自資料庫、API、感測器、日誌、第三方,要注意代表性、完整性、時效與授權。易混點:來源有偏差(取樣不具代表性)會讓整個模型偏掉,正所謂垃圾進、垃圾出;個資與版權使用前要合規。情境:評估某資料是否可用、是否有偏誤或法律風險。
想練情境題與詳解 → AI 學習與考證地圖
內部資料庫與交易系統、日誌、感測器(IoT)、API、第三方資料、公開資料集、問卷與爬蟲等,結構化與非結構化都算。
可信度、覆蓋率與代表性、更新頻率、格式與可取得性、隱私與授權合規、以及取得成本。
一手為當前目的自行蒐集(貼合需求但成本高);二手是既有或他人蒐集(快又省但未必貼合,需檢查偏差)。
個資保護(台灣個資法、GDPR)、授權條款、敏感屬性使用限制;蒐集與使用都要有合法依據與最小化原則。
來源不具代表性會讓模型學到偏誤、對未涵蓋族群表現差;選來源時就要顧及代表性與抽樣方式。