Data Source · 5V

資料來源

資料從哪來、是什麼樣的資料

資料庫、API、檔案、日誌、爬蟲——來源百百種。
先用大數據 5V(量、速、雜、真、值)幫資料把脈,才知道用什麼工具、會踩什麼坑。

5V = Volume + Velocity + Variety + Veracity + Value
01 — 白話直覺

資料從哪來?先認識來源與 5V

資料來源百百種:資料庫、API、檔案、日誌、爬蟲。在動手取得前,先用大數據的 5V 判斷你面對的是什麼樣的資料,才知道要用什麼工具、會踩什麼坑(尤其是取樣偏差)。

資料庫/API
結構化

SQL 查詢、REST API 取得。

檔案/日誌
半結構

CSV、JSON、Log 收集。

爬蟲
非結構

網頁抓取,注意法律規範。

下面互動讓你用 5V(量、速、雜、真、值)幫一筆資料把脈,判斷它是不是「大數據」、該怎麼處理。

02 — 核心互動

用 5V 幫資料把脈

點下面五個 V,看每個維度在問什麼。5V 越極端,越需要大數據工具(分散式儲存、串流處理);反之普通資料庫就夠。

點任一個 V

03 — 來源與風險

取得資料的重點

優點

  • 先判斷 5V,選對工具與架構
  • 來源多元時注意 Schema 對齊
  • 記錄資料來源與時間,方便追溯

缺點 / 限制

  • 取樣偏差:樣本不能代表母體(最隱形的坑)
  • 倖存者偏差:只看到『活下來』的資料
  • 爬蟲/個資的法律風險

大數據 5V

📦
Volume 量
TB~PB 等級的資料量
Velocity 速
即時/近即時產生與處理
🎨
Variety 雜
結構化+半+非結構化
🔍
Veracity 真
品質與可信度(GIGO)
💎
Value 值
分析後的決策才值錢
⚠️
取樣偏差
樣本是否代表母體
04 — 速記與對照

資料來源類型對照

類型例子特點
一手資料自家 App/交易/感測器紀錄貼近需求、可控但要自建
二手資料公開資料集、政府開放資料、第三方便宜快、但未必貼合
內部資料資料庫、日誌、CRM現成、需整合與清理
外部/爬蟲網站爬蟲、購買、公開 API廣但有法規與品質風險

自我檢測

評估資料來源要看什麼?
相關性、品質(完整正確及時)、代表性(有沒有偏差)、可得性與成本、以及法規合規。
一手與二手資料差在哪?
一手是自己為此目的蒐集(貼合但貴);二手是別人已蒐集的現成資料(便宜快但未必貼合需求)。
取資料要注意什麼法規?
個資法/GDPR、網站條款與 robots、著作權與授權;爬蟲與購買資料尤其要確認來源合法。

🎯 重點整理

  1. 分清一手(自蒐)與二手(現成)資料。
  2. 評估相關性、品質、代表性、成本、合規。
  3. 當心來源偏差,會一路帶到模型。
  4. 爬蟲/購買資料先確認法規與授權。
  5. 記錄來源與時間,利於追溯與更新。

📝 iPAS 考點提醒

資料來源的品質與合法性是資料專案的根本,iPAS 考點(初級科目一、中級科目二)。重點:資料可能來自資料庫、API、感測器、日誌、第三方,要注意代表性、完整性、時效與授權。易混點:來源有偏差(取樣不具代表性)會讓整個模型偏掉,正所謂垃圾進、垃圾出;個資與版權使用前要合規。情境:評估某資料是否可用、是否有偏誤或法律風險。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

常見的資料來源有哪些?

內部資料庫與交易系統、日誌、感測器(IoT)、API、第三方資料、公開資料集、問卷與爬蟲等,結構化與非結構化都算。

評估資料來源要看什麼?

可信度、覆蓋率與代表性、更新頻率、格式與可取得性、隱私與授權合規、以及取得成本。

一手與二手資料差在哪?

一手為當前目的自行蒐集(貼合需求但成本高);二手是既有或他人蒐集(快又省但未必貼合,需檢查偏差)。

取資料要注意什麼法規?

個資保護(台灣個資法、GDPR)、授權條款、敏感屬性使用限制;蒐集與使用都要有合法依據與最小化原則。

資料來源偏差會怎樣?

來源不具代表性會讓模型學到偏誤、對未涵蓋族群表現差;選來源時就要顧及代表性與抽樣方式。

🧭 相關主題

← 返回 AI 學習與考證地圖