資料漂移 (Data Drift) 與 KL 散度偵測

基準:訓練資料 (Q)
實際:生產資料 (P)

調整生產資料分佈 (P)

💡 提示:試著移動滑桿。當紅色的生產資料偏離藍色的訓練資料越遠,代表資料漂移越嚴重。

KL 散度 (KL Divergence)

0.000
🟢 模型狀態:正常
常態分佈 KL 散度公式: D_{KL}(P||Q) = log(σ_Q/σ_P) + [σ_P² + (μ_P - μ_Q)²] / (2σ_Q²) - 0.5
📊 漂移類型
類型意思例子
資料漂移輸入分布改變 P(X)新客群、季節變化
概念漂移X→Y 關係改變 P(Y|X)消費行為質變
標籤漂移目標分布改變 P(Y)詐欺比例上升
偵測KL/KS/PSI、監控績效觸發再訓練
✅ 自我檢測
資料漂移和概念漂移差在哪?
資料漂移是輸入分布 P(X) 變(客群變了);概念漂移是輸入到輸出的關係 P(Y|X) 變(同樣的人行為變了),後者更難。
怎麼偵測漂移?
比對訓練與線上分布(KL 散度、KS 檢定、PSI),並監控模型績效是否衰退。
發現漂移後怎麼辦?
依嚴重度:重新訓練/校準、更新特徵、調整門檻,必要時回滾或人工介入。
🎯 重點整理
  1. 資料漂移=輸入分布 P(X) 改變。
  2. 概念漂移=P(Y|X) 關係改變、更棘手。
  3. 用 KL/KS/PSI 與績效監控偵測。
  4. 漂移就再訓練/校準/調門檻。
  5. 上線後必須持續監控。

📝 iPAS 考點提醒

資料漂移是模型上線後退化的主因,iPAS 維運考點(中級科目一)。重點:輸入資料的分布隨時間改變(如客群、行為變了),使模型效能下降,需持續監控(如 PSI、KL 散度)。易混點:資料漂移(輸入分布變)與概念漂移(輸入與目標的關係變)不同;漂移不一定立刻反映在準確率,要監控輸入分布。情境:上線後監控、決定何時再訓練。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

資料漂移(Data Drift)是什麼?

模型上線後輸入資料分布隨時間改變、與訓練時不同,導致預測表現逐漸下滑,是模型會過期的主因之一。

資料漂移和概念漂移差在哪?

資料漂移是輸入分布變(P(X) 變);概念漂移是輸入與目標的關係變(P(Y|X) 變,例如同樣特徵對應的答案改了),兩者都會傷害效能。

怎麼偵測漂移?

比較上線資料與訓練資料的分布,用統計檢定(KS 檢定、PSI、卡方)或監控特徵統計量與模型信心、效能指標的變化。

發現漂移後怎麼辦?

視情況用新資料再訓練或微調、更新特徵或重新校準;嚴重時回滾舊版,並建立定期再訓練機制。

為什麼一定要持續監控?

因為世界會變(用戶行為、季節、政策),沒有模型能永久準確;不監控就會在不知不覺中默默劣化、造成業務損失。

🧭 相關主題

← 返回 AI 學習與考證地圖