| 類型 | 意思 | 例子 |
|---|---|---|
| 資料漂移 | 輸入分布改變 P(X) | 新客群、季節變化 |
| 概念漂移 | X→Y 關係改變 P(Y|X) | 消費行為質變 |
| 標籤漂移 | 目標分布改變 P(Y) | 詐欺比例上升 |
| 偵測 | KL/KS/PSI、監控績效 | 觸發再訓練 |
資料漂移是模型上線後退化的主因,iPAS 維運考點(中級科目一)。重點:輸入資料的分布隨時間改變(如客群、行為變了),使模型效能下降,需持續監控(如 PSI、KL 散度)。易混點:資料漂移(輸入分布變)與概念漂移(輸入與目標的關係變)不同;漂移不一定立刻反映在準確率,要監控輸入分布。情境:上線後監控、決定何時再訓練。
想練情境題與詳解 → AI 學習與考證地圖
模型上線後輸入資料分布隨時間改變、與訓練時不同,導致預測表現逐漸下滑,是模型會過期的主因之一。
資料漂移是輸入分布變(P(X) 變);概念漂移是輸入與目標的關係變(P(Y|X) 變,例如同樣特徵對應的答案改了),兩者都會傷害效能。
比較上線資料與訓練資料的分布,用統計檢定(KS 檢定、PSI、卡方)或監控特徵統計量與模型信心、效能指標的變化。
視情況用新資料再訓練或微調、更新特徵或重新校準;嚴重時回滾舊版,並建立定期再訓練機制。
因為世界會變(用戶行為、季節、政策),沒有模型能永久準確;不監控就會在不知不覺中默默劣化、造成業務損失。