🔮 流失預測 + 生成式沙盤 · iPAS

顧客流失預測:不只「預測誰會走」,還能「模擬留客策略」

傳統模型(判別式)只回答「誰會流失」;生成式模型(VAE/GAN)更進一步——它學會資料的分布,能造出虛擬顧客,讓你在不花半毛錢的情況下先沙盤推演:「如果打 8 折,能救回多少人?」

流失預測(分類)判別式 vs 生成式VAE / GAN合成資料A/B 情境模擬

🧠 一、兩種模型,回答不同的問題

判別式模型(如隨機森林)只學「分界線」——回答「這位顧客會不會流失?」畫一條決策線就好,不會造新資料
生成式模型(VAE / GAN)學會「資料的分布」——能造出逼真的虛擬顧客,回答「假如做了某行銷,這群人會怎麼變?」

📌 為什麼需要生成式?

要「找出誰會流失」,隨機森林就夠了。但要回答「給這群高風險客戶 20% 折扣,能救回多少?」——判別式無能為力,因為它不會創造假設性的未來資料。生成式模型才能做這種「what-if」沙盤推演

🎮 二、動手玩:造虛擬顧客、模擬留客策略

紅點=已流失、綠點=已留存、中間虛線=決策邊界。先切到「生成式模型」,按「產生虛擬顧客」,再拉「行銷策略」滑桿,看橘色虛擬顧客被推過決策線、變綠(挽留成功)。

傳統模型無法生成新資料!
高風險區 (預測流失) 安全留存區 (預測留下)
真實顧客 (已流失)
真實顧客 (已留存)
VAE/GAN 虛擬顧客 (沙盤推演)

🗺️ 怎麼看

保持在「傳統模型」時,生成按鈕是灰的、滑桿也動不了(會跳出提示)——因為判別式無法造資料。切到「生成式」→ 按生成,橘色虛擬顧客出現在高風險區 → 拉「行銷策略」滑桿,代表對他們施加挽留策略,他們會往右移、越過決策線變綠=被成功挽留。這就是用合成資料評估行銷活動的預期轉換率

⚖️ 三、判別式 vs 生成式 對照

比較判別式 Discriminative生成式 Generative
學什麼決策邊界 P(y|x)資料分布 P(x)、P(x,y)
能做分類/預測「誰會流失」造新樣本、模擬 what-if
代表隨機森林、邏輯斯回歸、SVMVAE、GAN、Diffusion
能沙盤推演?❌ 不會造資料✅ 可情境模擬

📊 四、流失預測,該看哪個指標?

流失通常是「少數類」→ 別只看準確率

會流失的客戶往往只佔一小部分(不平衡資料)。若只看準確率,盲猜「全都會留下」就能拿高分卻毫無用處。應重視 召回率(盡量抓出會走的人)、F1、PR-AUC。指標細節見 混淆矩陣與評估指標

🧪 五、合成資料:用途與風險

補少數類流失樣本太少,用 SMOTE 或生成模型補齊,改善不平衡。
保護隱私用合成資料代替真實個資做開發與分享。
情境壓力測試造出各種「假設情境」評估策略成效。
風險生成模型若學壞了分布會製造誤導;合成資料的品質與偏誤要嚴格把關。

🎨 六、VAE 與 GAN 差在哪?(簡介)

兩種造資料的思路

VAE(變分自編碼器):把資料壓進一個「潛在空間(latent space)」再解碼還原,能平滑地在潛在空間移動來生成——demo 裡「拉策略滑桿讓顧客在潛在空間往留存方向移動」就是這個直覺。
GAN(生成對抗網路):讓「生成器」和「鑑別器」互相對抗,生成器不斷學著造出以假亂真的樣本。兩者都是生成式主力,細節屬深度學習範疇。

⚠️ 七、流失預測的實務挑戰

類別不平衡流失是少數,要用重採樣/加權/合適指標。
資料漂移顧客行為會隨時間變,模型要定期重訓。
把預測轉成行動不只知道誰會走,還要決定對誰、用什麼策略挽留。
衡量真實成效用 A/B 測試驗證介入是否真的降低流失。

🧪 八、觀念自我檢測

先想再點開。

Q1. 判別式和生成式模型差在哪?

判別式學決策邊界、做分類/預測;生成式學資料分布、能造新樣本做模擬。

Q2. 為什麼流失預測不能只看準確率?

流失是少數類,盲猜多數就能拿高準確率;要看召回率、F1、PR-AUC

Q3. 合成資料有什麼用途?

補少數類、保護隱私、情境壓力測試;但要注意品質與偏誤。

Q4. VAE 和 GAN 都屬哪一類?

都是生成式模型;VAE 靠潛在空間編解碼、GAN 靠生成器對抗鑑別器。

Q5. 流失預測的最大實務挑戰之一?

類別不平衡資料漂移,以及把預測轉成有效行動

✅ 九、30 秒重點整理

流失預測=分類預測誰會取消/停用。
判別式畫決策線、只做預測。
生成式(VAE/GAN)學分布、造樣本、模擬 what-if。
少數類重召回率/F1/PR-AUC。
合成資料補類別/隱私/壓測,但防偏誤。
挑戰不平衡、漂移、轉成行動。

📝 iPAS 考點提醒

生成式模型可用於模擬與資料增補,iPAS 生成式 AI 應用考點(初級科目二)。重點:用學到的資料分布生成新樣本,可補足稀少類別(如流失客戶)、做情境模擬或產生保護隱私的合成資料。易混點:合成資料能緩解資料不足與隱私問題,但品質與偏誤要把關(學壞分布會誤導);生成(造資料)與鑑別(做判斷)用途不同。情境:不平衡資料增補、隱私合成、商業情境模擬。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

這個主題在示範什麼?

用生成或模擬方法產生客戶流失情境的資料與預測,幫助理解流失預測,以及如何用模型支援留客決策。

什麼是顧客流失(churn)預測?

用歷史行為預測哪些客戶可能流失(取消、停用),屬分類問題;讓企業及早介入挽留高風險客戶。

流失預測常用什麼模型與指標?

邏輯斯回歸、樹與集成(隨機森林、XGBoost)等;因流失通常是少數類,重視 Recall、F1、PR-AUC,而非只看 Accuracy。

為什麼會用到生成或模擬資料?

真實流失樣本少或敏感時,可用模擬或合成(如 SMOTE、生成模型)補充少數類,做情境推演與壓力測試。

流失預測的實務挑戰?

類別不平衡、資料漂移(行為會變)、把預測轉成行動(該對誰、怎麼挽留),以及衡量介入的實際成效。

🧭 相關主題

← 返回 AI 學習與考證地圖