從連續資料到信用評分權重

正常繳款 (好客戶)
違約遲繳 (壞客戶)
客戶年齡 (Age) 步驟 1:原始年齡分佈 (充滿雜訊) 20歲 70歲 步驟 2:進行分箱 (Binning) 與統計人數 20 - 30 歲 壞多於好 31 - 50 歲 好多於壞 51 歲以上 絕大多數為好 步驟 3:計算 WoE (證據權重) 與 IV (資訊值) WoE = 0 正權重 (好) 負權重 (壞) 20 - 30 歲 -0.85 31 - 50 歲 +0.42 51 歲以上 +1.15 總 IV 值 = 0.32 (具備預測力)

1. 原始連續資料

如果我們直接看每個年齡的散佈圖,雖然隱約可以看出「年輕人紅點(違約)比較多,老年人綠點(正常)比較多」,但對邏輯迴歸模型來說,這種數值連續且充滿雜訊的資料,很難直接拿來給出穩定的評分。

📊 WoE 與 IV
概念意思用途
分箱 Binning把連續值切成區間穩定、抗離群、可解釋
WoEln(好客佔比/壞客佔比)把類別/箱轉成單調數值
IV各箱貢獻加總衡量特徵預測力
IV 判讀<0.02 無用、0.1~0.3 中等、>0.5 極強(疑洩漏)特徵篩選
✅ 自我檢測
WoE 是什麼?
Weight of Evidence:用「好壞比」的對數把類別或分箱轉成單調數值,常用於信用評分。
IV 怎麼解讀?
Information Value 衡量特徵對目標的預測力:一般 <0.02 沒用、0.1~0.3 中等、>0.5 很強(但過高要防洩漏)。
WoE 編碼的好處?
單調、可解釋、抗離群、能把缺失處理成獨立箱,適合線性/評分卡模型。
🎯 重點整理
  1. 分箱把連續值切區間,穩定可解釋。
  2. WoE=好壞比的對數,轉單調數值。
  3. IV 衡量特徵預測力、用於篩選。
  4. IV 判讀有經驗門檻,過高防洩漏。
  5. 常用於信用評分卡。

📝 iPAS 考點提醒

WoE 與 IV 是信用風控建模的經典特徵工具,iPAS 中級科目二考點。重點:WoE(證據權重)把分箱後特徵依好壞樣本比例轉成對數值、與目標單調相關;IV(資訊值)彙總衡量特徵對二元目標的整體預測力。易混點:IV 經驗上 小於 0.02 幾乎無用、0.1 到 0.3 中等、大於 0.5 反而要懷疑資料洩漏;WoE 編碼讓邏輯迴歸更穩、可解釋。情境:信用評分卡、流失與詐欺的特徵篩選。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

WoE 是什麼?

證據權重(Weight of Evidence);把類別或分箱後的特徵,依好壞樣本比例轉成對數值,常用於信用評分等風控建模。

IV 是什麼?

資訊值(Information Value);彙總各分箱的 WoE 與佔比,衡量一個特徵對二元目標(如違約與否)的整體預測力。

IV 怎麼解讀?

經驗上 IV 小於 0.02 幾乎無用、0.1 到 0.3 中等、0.3 到 0.5 強;過高(如大於 0.5)反而要懷疑資料洩漏。

WoE 編碼的好處?

把特徵轉成與目標單調相關的數值、處理類別與缺失、降低離群影響,讓邏輯迴歸更穩定、可解釋。

主要用在哪?

信用評分卡、流失與詐欺等二元分類的特徵工程與篩選;WoE 編碼加 IV 篩變數,是金融風控建模的經典工具。

🧭 相關主題

← 返回 AI 學習與考證地圖