👯 多重共線性與 VIF:係數為什麼亂跳

「廣告支出、曝光、點擊」互相高度相關——模型 R² 依然漂亮,個別係數卻忽正忽負、標準誤爆大。拉高相關度、重抽 30 次資料,親眼看係數亂跳與 VIF 突破警戒線。

💡 白話定義

多重共線性=特徵彼此高度相關:兩個特徵講的是同一件事,迴歸「分不清功勞該記給誰」——整體預測力(R²)可以不受影響,但個別係數的估計極不穩定(換一批資料就翻號)。
VIF(變異數膨脹因子)=1/(1−Rj²),其中 Rj² 是「用其他特徵去預測第 j 個特徵」的 R²。兩變數時 VIF=1/(1−r²)。VIF > 10 為常用警戒線(有人用 5)。

🎮 互動實驗:拉高相關度、看係數發瘋

VIF=1/(1−r²)=1.33 R²(整體)≈ β₁ 範圍: 翻號次數:
真實世界是 y=1·x₁+1·x₂+雜訊。左圖看兩特徵多像、右圖看 30 批資料估出來的係數散得多開。

🧠 怎麼診斷、怎麼處理

診斷訊號三件套:R² 高但係數符號違反常識、標準誤異常大、VIF>10。處理三招:①刪除或合併高度相關變數(曝光與點擊擇一、或合成「互動率」);②改用 Ridge(L2)正則化——用一點偏差換係數穩定;③ PCA 把相關特徵壓成正交主成分。注意:樣本加大救不了共線性(變數間的線性重疊不會因此消失),且共線性「不」影響純預測用途——要解釋係數時它才是大魔王。

✅ 自我檢測

Q1:R² 很高、係數符號卻與常識相反、VIF=15——診斷與處理?

嚴重多重共線性(VIF>10):刪/併相關變數、改用 Ridge、或 PCA。R² 高不代表沒有共線性。

Q2:「樣本數夠大共線性就會自動消失」對嗎?

錯。變數間的線性重疊與樣本量無關;加樣本只是讓「不穩定的估計」稍微收斂,分不清功勞的本質不變。

Q3:兩變數相關 r=0.95,VIF 是多少?

1/(1−0.9025)≈10.3——剛好破警戒線。r=0.99 時 VIF≈50。

🎯 重點整理

① 共線性傷「係數解釋」不傷「整體預測」:R² 可以照樣高。
② VIF=1/(1−Rj²);>10 警戒(兩變數時=1/(1−r²))。
③ 處理:刪併變數/Ridge 正則化/PCA;加大樣本沒用
④ 訊號三件套:符號違反常識+標準誤爆大+VIF 高。