「廣告支出、曝光、點擊」互相高度相關——模型 R² 依然漂亮,個別係數卻忽正忽負、標準誤爆大。拉高相關度、重抽 30 次資料,親眼看係數亂跳與 VIF 突破警戒線。
診斷訊號三件套:R² 高但係數符號違反常識、標準誤異常大、VIF>10。處理三招:①刪除或合併高度相關變數(曝光與點擊擇一、或合成「互動率」);②改用 Ridge(L2)正則化——用一點偏差換係數穩定;③ PCA 把相關特徵壓成正交主成分。注意:樣本加大救不了共線性(變數間的線性重疊不會因此消失),且共線性「不」影響純預測用途——要解釋係數時它才是大魔王。
嚴重多重共線性(VIF>10):刪/併相關變數、改用 Ridge、或 PCA。R² 高不代表沒有共線性。
錯。變數間的線性重疊與樣本量無關;加樣本只是讓「不穩定的估計」稍微收斂,分不清功勞的本質不變。
1/(1−0.9025)≈10.3——剛好破警戒線。r=0.99 時 VIF≈50。
中級科目二 L223 考「廣告支出/曝光/點擊」的原題情境:正解=共線性診斷(VIF>10)+刪併變數或 Ridge;干擾選項=「VIF 越大預測力越強」「共線性會降低 R²」「樣本大就會消失」——本頁實驗全部反駁得掉。
是:輪流把每個特徵當目標、用其餘特徵回歸得 R_j²。實務用 statsmodels 的 variance_inflation_factor 逐欄計算。
會(虛擬變數陷阱):k 個類別全展開會與截距完全共線,慣例丟掉一欄(drop_first=True)。
預測不太怕,但「特徵重要性」會被相關特徵攤薄——解釋時同樣要小心。