🌳 決策樹 vs 隨機森林 · iPAS 常考對比

決策樹 vs 隨機森林:一棵樹,還是一片森林投票?

決策樹像一連串「是非題」,直觀好懂但容易鑽牛角尖(過擬合)。隨機森林則是「三個臭皮匠勝過一個諸葛亮」——種很多棵不一樣的樹,讓它們投票,結果更穩更準。

if-else 分裂吉尼/熵過擬合Bagging多樹投票

🌲 一、決策樹:一連串「是非題」

決策樹就像玩「20 個問題」猜謎:一路問是非題,把可能性越縮越小,最後給出答案。

怎麼決定「問哪個問題」?

每個節點挑一個特徵+門檻來切,目標是切完之後兩邊越「純」越好(同一類的盡量分到同一邊)。純不純用 吉尼不純度(Gini)熵/資訊增益衡量——選能讓資料最純的那一刀。一路切到葉節點,就給出預測。

🎮 二、動手玩:單樹走一條路 vs 森林投票

上方切換「單一決策樹 / 隨機森林」。點紫色菱形(未知資料點):單樹模式看它沿一條路徑走到葉節點;森林模式看三棵樹各自判斷、再匯總投票。

決策樹 vs. 隨機森林 互動圖解 模式一:單一決策樹 模式二:隨機森林 (多樹投票) 未知數據點 (特徵:紅色, 小型) 點擊此處開始預測! (點擊紫色菱形開始) 是紅色嗎? 是大型嗎? 結果:類別 B (非紅) 結果:類別 B (大紅) 結果:類別 A (小紅) 單一決策樹特點: 結構簡單直觀,像一系列是非題。 但容易「過擬合」(太鑽牛角尖),對特定訓練數據太敏感。

🗺️ 怎麼看

單樹:資料點沿「是紅色?→ 是大型?」一路走到唯一的葉節點——路徑清楚、可解釋,但整棵樹的判斷押在一條路徑上。森林:三棵樹各用不同的特徵/角度判斷,可能各給不同答案,最後多數決(2 票 A、1 票 B → A 勝)。少數幾棵樹的錯誤會被多數平均掉

⚖️ 三、決策樹的優點與致命傷

✅ 直觀可解釋一串是非題,能畫出來、能跟老闆解釋為什麼。
✅ 不用標準化依門檻切分,對特徵縮放不敏感,省去前處理。
❌ 容易過擬合不限制就會一直分到連雜訊都背下來,對新資料差。
❌ 不穩定換一點資料,整棵樹可能長得完全不同(高變異)。

怎麼抑制單樹過擬合?

剪枝(pruning)、限制最大深度、設葉節點最小樣本數——別讓它分太細。但更強的做法是……種一片森林。

🌳 四、隨機森林:讓「差異化」的樹一起投票

隨機森林靠兩層隨機製造出一群「彼此不太一樣」的樹,再讓它們投票(分類)或平均(回歸)。

① Bagging(自助抽樣)對訓練資料有放回抽樣,每棵樹看到的資料略不同。
② 隨機特徵子集每次分裂只從隨機一部分特徵裡挑——讓樹彼此去相關,不會都長一樣。
③ 投票 / 平均多棵樹的結果匯總,把個別樹的錯誤平均掉

🧠 為什麼有效?降變異

單棵樹高變異(不穩);把很多棵去相關的樹平均起來,變異就大幅下降——這正是 偏差-變異 裡「Bagging 降變異」的道理。代價是:犧牲一點單樹的可解釋性

📊 五、單樹 vs 森林 對照

比較單一決策樹隨機森林
準確 / 穩定較低、不穩更準、更穩
過擬合容易大幅緩解
可解釋性(畫得出來)較低(黑盒一點)
速度較慢(多棵樹)

🆚 六、隨機森林 vs 梯度提升(GBDT)

📌 都是「集成很多樹」,但方式相反

隨機森林=Bagging:很多棵獨立的樹並行訓練、投票,主要降變異、較不易過擬合、好調。
GBDT=Boosting:樹一棵接一棵,每棵專門修正前面的殘差,主要降偏差、通常更準,但較易過擬合、需細調。詳見 集成學習GBDT

🧰 七、兩個實用重點

不用標準化樹靠門檻切分,對特徵單調轉換不敏感——這是相對 SVMKNN 的一大便利。
特徵重要性 & OOB森林能算出哪個特徵最有用,並用袋外樣本(OOB)免費估誤差,不必另切驗證集。

🧪 八、觀念自我檢測

先想再點開。

Q1. 決策樹每個節點怎麼決定怎麼切?

挑特徵+門檻,讓切完後兩邊最純(用吉尼/熵/資訊增益衡量)。

Q2. 決策樹為什麼容易過擬合?怎麼辦?

不限制會分到連雜訊都背;用剪枝、限深度、葉節點最小樣本數抑制。

Q3. 隨機森林用哪兩層隨機讓樹差異化?

Bagging(有放回抽樣資料)每次分裂用隨機特徵子集

Q4. 隨機森林主要降偏差還是變異?

主要降變異(多棵去相關的樹平均)。GBDT 才是降偏差。

Q5. 樹模型需要對特徵標準化嗎?

不需要,樹依門檻切分、對縮放不敏感。

✅ 九、30 秒重點整理

決策樹if-else 是非題,吉尼/熵分最純。
單樹缺點易過擬合、高變異、不穩。
隨機森林Bagging + 隨機特徵 + 投票。
效果降變異、更準更穩,犧牲點解釋性。
vs GBDT森林並行降變異、GBDT 序列降偏差。
樹不用標準化+特徵重要性/OOB。

📝 iPAS 考點提醒

決策樹與隨機森林是 iPAS 常考的對比題(中級科目三)。重點:單棵決策樹易解釋但不穩、易過擬合;隨機森林用裝袋(Bagging)加隨機特徵訓練多棵樹再投票,更準更穩。易混點:隨機森林犧牲單樹的可解釋性換取準確與穩定;它降的是變異(與 Boosting 降偏差不同)。情境:判斷該用單樹(求解釋)還是森林(求準確)。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

決策樹怎麼做決策?

像一連串 if-else:每個節點挑一個特徵與門檻,把資料分得「最純」(用資訊增益/熵或吉尼不純度衡量),一路分到葉節點給出預測。

決策樹為什麼容易過擬合?

若不限制深度,樹會一直分到完美擬合訓練資料(連雜訊都記住),對新資料就差;可用剪枝、限制深度或葉節點最小樣本數來抑制。

隨機森林如何改善單棵樹?

用 bagging(對資料有放回抽樣訓練多棵樹),再加「每次分裂只考慮隨機特徵子集」讓樹彼此去相關;最後投票或平均,大幅降低變異、更穩定。

隨機森林和梯度提升(GBDT)差在哪?

隨機森林是 bagging(多棵獨立樹並行、主要降變異);GBDT 是 boosting(樹一棵接一棵修正前面的殘差、主要降偏差),通常更準但較易過擬合、需細調。

樹模型需要標準化嗎?

不需要。樹依門檻分割,對特徵的單調轉換不敏感,所以不必標準化,這是相對 SVM/KNN 的一大便利。

🧭 相關主題

← 返回 AI 學習與考證地圖