決策樹像一連串「是非題」,直觀好懂但容易鑽牛角尖(過擬合)。隨機森林則是「三個臭皮匠勝過一個諸葛亮」——種很多棵不一樣的樹,讓它們投票,結果更穩更準。
決策樹就像玩「20 個問題」猜謎:一路問是非題,把可能性越縮越小,最後給出答案。
上方切換「單一決策樹 / 隨機森林」。點紫色菱形(未知資料點):單樹模式看它沿一條路徑走到葉節點;森林模式看三棵樹各自判斷、再匯總投票。
隨機森林靠兩層隨機製造出一群「彼此不太一樣」的樹,再讓它們投票(分類)或平均(回歸)。
| 比較 | 單一決策樹 | 隨機森林 |
|---|---|---|
| 準確 / 穩定 | 較低、不穩 | 更準、更穩 |
| 過擬合 | 容易 | 大幅緩解 |
| 可解釋性 | 高(畫得出來) | 較低(黑盒一點) |
| 速度 | 快 | 較慢(多棵樹) |
先想再點開。
挑特徵+門檻,讓切完後兩邊最純(用吉尼/熵/資訊增益衡量)。
不限制會分到連雜訊都背;用剪枝、限深度、葉節點最小樣本數抑制。
Bagging(有放回抽樣資料)+每次分裂用隨機特徵子集。
主要降變異(多棵去相關的樹平均)。GBDT 才是降偏差。
不需要,樹依門檻切分、對縮放不敏感。
決策樹與隨機森林是 iPAS 常考的對比題(中級科目三)。重點:單棵決策樹易解釋但不穩、易過擬合;隨機森林用裝袋(Bagging)加隨機特徵訓練多棵樹再投票,更準更穩。易混點:隨機森林犧牲單樹的可解釋性換取準確與穩定;它降的是變異(與 Boosting 降偏差不同)。情境:判斷該用單樹(求解釋)還是森林(求準確)。
想練情境題與詳解 → AI 學習與考證地圖
像一連串 if-else:每個節點挑一個特徵與門檻,把資料分得「最純」(用資訊增益/熵或吉尼不純度衡量),一路分到葉節點給出預測。
若不限制深度,樹會一直分到完美擬合訓練資料(連雜訊都記住),對新資料就差;可用剪枝、限制深度或葉節點最小樣本數來抑制。
用 bagging(對資料有放回抽樣訓練多棵樹),再加「每次分裂只考慮隨機特徵子集」讓樹彼此去相關;最後投票或平均,大幅降低變異、更穩定。
隨機森林是 bagging(多棵獨立樹並行、主要降變異);GBDT 是 boosting(樹一棵接一棵修正前面的殘差、主要降偏差),通常更準但較易過擬合、需細調。
不需要。樹依門檻分割,對特徵的單調轉換不敏感,所以不必標準化,這是相對 SVM/KNN 的一大便利。