❓ 一、決策樹=一連串「最有效的問題」
像玩「20 個問題」猜謎——好問題一次砍掉一半可能性,爛問題問了等於沒問。
決策樹要解決的核心問題
一堆混在一起的資料,決策樹要從眾多特徵中挑出一個最棒的問題把資料切開,讓切完的兩堆越乾淨(純)越好。挑哪個問題?就看哪個問題帶來的資訊增益最大。
🌀 二、什麼是「亂度」(熵 / 不確定性)?
高亂度紅球藍球混在一起,你完全猜不準隨手抓一顆是什麼色 → 不確定性最高。
亂度 = 0一堆全同色(純淨),閉著眼睛抓都對 → 完全確定。
熵(Entropy)就是這個「亂」的量尺
熵越高=越混亂、越不確定;熵越低=越純、越確定。決策樹的目標,就是每切一刀都盡量把熵降下來。
🎮 三、動手玩:爛問題 vs 好問題
上面箱子裡 8 紅 8 藍混在一起(高亂度)。點「爛問題」看它切完兩邊還是很混;點「好問題」看它完美分開、亂度歸零。對照下方的「資訊增益」。
🗺️ 怎麼看
爛問題(如「重量 > 10kg?」):紅藍都有重有輕,切完左右兩箱依然很混、亂度幾乎沒降 → 資訊增益極低,決策樹會果斷放棄它。好問題(如「有長耳朵?」):一刀把兔子(紅)貓(藍)完美分開、左右亂度都歸 0 → 資訊增益最高,樹就選它當這個節點的分裂條件。
🧮 四、資訊增益=亂度減少了多少
資訊增益 = 分裂前的熵 − 分裂後的熵(加權平均)
分裂後的熵 = 左子集熵 × 左邊比例 + 右子集熵 × 右邊比例
白話
「切這一刀,把混亂降低了多少?」降越多=資訊增益越大=這個問題越好。決策樹在每個節點把所有可能的特徵/門檻都算一遍,永遠挑資訊增益最高的那個來切,然後對子節點遞迴重複,直到分完。
📐 五、三種衡量「純度」的指標
| 指標 | 用於 | 直覺 |
| 資訊增益(熵) | 分類 | 用熵衡量亂度,選亂度降最多的分裂 |
| 吉尼不純度 Gini | 分類 | 隨手抓兩顆不同類的機率,越低越純(CART 預設) |
| 變異數減少 | 回歸 | 切完後兩邊數值越集中越好 |
🧠 熵 vs Gini
兩者結果通常很接近;Gini 計算較快(不用算 log),所以 sklearn 的 CART 預設用 Gini。考試知道「分類用熵/Gini、回歸用變異減少」即可。
♻️ 六、遞迴分裂、貪婪,以及何時停
遞迴分裂對每個子節點重複「找最佳分裂」,樹越長越深。
貪婪(greedy)每一步只挑當下增益最高的,不保證整棵樹全局最佳——但實務夠好又快。
何時停?子集夠純、達到最大深度、或葉節點樣本太少就停,避免過度細分。
⚠️ 分太細=過擬合
如果放任它一直分到每個葉子只剩一顆球,它會
連雜訊都背下來、對新資料很差。這就是為什麼要
剪枝、限深度,或乾脆用
隨機森林 這種多樹集成來壓低變異。
🧪 七、觀念自我檢測
先想再點開。
Q1. 決策樹每個節點怎麼挑分裂條件?
把所有特徵/門檻算一遍,選資訊增益最高(讓亂度降最多)的那個。
Q2. 熵(亂度)高低代表什麼?
高=混雜不確定;0=全同類、完全純淨。
Q3. 資訊增益怎麼算?
分裂前的熵 − 分裂後的加權熵;降越多增益越大。
Q4. 分類、回歸各用什麼純度指標?
分類用資訊增益(熵)或吉尼;回歸用變異數減少。
Q5. 為什麼樹是「貪婪」的?有什麼隱憂?
每步只挑當下最佳、不保證全局最優;分太細會過擬合,需剪枝或用森林。
✅ 八、30 秒重點整理
目標每刀把資料分得越純越好。
熵=亂度高=混、0=純。
資訊增益分裂前後亂度差,越大越好。
純度指標熵/Gini(分類)、變異減少(回歸)。
遞迴+貪婪每步選當下最佳、重複到停。
分太細會過擬合剪枝/限深/用森林。
📝 iPAS 考點提醒
決策樹用一連串是非判斷把資料逐層分割,iPAS 監督式學習考點(初級科目一、中級科目三)。重點:分類用資訊增益(熵)或吉尼不純度選分裂、迴歸用變異數下降;易解釋、不需特徵縮放、能處理數值與類別。易混點:單棵樹容易過擬合(長太深),需剪枝或限制深度;單樹不穩、隨機森林(多樹投票)能大幅改善。情境:需要可解釋規則的場景。
想練情境題與詳解 → AI 學習與考證地圖
❓ 常見問題
決策樹怎麼做決策?
像一連串 if-else:每個節點挑一個特徵與門檻把資料分成更純的子集,一路往下分到葉節點輸出預測(分類或數值)。
怎麼決定每個節點用哪個特徵分裂?
挑能讓子集最純的分法,分類常用資訊增益(熵)或吉尼不純度、回歸用變異減少,貪婪地每步選最佳分裂。
決策樹的優點?
直觀好解讀(可畫成流程圖)、不需特徵標準化、能處理數值與類別特徵、可呈現特徵重要性。
為什麼容易過擬合、怎麼防?
不限制就會一直分到記住雜訊;用剪枝、限制最大深度、設定葉節點最小樣本數,或改用隨機森林、GBDT 等集成法。
決策樹和隨機森林的關係?
隨機森林是很多棵決策樹的集成(bagging 加隨機特徵),用投票或平均降低單棵樹的高變異,通常更準更穩但較不易解讀。