🌿 決策樹 · 資訊增益 · iPAS 考點

決策樹怎麼「挑問題」?靠資訊增益,把亂度降到最低

決策樹每一刀都在問:「哪個問題最能把資料分乾淨?」衡量的標準就是資訊增益——切完之後亂度(不確定性)下降最多的那個問題,就是這一刀的最佳選擇。

資訊增益熵 / 亂度吉尼不純度純度最大化貪婪分裂

❓ 一、決策樹=一連串「最有效的問題」

像玩「20 個問題」猜謎——好問題一次砍掉一半可能性,爛問題問了等於沒問。

決策樹要解決的核心問題

一堆混在一起的資料,決策樹要從眾多特徵中挑出一個最棒的問題把資料切開,讓切完的兩堆越乾淨(純)越好。挑哪個問題?就看哪個問題帶來的資訊增益最大。

🌀 二、什麼是「亂度」(熵 / 不確定性)?

高亂度紅球藍球混在一起,你完全猜不準隨手抓一顆是什麼色 → 不確定性最高。
亂度 = 0一堆全同色(純淨),閉著眼睛抓都對 → 完全確定。

熵(Entropy)就是這個「亂」的量尺

熵越高=越混亂、越不確定;熵越低=越純、越確定。決策樹的目標,就是每切一刀都盡量把熵降下來

🎮 三、動手玩:爛問題 vs 好問題

上面箱子裡 8 紅 8 藍混在一起(高亂度)。點「爛問題」看它切完兩邊還是很混;點「好問題」看它完美分開、亂度歸零。對照下方的「資訊增益」。

根據某特徵分裂... 分類前 (全部資料) 亂度 (不確定性):極高 回答為「是」 亂度:待計算 回答為「否」 亂度:待計算 資訊增益:0

🗺️ 怎麼看

爛問題(如「重量 > 10kg?」):紅藍都有重有輕,切完左右兩箱依然很混、亂度幾乎沒降 → 資訊增益極低,決策樹會果斷放棄它。好問題(如「有長耳朵?」):一刀把兔子(紅)貓(藍)完美分開、左右亂度都歸 0 → 資訊增益最高,樹就選它當這個節點的分裂條件。

🧮 四、資訊增益=亂度減少了多少

資訊增益 = 分裂前的熵 − 分裂後的熵(加權平均) 分裂後的熵 = 左子集熵 × 左邊比例 + 右子集熵 × 右邊比例

白話

切這一刀,把混亂降低了多少?」降越多=資訊增益越大=這個問題越好。決策樹在每個節點把所有可能的特徵/門檻都算一遍,永遠挑資訊增益最高的那個來切,然後對子節點遞迴重複,直到分完。

📐 五、三種衡量「純度」的指標

指標用於直覺
資訊增益(熵)分類用熵衡量亂度,選亂度降最多的分裂
吉尼不純度 Gini分類隨手抓兩顆不同類的機率,越低越純(CART 預設)
變異數減少回歸切完後兩邊數值越集中越好

🧠 熵 vs Gini

兩者結果通常很接近;Gini 計算較快(不用算 log),所以 sklearn 的 CART 預設用 Gini。考試知道「分類用熵/Gini、回歸用變異減少」即可。

♻️ 六、遞迴分裂、貪婪,以及何時停

遞迴分裂對每個子節點重複「找最佳分裂」,樹越長越深。
貪婪(greedy)每一步只挑當下增益最高的,不保證整棵樹全局最佳——但實務夠好又快。
何時停?子集夠純、達到最大深度、或葉節點樣本太少就停,避免過度細分。

⚠️ 分太細=過擬合

如果放任它一直分到每個葉子只剩一顆球,它會連雜訊都背下來、對新資料很差。這就是為什麼要剪枝、限深度,或乾脆用 隨機森林 這種多樹集成來壓低變異。

🧪 七、觀念自我檢測

先想再點開。

Q1. 決策樹每個節點怎麼挑分裂條件?

把所有特徵/門檻算一遍,選資訊增益最高(讓亂度降最多)的那個。

Q2. 熵(亂度)高低代表什麼?

高=混雜不確定0=全同類、完全純淨

Q3. 資訊增益怎麼算?

分裂前的熵 − 分裂後的加權熵;降越多增益越大。

Q4. 分類、回歸各用什麼純度指標?

分類用資訊增益(熵)或吉尼;回歸用變異數減少

Q5. 為什麼樹是「貪婪」的?有什麼隱憂?

每步只挑當下最佳、不保證全局最優;分太細會過擬合,需剪枝或用森林。

✅ 八、30 秒重點整理

目標每刀把資料分得越純越好。
熵=亂度高=混、0=純。
資訊增益分裂前後亂度差,越大越好。
純度指標熵/Gini(分類)、變異減少(回歸)。
遞迴+貪婪每步選當下最佳、重複到停。
分太細會過擬合剪枝/限深/用森林。

📝 iPAS 考點提醒

決策樹用一連串是非判斷把資料逐層分割,iPAS 監督式學習考點(初級科目一、中級科目三)。重點:分類用資訊增益(熵)或吉尼不純度選分裂、迴歸用變異數下降;易解釋、不需特徵縮放、能處理數值與類別。易混點:單棵樹容易過擬合(長太深),需剪枝或限制深度;單樹不穩、隨機森林(多樹投票)能大幅改善。情境:需要可解釋規則的場景。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

決策樹怎麼做決策?

像一連串 if-else:每個節點挑一個特徵與門檻把資料分成更純的子集,一路往下分到葉節點輸出預測(分類或數值)。

怎麼決定每個節點用哪個特徵分裂?

挑能讓子集最純的分法,分類常用資訊增益(熵)或吉尼不純度、回歸用變異減少,貪婪地每步選最佳分裂。

決策樹的優點?

直觀好解讀(可畫成流程圖)、不需特徵標準化、能處理數值與類別特徵、可呈現特徵重要性。

為什麼容易過擬合、怎麼防?

不限制就會一直分到記住雜訊;用剪枝、限制最大深度、設定葉節點最小樣本數,或改用隨機森林、GBDT 等集成法。

決策樹和隨機森林的關係?

隨機森林是很多棵決策樹的集成(bagging 加隨機特徵),用投票或平均降低單棵樹的高變異,通常更準更穩但較不易解讀。

🧭 相關主題

← 返回 AI 學習與考證地圖