📽️ 監督式降維 + 分類 · iPAS 常考
LDA 線性判別分析:找出「最能分開類別」的角度
LDA 一招兩用:它能分類,也能降維。核心點子很單純——找一個「觀看角度」,讓不同類別投影下去後分得最開、同類擠最緊。這頁先用直覺帶你懂,再玩 LDA vs QDA 的決策邊界,最後釐清它和 PCA 的差別(考試最愛考)。
投影直覺類間大/類內小LDA vs PCA最多 k−1 維LDA vs QDA兩個 LDA 別搞混
🤔 一、LDA 在做什麼?
一句話:用「有標籤」的資料,找出一個最能把類別分開的方向。
💡 白話定義
LDA(Linear Discriminant Analysis,線性判別分析)會看你的資料各屬於哪一類,然後找一條線/方向,把資料投影上去,使得不同類別的影子分得最開、同一類的影子擠得最緊。投影後不只好分類,維度還變少了——所以它同時是分類器,也是降維工具。
🔦 用「打光投影」想像
把兩群點想成空中的兩團棉花糖,你拿手電筒從某個角度照,牆上會有它們的影子。換不同角度,影子有時清楚分成兩坨、有時糊成一團。LDA 做的,就是自動找出「讓兩團影子分最開」的那個照射角度。
🎯 二、LDA 的兩個目標:分得開、又擠得緊
什麼叫「好的投影方向」?LDA 用兩個指標同時衡量。
1
類間變異「最大化」(Between-class)
投影後,不同類別的中心離得越遠越好——這樣兩群才不會黏在一起。
2
類內變異「最小化」(Within-class)
投影後,同一類的點要擠得越緊越好——免得自己這一坨就散開、跟別類重疊。
🧮 一句話的數學
LDA 就是讓 (類間距離 ÷ 類內散度)這個比值越大越好。比值大 = 兩群分得開、各自又緊實 = 最好分類的方向。
⚖️ 三、LDA vs PCA:差在「有沒有看標籤」
兩個都能降維,但目標完全不同——這是考試最高頻的對比。
| 比較 | LDA | PCA |
| 有沒有用標籤 | ✅ 監督式(要知道每點哪一類) | ❌ 非監督式(不看類別) |
| 找什麼方向 | 最能分開類別的方向 | 資料整體變異最大的方向 |
| 目的 | 分類前降維、提升可分性 | 壓縮、去冗餘、視覺化 |
| 最多降到 | 類別數 − 1 維 | 原始特徵數(可自選) |
🎯 一個經典陷阱
「整體變異最大的方向」不一定是「最能分開類別的方向」!有時資料散得最開的軸,剛好讓兩類混在一起。PCA 看不到標籤、會選錯;LDA 因為知道標籤,會選真正能分類的方向。要分類就用 LDA,純壓縮/探索就用 PCA。
📏 四、為什麼「最多只能降到 類別數 − 1 維」?
這是 LDA 的固有限制、也是常考的數字。
🔢 直覺理解
要分開 2 類,只需要一條線(1 維)就能把它們排開;要分開 3 類,最多一個平面(2 維)。所以 k 類 → 最多 k−1 個有用的判別方向。多出來的方向對「區分類別」沒有貢獻。
(對比 PCA:PCA 想降幾維就降幾維,因為它跟類別數無關。)
🎮 五、動手玩:LDA vs QDA 決策邊界
這個 demo 換個角度看 LDA——當成分類器時,它怎麼把平面切兩半。順便跟它的「曲線版」表親 QDA 比一比。
📐 六、LDA vs QDA:什麼時候用哪個?
兩者都假設資料像高斯(橢圓)分佈,差別在「各類形狀能不能不一樣」。
| 比較 | LDA | QDA |
| 各類共變異數 | 共用同一個(形狀相同) | 各自獨立(形狀可不同) |
| 決策邊界 | 直線/超平面 | 曲線(橢圓、拋物線…) |
| 參數量 | 少 → 較不易過擬合 | 多 → 需要更多資料 |
| 適合時機 | 各類分散度差不多、資料量少 | 各類形狀明顯不同、資料夠多 |
🧩 直白記法
LDA 認為「大家形狀一樣、只是位置不同」→ 用一條直線切;QDA 放寬成「各有各的胖瘦」→ 邊界可彎。形狀假設越寬鬆、邊界越靈活,但也越吃資料。
🔬 進階:判別函數的數學式(想深入再點)
兩者都從後驗機率 $P(Y=k\mid X) \propto f_k(X)\cdot \pi_k$ 出發,取 log 後得到判別函數 $\delta_k(x)$,選 $\delta_k$ 最大的類別。
LDA:
$$ \delta_k(x) = x^T \Sigma^{-1} \mu_k - \tfrac{1}{2}\mu_k^T \Sigma^{-1} \mu_k + \log \pi_k $$
$x$ 只有一次方項 → 邊界是線性的。
QDA:
$$ \delta_k(x) = -\tfrac{1}{2}x^T \Sigma_k^{-1} x + x^T \Sigma_k^{-1} \mu_k - \tfrac{1}{2}\mu_k^T \Sigma_k^{-1}\mu_k - \tfrac{1}{2}\log|\Sigma_k| + \log\pi_k $$
多了 $x^T\Sigma_k^{-1}x$(含 $x^2$ 二次項)→ 邊界是「二次」曲線。
⚠️ 七、超重要:兩個「LDA」別搞混
它們完全是兩回事
本頁的 LDA = Linear Discriminant Analysis(線性判別分析):監督式的降維 / 分類方法。
另一個常見的 LDA = Latent Dirichlet Allocation(隱含狄利克雷分配):是主題模型,用來從一堆文件中找出潛在主題,跟本頁完全無關。考試看到 LDA,先看上下文是「分類/降維」還是「文字主題」。
🧪 八、觀念自我檢測
先想再點開。
Q1. LDA 和 PCA 最關鍵的差別是什麼?
有沒有用標籤。LDA 是監督式,找「最能分開類別」的方向;PCA 是非監督式,找「整體變異最大」的方向。要分類用 LDA、純壓縮用 PCA。
Q2. 有 4 個類別,LDA 最多能降到幾維?
3 維(類別數 − 1 = 4 − 1)。這是 LDA 的固有限制,PCA 沒有這個限制。
Q3. 為什麼 LDA 的決策邊界是直線,QDA 卻是曲線?
LDA 假設各類共用同一個共變異數(形狀相同),判別函數只有一次項 → 邊界線性;QDA 允許各類形狀不同,判別函數含二次項 → 邊界是曲線。
Q4. 看到「LDA」一定是線性判別分析嗎?
不一定!文字/主題模型裡的 LDA 是 Latent Dirichlet Allocation(隱含狄利克雷分配),跟線性判別分析完全不同,要看上下文判斷。
✅ 九、30 秒重點整理
LDA = 監督式降維 + 分類找最能分開類別的投影方向。
目標:類間大、類內小不同類分得開、同類擠得緊。
vs PCALDA 看標籤找可分方向;PCA 不看標籤找最大變異。
最多降到 k−1 維k 是類別數,這是固有限制。
vs QDALDA 直線邊界(形狀相同);QDA 曲線(形狀可不同、吃資料)。
別搞混另一個 LDA 是主題模型 Latent Dirichlet Allocation。
📝 iPAS 考點提醒
LDA(線性判別分析)是監督式降維兼分類法,iPAS 中級科目三考點。重點:找讓類間分離最大、類內變異最小的投影方向,最多降到類別數減一維。易混點:LDA(監督、用標籤找最能分類的方向)與 PCA(非監督、只看整體變異)不同;且這個 LDA 別跟主題模型的 LDA(隱含狄利克雷分配)搞混。情境:分類前降維、人臉辨識。
想練情境題與詳解 → AI 學習與考證地圖
❓ 常見問題
LDA(線性判別分析)在做什麼?
一種監督式降維兼分類法,找能讓類間分離最大、類內變異最小的投影方向;常用於分類前降維與人臉辨識。
LDA 和 PCA 差在哪?
PCA 非監督、只看整體變異最大方向;LDA 監督、利用標籤找最能區分類別的方向,故更適合分類前降維。
LDA 最多能降到幾維?
最多到類別數減一維;例如 3 類最多降到 2 維,這是 LDA 的固有限制(與 PCA 不同)。
LDA 有什麼假設?
假設各類服從常態分布且共用相同共變異數矩陣;違反時(如各類分散度差很多)可改用 QDA。
注意別混淆哪個 LDA?
這裡的 LDA 是線性判別分析;主題模型裡的 LDA 是 Latent Dirichlet Allocation(隱含狄利克雷分配),兩者完全不同。