📽️ 監督式降維 + 分類 · iPAS 常考

LDA 線性判別分析:找出「最能分開類別」的角度

LDA 一招兩用:它能分類,也能降維。核心點子很單純——找一個「觀看角度」,讓不同類別投影下去後分得最開、同類擠最緊。這頁先用直覺帶你懂,再玩 LDA vs QDA 的決策邊界,最後釐清它和 PCA 的差別(考試最愛考)。

投影直覺類間大/類內小LDA vs PCA最多 k−1 維LDA vs QDA兩個 LDA 別搞混

🤔 一、LDA 在做什麼?

一句話:用「有標籤」的資料,找出一個最能把類別分開的方向

💡 白話定義

LDA(Linear Discriminant Analysis,線性判別分析)會看你的資料各屬於哪一類,然後找一條線/方向,把資料投影上去,使得不同類別的影子分得最開、同一類的影子擠得最緊。投影後不只好分類,維度還變少了——所以它同時是分類器,也是降維工具。

🔦 用「打光投影」想像

把兩群點想成空中的兩團棉花糖,你拿手電筒從某個角度照,牆上會有它們的影子。換不同角度,影子有時清楚分成兩坨、有時糊成一團。LDA 做的,就是自動找出「讓兩團影子分最開」的那個照射角度。
LDA 找的好方向 類別 A 類別 B 沿綠色方向看,藍與紅分得最開;換成別的角度就會糊在一起。

🎯 二、LDA 的兩個目標:分得開、又擠得緊

什麼叫「好的投影方向」?LDA 用兩個指標同時衡量。

1
類間變異「最大化」(Between-class)
投影後,不同類別的中心離得越遠越好——這樣兩群才不會黏在一起。
2
類內變異「最小化」(Within-class)
投影後,同一類的點要擠得越緊越好——免得自己這一坨就散開、跟別類重疊。

🧮 一句話的數學

LDA 就是讓 (類間距離 ÷ 類內散度)這個比值越大越好。比值大 = 兩群分得開、各自又緊實 = 最好分類的方向。

⚖️ 三、LDA vs PCA:差在「有沒有看標籤」

兩個都能降維,但目標完全不同——這是考試最高頻的對比。

比較LDAPCA
有沒有用標籤監督式(要知道每點哪一類)非監督式(不看類別)
找什麼方向最能分開類別的方向資料整體變異最大的方向
目的分類前降維、提升可分性壓縮、去冗餘、視覺化
最多降到類別數 − 1原始特徵數(可自選)

🎯 一個經典陷阱

「整體變異最大的方向」不一定是「最能分開類別的方向」!有時資料散得最開的軸,剛好讓兩類混在一起。PCA 看不到標籤、會選錯;LDA 因為知道標籤,會選真正能分類的方向。要分類就用 LDA,純壓縮/探索就用 PCA。

📏 四、為什麼「最多只能降到 類別數 − 1 維」?

這是 LDA 的固有限制、也是常考的數字。

🔢 直覺理解

要分開 2 類,只需要一條線(1 維)就能把它們排開;要分開 3 類,最多一個平面(2 維)。所以 k 類 → 最多 k−1 個有用的判別方向。多出來的方向對「區分類別」沒有貢獻。
(對比 PCA:PCA 想降幾維就降幾維,因為它跟類別數無關。)

🎮 五、動手玩:LDA vs QDA 決策邊界

這個 demo 換個角度看 LDA——當成分類器時,它怎麼把平面切兩半。順便跟它的「曲線版」表親 QDA 比一比。

🗺️ 怎麼看這張圖

藍點 / 紅點 = 兩個類別的資料;十字 ✚ 是各類的中心。
背景藍/紅色塊 = 模型的判定區域:落在藍區就判藍、紅區就判紅。
兩色交界 = 決策邊界LDA → 直線(假設兩類形狀相同);QDA → 曲線(允許兩類形狀不同)。

操作:切換 LDA / QDA 看邊界從直線變曲線;把某一類的擴散度調大(變胖),QDA 的邊界會明顯彎曲、LDA 仍是直線;按「重新生成」換位置。

類別 A 區域
類別 B 區域
交界線:決策邊界

📐 六、LDA vs QDA:什麼時候用哪個?

兩者都假設資料像高斯(橢圓)分佈,差別在「各類形狀能不能不一樣」

比較LDAQDA
各類共變異數共用同一個(形狀相同)各自獨立(形狀可不同)
決策邊界直線/超平面曲線(橢圓、拋物線…)
參數量少 → 較不易過擬合多 → 需要更多資料
適合時機各類分散度差不多、資料量少各類形狀明顯不同、資料夠多

🧩 直白記法

LDA 認為「大家形狀一樣、只是位置不同」→ 用一條直線切;QDA 放寬成「各有各的胖瘦」→ 邊界可。形狀假設越寬鬆、邊界越靈活,但也越吃資料。
🔬 進階:判別函數的數學式(想深入再點)

兩者都從後驗機率 $P(Y=k\mid X) \propto f_k(X)\cdot \pi_k$ 出發,取 log 後得到判別函數 $\delta_k(x)$,選 $\delta_k$ 最大的類別。

LDA: $$ \delta_k(x) = x^T \Sigma^{-1} \mu_k - \tfrac{1}{2}\mu_k^T \Sigma^{-1} \mu_k + \log \pi_k $$ $x$ 只有一次方項 → 邊界是線性的。
QDA: $$ \delta_k(x) = -\tfrac{1}{2}x^T \Sigma_k^{-1} x + x^T \Sigma_k^{-1} \mu_k - \tfrac{1}{2}\mu_k^T \Sigma_k^{-1}\mu_k - \tfrac{1}{2}\log|\Sigma_k| + \log\pi_k $$ 多了 $x^T\Sigma_k^{-1}x$(含 $x^2$ 二次項)→ 邊界是「二次」曲線。

⚠️ 七、超重要:兩個「LDA」別搞混

它們完全是兩回事

本頁的 LDA = Linear Discriminant Analysis(線性判別分析):監督式的降維 / 分類方法。
另一個常見的 LDA = Latent Dirichlet Allocation(隱含狄利克雷分配):是主題模型,用來從一堆文件中找出潛在主題,跟本頁完全無關。考試看到 LDA,先看上下文是「分類/降維」還是「文字主題」。

🧪 八、觀念自我檢測

先想再點開。

Q1. LDA 和 PCA 最關鍵的差別是什麼?

有沒有用標籤。LDA 是監督式,找「最能分開類別」的方向;PCA 是非監督式,找「整體變異最大」的方向。要分類用 LDA、純壓縮用 PCA。

Q2. 有 4 個類別,LDA 最多能降到幾維?

3 維(類別數 − 1 = 4 − 1)。這是 LDA 的固有限制,PCA 沒有這個限制。

Q3. 為什麼 LDA 的決策邊界是直線,QDA 卻是曲線?

LDA 假設各類共用同一個共變異數(形狀相同),判別函數只有一次項 → 邊界線性;QDA 允許各類形狀不同,判別函數含二次項 → 邊界是曲線。

Q4. 看到「LDA」一定是線性判別分析嗎?

不一定!文字/主題模型裡的 LDA 是 Latent Dirichlet Allocation(隱含狄利克雷分配),跟線性判別分析完全不同,要看上下文判斷。

✅ 九、30 秒重點整理

LDA = 監督式降維 + 分類找最能分開類別的投影方向。
目標:類間大、類內小不同類分得開、同類擠得緊。
vs PCALDA 看標籤找可分方向;PCA 不看標籤找最大變異。
最多降到 k−1 維k 是類別數,這是固有限制。
vs QDALDA 直線邊界(形狀相同);QDA 曲線(形狀可不同、吃資料)。
別搞混另一個 LDA 是主題模型 Latent Dirichlet Allocation。

📝 iPAS 考點提醒

LDA(線性判別分析)是監督式降維兼分類法,iPAS 中級科目三考點。重點:找讓類間分離最大、類內變異最小的投影方向,最多降到類別數減一維。易混點:LDA(監督、用標籤找最能分類的方向)與 PCA(非監督、只看整體變異)不同;且這個 LDA 別跟主題模型的 LDA(隱含狄利克雷分配)搞混。情境:分類前降維、人臉辨識。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

LDA(線性判別分析)在做什麼?

一種監督式降維兼分類法,找能讓類間分離最大、類內變異最小的投影方向;常用於分類前降維與人臉辨識。

LDA 和 PCA 差在哪?

PCA 非監督、只看整體變異最大方向;LDA 監督、利用標籤找最能區分類別的方向,故更適合分類前降維。

LDA 最多能降到幾維?

最多到類別數減一維;例如 3 類最多降到 2 維,這是 LDA 的固有限制(與 PCA 不同)。

LDA 有什麼假設?

假設各類服從常態分布且共用相同共變異數矩陣;違反時(如各類分散度差很多)可改用 QDA。

注意別混淆哪個 LDA?

這裡的 LDA 是線性判別分析;主題模型裡的 LDA 是 Latent Dirichlet Allocation(隱含狄利克雷分配),兩者完全不同。

🧭 相關主題

← 返回 AI 學習與考證地圖