判別分析分得好不好,看兩件事:分得準(準確率)、分得開(類別分離度)。
分離度是問題的先天難度——兩群太近,再好的模型也救不了。
LDA / QDA 是分類器:它假設每個類別的資料各自呈常態分布,然後找一條界線把類別分開。LDA 用直線邊界、QDA 允許彎曲邊界。評估它好不好,看兩件事:分得準不準(準確率),以及兩群分得開不開(類別分離度)。
兩群中心離越遠、各自越集中,越好分。
對角線(猜對)越多越好,斜角(猜錯)越少越好。
各類變異不同時,彎曲邊界比直線分得更準。
下圖是兩個類別投影到一條軸上的分布(藍 = 類別 A、橘 = 類別 B)。拖動決策門檻看準確率怎麼變;再調「兩群距離」看分離度如何根本性地決定一個分類問題的上限。
當兩群靠很近(分離度小),不管門檻怎麼調,準確率都上不去——這就是「類別分離度」的意義:它是這個分類問題先天的難度上限。
準確率 (Accuracy):整體猜對比例,類別均衡時好用。類別分離度 (d′ / Fisher 比):衡量群間距離相對群內離散的大小。類別不均衡時,還要再看 精確率 / 召回率 / F1。
LDA 與 QDA 是基於機率的分類法,iPAS 中級科目三考點。重點:都假設各類服從常態,LDA 假設共用相同共變異數(決策邊界線性)、QDA 各類各自共變異數(邊界為二次曲線)。易混點:QDA 更彈性但參數多、資料少易過擬合;這個 LDA 是線性判別分析,別跟主題模型 LDA 混。情境:資料近常態、想要可解釋的機率分類。
想練情境題與詳解 → AI 學習與考證地圖
線性判別分析(LDA)與二次判別分析(QDA)是基於機率的分類法;LDA 假設各類共用相同共變異(邊界線性),QDA 允許各類不同共變異(邊界二次)。
資料少或各類共變異相近用 LDA(較穩、參數少);各類分散差異大且資料足夠用 QDA(更彈性但易過擬合)。
能;LDA 可當監督式降維,找最能分開各類別的方向(最大化類間、最小化類內變異),與 PCA(非監督、看變異)不同。
用分類指標:準確率、Precision 與 Recall、F1、混淆矩陣、ROC-AUC;不平衡時看 F1 與 PR-AUC。
PCA 非監督、找最大變異方向;LDA 監督、找最能分類的方向;降維目的不同(保留資訊相對保留可分性)。