幾百個欄位看不動?降維把資料壓到少數幾個「重點方向」。
PCA 的核心:沿著資料變異最大的方向投影,丟掉變異小的雜訊。
真實資料常有幾十、幾百個特徵(欄位),人眼根本看不動。降維就是用更少的維度,盡量保留原本的資訊——像把一段 3D 影子打到一張 2D 紙上,只要角度選得好,影子仍能看出形狀。
找「變異最大」的方向當新座標軸,把資料投影上去。線性、最常用。
專門把高維資料攤平到 2D 視覺化,讓相似的點靠在一起。
比 t-SNE 快,同時較能保留資料的全局結構。
下面是一團 2D 資料。轉動那條投影軸,所有點會被「壓」到這條線上(白點)。當軸對準資料最長、最分散的方向時,投影後的點散得最開——代表保留的變異(資訊)最多,這正是 PCA 的第一主成分。
轉到「保留變異比例」最大時,就是第一主成分的方向。降維就是優先沿著這些高變異方向保留資訊、丟掉變異小的方向。
評估常看:解釋變異比例(前幾個主成分保住了原資料多少百分比的變異)、以及降維後拿去做下游任務(分類、視覺化)的效果。
降維把高維資料壓到少數維度,iPAS 中級科目三考點。重點:減少特徵數可去冗餘、抗維度詛咒、加速運算與視覺化;線性用 PCA、非線性用 t-SNE 或 UMAP。易混點:PCA 非監督、保留最大變異方向且可解釋變異比例;t-SNE 與 UMAP 適合視覺化但軸無意義、不宜當特徵直接餵模型。情境:視覺化高維資料、前處理去冗餘。
想練情境題與詳解 → AI 學習與考證地圖
減少特徵數以利視覺化、去雜訊與冗餘、降低運算與儲存成本、緩解維度詛咒,有時還能提升下游模型表現。
維度越高資料越稀疏、點距離趨於相近,使距離型方法(KNN、分群)失效、所需樣本量暴增;降維有助緩解。
想保留全局結構、要可解釋與可逆,用線性的 PCA;想做視覺化、保留複雜的局部結構,用非線性的 t-SNE 或 UMAP。
特徵選擇是挑出原始特徵的子集(保留可解釋性);特徵抽取(如 PCA)是組合成新的特徵(主成分),通常較難直接解讀。
一定會損失部分資訊;若降太多或方法不當,可能丟掉對任務重要的訊號,需用解釋變異比例或下游表現來檢查。