Dimensionality Reduction

降維

用更少維度,保留最多資訊

幾百個欄位看不動?降維把資料壓到少數幾個「重點方向」。
PCA 的核心:沿著資料變異最大的方向投影,丟掉變異小的雜訊。

max Var(Xw) s.t. ‖w‖ = 1 (找變異最大的投影方向)
01 — 白話直覺

把很多欄位,壓成少少幾個重點

真實資料常有幾十、幾百個特徵(欄位),人眼根本看不動。降維就是用更少的維度,盡量保留原本的資訊——像把一段 3D 影子打到一張 2D 紙上,只要角度選得好,影子仍能看出形狀。

PCA
主成分分析

找「變異最大」的方向當新座標軸,把資料投影上去。線性、最常用。

t-SNE
非線性

專門把高維資料攤平到 2D 視覺化,讓相似的點靠在一起。

UMAP
非線性

比 t-SNE 快,同時較能保留資料的全局結構。

02 — 核心互動

旋轉投影軸,看保留了多少資訊

下面是一團 2D 資料。轉動那條投影軸,所有點會被「壓」到這條線上(白點)。當軸對準資料最長、最分散的方向時,投影後的點散得最開——代表保留的變異(資訊)最多,這正是 PCA 的第一主成分。

20°
保留變異比例
狀態

轉到「保留變異比例」最大時,就是第一主成分的方向。降維就是優先沿著這些高變異方向保留資訊、丟掉變異小的方向。

03 — 評估與用途

降維能拿來做什麼?

評估常看:解釋變異比例(前幾個主成分保住了原資料多少百分比的變異)、以及降維後拿去做下游任務(分類、視覺化)的效果。

優點

  • 壓縮特徵、加速訓練、減少儲存
  • 去除雜訊與冗餘、緩解維度災難
  • 2D/3D 視覺化,肉眼看出群聚結構

缺點 / 限制

  • 線性 PCA 抓不到彎曲的非線性結構
  • 降維後的新軸通常難以直接解釋
  • t-SNE/UMAP 結果受參數影響、不適合拿來做距離計算

典型應用場景

🧬
基因資料
上萬基因壓到少數主成分再分析
👁️
資料視覺化
高維特徵攤成 2D 看群聚
前處理加速
降維後再餵給下游模型

📝 iPAS 考點提醒

降維把高維資料壓到少數維度,iPAS 中級科目三考點。重點:減少特徵數可去冗餘、抗維度詛咒、加速運算與視覺化;線性用 PCA、非線性用 t-SNE 或 UMAP。易混點:PCA 非監督、保留最大變異方向且可解釋變異比例;t-SNE 與 UMAP 適合視覺化但軸無意義、不宜當特徵直接餵模型。情境:視覺化高維資料、前處理去冗餘。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

為什麼要降維?

減少特徵數以利視覺化、去雜訊與冗餘、降低運算與儲存成本、緩解維度詛咒,有時還能提升下游模型表現。

什麼是維度詛咒?

維度越高資料越稀疏、點距離趨於相近,使距離型方法(KNN、分群)失效、所需樣本量暴增;降維有助緩解。

線性與非線性降維怎麼選?

想保留全局結構、要可解釋與可逆,用線性的 PCA;想做視覺化、保留複雜的局部結構,用非線性的 t-SNE 或 UMAP。

特徵選擇和特徵抽取差在哪?

特徵選擇是挑出原始特徵的子集(保留可解釋性);特徵抽取(如 PCA)是組合成新的特徵(主成分),通常較難直接解讀。

降維有什麼風險?

一定會損失部分資訊;若降太多或方法不當,可能丟掉對任務重要的訊號,需用解釋變異比例或下游表現來檢查。

🧭 相關主題

← 返回 AI 學習與考證地圖