🗺️ AI 學習與考證地圖
Lesson 01 · High to Low

貓老師複習站 · 非監督式學習

降維 Dimensionality Reduction

幾百個欄位看不動?降維把資料壓到少數幾個「重點方向」。PCA 的核心:沿著資料變異最大的方向投影,丟掉變異小的雜訊。

Mochi 的白話提醒:像把厚厚一疊特徵卡整理成幾張摘要卡,張數變少,但最重要的線索要留下來。

max Var(Xw) s.t. ‖w‖ = 1 (找變異最大的投影方向)
貓老師 Mochi 把大量彩色特徵資料壓縮成兩張主成分卡片
Lesson 02 · Methods

把很多欄位,壓成少少幾個重點

真實資料常有幾十、幾百個特徵(欄位),人眼根本看不動。降維就是用更少的維度,盡量保留原本的資訊——像把一段 3D 影子打到一張 2D 紙上,只要角度選得好,影子仍能看出形狀。

PCA 主成分分析 · 線性

找「變異最大」的方向當新座標軸,把資料投影上去。線性、最常用。

t-SNE 非線性

專門把高維資料攤平到 2D 視覺化,讓相似的點靠在一起。

UMAP 非線性

比 t-SNE 快,同時較能保留資料的全局結構。

貓老師 Mochi 展示 PCA、t-SNE 與 UMAP 三種降維方法
Lesson 03 · PCA Lab

旋轉投影軸,看保留了多少資訊

下面是一團 2D 資料。轉動那條投影軸,所有點會被「壓」到這條線上(綠點)。當軸對準資料最長、最分散的方向時,投影後的點散得最開——代表保留的變異(資訊)最多,這正是 PCA 的第一主成分。

20°
保留變異比例
狀態

轉到「保留變異比例」最大時,就是第一主成分的方向。降維就是優先沿著這些高變異方向保留資訊、丟掉變異小的方向。

貓老師 Mochi 轉動投影軸並把資料點投影到軸上
Lesson 04 · Evaluation

怎麼判斷降維保留得夠不夠?

評估常看:解釋變異比例(前幾個主成分保住了原資料多少百分比的變異)、以及降維後拿去做下游任務(分類、視覺化)的效果。

比例越高,代表保留的資訊越多;但真正夠不夠,仍要回到使用目的與下游表現一起判斷。

優點

  • 壓縮特徵、加速訓練、減少儲存
  • 去除雜訊與冗餘、緩解維度災難
  • 2D/3D 視覺化,肉眼看出群聚結構

缺點 / 限制

  • 線性 PCA 抓不到彎曲的非線性結構
  • 降維後的新軸通常難以直接解釋
  • t-SNE/UMAP 結果受參數影響、不適合拿來做距離計算
貓老師 Mochi 用量尺與長條比較保留變異和資訊損失
Lesson 05 · Applications

降維能拿來做什麼?

Mochi 把降維當成「先整理再出發」:先濃縮資料裡的主要方向,再依任務做分析、觀察或訓練。

典型應用場景

基因資料

上萬基因壓到少數主成分再分析

資料視覺化

高維特徵攤成 2D 看群聚

前處理加速

降維後再餵給下游模型

研究員 Mochi 查看基因、二維視覺化與模型加速三種降維應用
Lesson 06 · Review

把降維重點收進三張卡

📝 iPAS 考點提醒

降維把高維資料壓到少數維度,iPAS 中級科目三考點。重點:減少特徵數可去冗餘、抗維度詛咒、加速運算與視覺化;線性用 PCA、非線性用 t-SNE 或 UMAP。易混點:PCA 非監督、保留最大變異方向且可解釋變異比例;t-SNE 與 UMAP 適合視覺化但軸無意義、不宜當特徵直接餵模型。情境:視覺化高維資料、前處理去冗餘。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

為什麼要降維?

減少特徵數以利視覺化、去雜訊與冗餘、降低運算與儲存成本、緩解維度詛咒,有時還能提升下游模型表現。

什麼是維度詛咒?

維度越高資料越稀疏、點距離趨於相近,使距離型方法(KNN、分群)失效、所需樣本量暴增;降維有助緩解。

線性與非線性降維怎麼選?

想保留全局結構、要可解釋與可逆,用線性的 PCA;想做視覺化、保留複雜的局部結構,用非線性的 t-SNE 或 UMAP。

特徵選擇和特徵抽取差在哪?

特徵選擇是挑出原始特徵的子集(保留可解釋性);特徵抽取(如 PCA)是組合成新的特徵(主成分),通常較難直接解讀。

降維有什麼風險?

一定會損失部分資訊;若降太多或方法不當,可能丟掉對任務重要的訊號,需用解釋變異比例或下游表現來檢查。

降維 · 互動教學 · Mochi 貓老師複習站

貓老師 Mochi 微笑揮手並拿著三張降維複習卡