🕸️ UMAP 降維視覺化 · iPAS 考點

UMAP:更快的降維視覺化,還能保留資料的「整體骨架」

UMAP 和 t-SNE 一樣,把高維資料壓成 2D 看群聚。但它走「流形+拓樸圖」的路線——通常更快、更能保留資料的整體形狀(全局結構),現在很多場合已取代 t-SNE。

非線性降維流形+鄰居圖比 t-SNE 快較保留全局n_neighbors · min_dist

🚇 一、先用白話講:UMAP 在做什麼?

UMAP 全名 Uniform Manifold Approximation and Projection。核心是「先建一張鄰居關係圖,再把它漂亮地攤平」。

🚇 生活比喻:畫捷運路線圖

捷運路線圖不在乎每兩站的實際公里數,它只忠實畫出「哪一站和哪一站相鄰、連到哪條線」。看圖的人就能輕鬆換乘。
UMAP 一樣:先記住「誰是誰的鄰居」建成一張拓樸圖(骨架),再把這張關係圖攤在平面上。實際距離被簡化,但連結結構保住了——這就是它比 t-SNE 更能呈現「整體骨架」的原因。

🧩 二、UMAP 的兩個步驟

1
建高維鄰居圖(Graph Construction):為每個點找最近的 n_neighbors 個鄰居、連起來,形成一張「骨架」拓樸圖。
2
優化低維佈局(Layout Optimization):在 2D 平面上重現這張圖——有連線的點拉近、沒連線的推開,直到佈局穩定。

👀 這頁 demo 的特別之處

下面的 demo 會把鄰居連線(灰色線)真的畫出來,讓你親眼看到那張「骨架圖」。這是 UMAP 和 t-SNE 最大的概念差異:UMAP 是圖(graph)的思維。

🎮 三、動手玩:看「鏈狀骨架」串起或斷裂

這裡有 5 個群,在高維裡其實是一條鏈(群0鄰群1、群1鄰群2…)。拖 n_neighbors:值大,鏈被連線串成一條(保住全局);值小,鏈斷成各自的孤島。拖 min_dist 看群的鬆緊。

決定拓樸結構的連通性。大值保留全域結構,小值強調局部細節。
控制群聚的緊密程度。數值越小,群聚越緊。

🗺️ 怎麼看

灰色線=鄰居連線(骨架)。把 n_neighbors 調到很小(如 2~3),五個群會斷開成孤立的小島;調大,連線把相鄰的群串成一條鏈——這條鏈就是「全局結構」,t-SNE 往往會把它拆散,UMAP 比較能保住。min_dist 調小群更緊實、調大更鬆散。

🎚️ 四、兩個一定要會的參數

參數調小調大
n_neighbors
(看多遠)
只連極近鄰 → 強調局部細節、群易斷裂(像 t-SNE)連到較遠的點 → 串起群與群、保留全局結構
min_dist
(擠多緊)
點擠成緻密團,適合凸顯分群點之間保持距離、較鬆散,看清內部結構

🧠 一句話

n_neighbors 管「局部 vs 全局」、min_dist 管「群的鬆緊」。兩個都要試幾組值,沒有萬用設定。

⚡ 五、為什麼 UMAP 比 t-SNE 快?

關鍵:不用算「全體的正規化分母」

t-SNE 每一步要算一個涵蓋所有點對的正規化分母(讓機率總和為 1),很重。
UMAP 改用 交叉熵(Cross-Entropy)+ 負取樣(Negative Sampling):每次只看「有連線的鄰居」加上「少量隨機抽到的非鄰居」,不必掃全體。這讓 UMAP 能處理百萬級的大資料,速度明顯領先。

⚖️ 六、UMAP vs t-SNE:怎麼選

比較UMAPt-SNE
速度快、對大資料友善較慢
全局結構保留較好較弱(重局部)
當通用降維/特徵可以(也有監督版)不建議
凸顯局部群集很經典、很強
軸 / 群間距離兩者都不可照字面解讀

🧠 一句話

大資料、想保留整體形狀、之後還要拿來用 → UMAP;單純想把局部群集畫得漂亮 → t-SNE 仍是經典。實務上 UMAP 已漸成主流。

⚠️ 七、看 UMAP 圖的注意事項

軸沒有意義X/Y 軸只是排版座標,不是可解讀的維度。
群間距離仍要謹慎比 t-SNE 可信一些,但絕對距離別過度詮釋
參數敏感n_neighbors/min_dist 換了,圖樣可能差很多。
有隨機性不同隨機種子結果可能不同,別執著單次形狀。

🛠️ 八、UMAP 不只能畫圖

📌 比 t-SNE 更通用

除了視覺化,UMAP 還可當通用降維/特徵前處理(降到中等維度餵給下游模型),也有監督式/半監督式版本(利用標籤強化分群)。這點是它比 t-SNE 實用的地方——t-SNE 幾乎只用來畫圖。各方法比較見 降維總覽

🧪 九、觀念自我檢測

先想再點開。

Q1. UMAP 的兩個步驟是什麼?

① 建高維鄰居圖(骨架);② 在低維重現這張圖(有連線拉近、沒連線推開)。

Q2. UMAP 為什麼比 t-SNE 快?

不用算涵蓋所有點對的正規化分母;改用交叉熵+負取樣,只看鄰居加少量隨機非鄰居。

Q3. n_neighbors 調大、調小有什麼差?

=重局部細節、群易斷裂;=串起群與群、保留全局結構。

Q4. min_dist 控制什麼?

點能擠多緊:小=緊密成團(利分群)、大=鬆散(看內部結構)。

Q5. UMAP 和 t-SNE 怎麼選?

UMAP 較快、全局較好、可當通用降維;t-SNE 凸顯局部群集很經典。兩者軸與距離都不可照字面解讀。

✅ 十、30 秒重點整理

UMAP=流形+鄰居圖降維建骨架→攤平。
比 t-SNE 快負取樣,不掃全體點對。
較保留全局能串起群與群的鏈狀結構。
n_neighbors局部↔全局。
min_dist群的鬆↔緊。
軸/距離仍不可照字面解讀。

📝 iPAS 考點提醒

UMAP 是 t-SNE 的熱門替代,iPAS 降維視覺化考點(中級科目三)。重點:同樣做非線性降維視覺化,但比 t-SNE 快、較能保留全局結構、也可當通用降維。易混點:與 t-SNE 一樣,軸無實際意義、群間距離要謹慎解讀;n_neighbors 與 min_dist 參數會大幅影響圖樣。情境:大資料的視覺化與降維,常與 t-SNE 二選一。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

UMAP 是什麼?

一種較新的非線性降維法,基於流形學習與拓撲,常用於高維資料視覺化;速度比 t-SNE 快、通常較能保留全局結構。

UMAP 和 t-SNE 怎麼選?

兩者都做視覺化。UMAP 較快、對大資料友善、全局結構保留較好;t-SNE 在凸顯局部群集上很經典。實務上 UMAP 漸成主流。

主要參數有哪些?

n_neighbors 控制看局部還是全局(小偏局部細節、大偏全局結構);min_dist 控制點可以多緊密,影響群的鬆緊。

UMAP 的距離可以解讀嗎?

局部鄰近結構較可信,但群間距離與大小仍應謹慎,和 t-SNE 一樣不宜過度詮釋絕對距離。

UMAP 只能用來畫圖嗎?

不只,它可當通用降維或特徵前處理,也有監督式與半監督式版本,但最常見用途仍是視覺化。

🧭 相關主題

← 返回 AI 學習與考證地圖