🏝️ 階層密度分群 · iPAS 進階考點

HDBSCAN:會自己調節密度的進階版 DBSCAN

DBSCAN 用單一一個 eps,碰到「有的群很密、有的群很鬆」就分不好。HDBSCAN 把 DBSCAN「階層化」——在各種密度層級都建群,再自動挑出最「穩定」的那些群。你幾乎不用調 eps,還能自動辨識雜訊。

DBSCAN 的升級版變動密度核心距離最小生成樹 MST群穩定度min_cluster_size

🤔 一、它解決了 DBSCAN 的什麼痛點?

先回顧 DBSCAN 的弱點,再看 HDBSCAN 怎麼補。

😣 DBSCAN 的痛點:只有「一個」eps

DBSCAN 用一個固定的 eps(鄰域半徑)判斷密度。但真實資料常常有的群很密、有的群很鬆——同一個 eps 不可能同時適配:eps 設大,鬆的群勉強連起來、密的群卻黏成一坨;eps 設小,密的群分對了、鬆的群卻全變雜訊。而且 eps 還很難調

💡 HDBSCAN 的解法:在「所有密度層級」都看一遍

HDBSCAN = Hierarchical(階層)+ DBSCAN。它不挑一個 eps,而是把 eps 從小到大全部掃一遍,建出一棵「密度階層樹」,再自動挑出「最穩定」的那些群。
想像水位慢慢下降:原本淹在水裡的點一個個浮出來、連成島嶼;有些島嶼很快又被淹沒(不穩定),有些島嶼維持很久(穩定)——HDBSCAN 就挑那些撐最久的穩定島嶼當作群。

🧐 二、三個核心概念

🧍
① 核心距離(Core Distance)=個人空間
先把「周圍沒朋友(太稀疏)」的點推遠:低密度點與別人的距離在計算時被放大,讓它更難被併進群——這能有效過濾雜訊
🛣️
② 最小生成樹(MST)=最省的鋪路
在所有點之間「鋪最短的路」連起來,就是 MST。HDBSCAN 用它把資料從「一盤散點」變成「一棵階層樹」(demo 裡拉滑桿看到的線就是這個過程)。
③ 群穩定度(Stability)=持久度
HDBSCAN 最聰明之處:看一個群「隨著密度門檻放寬,存活了多久」。撐很久、不分裂也不消失的群=穩定的好群,就被選為最終結果。這取代了 DBSCAN「猜一個 eps」的步驟。

🎮 三、動手玩:水位下降,島嶼浮現

拉「連接距離」模擬密度門檻(MST 連線),拉「最小群人數」決定多大才算一個群。

🗺️ 怎麼看

連接距離越大→越多點被連起來(線變多);連在一起、且人數≥ 最小群人數的團體才算「有效群組」(上色),其餘是灰色雜訊。慢慢拉滑桿,感受「不同距離門檻下,群怎麼出現、合併、又被雜訊吃掉」——這就是 HDBSCAN 在各密度層級觀察的過程。

模擬建立「最小生成樹 (MST)」:距離小於此值的點會被連起來。

只有連結人數超過此設定的團體,才算「有效群組」,否則視為雜訊。

目前狀態:發現 0 個群組,其餘為雜訊

🎛️ 四、主要參數與輸出

min_cluster_size(最重要)「多少個點才算一個群」。比 DBSCAN 的 eps 直覺得多——你只要說「群至少要幾人」。
min_samples(可選)控制對雜訊的保守程度;越大、越多點被當雜訊。
自動決定群數不必給 K、也不必給 eps,群數由「穩定度」自動浮現。
提供成員歸屬機率每個點屬於某群的「信心分數」(soft),邊緣模糊的點看得出來。

🆚 五、HDBSCAN vs DBSCAN

比較DBSCANHDBSCAN
密度單一 eps,密度不均就吃力掃過各密度層級,能處理變動密度
主要參數eps + MinPts(eps 難調)min_cluster_size(更直覺)
怎麼定群固定 eps 切一刀看群的穩定度自動萃取
成員機率(soft clustering)
代價較輕、較快計算較重、概念較複雜

🧠 一句話

HDBSCAN = 把 DBSCAN 在「所有 eps」都跑一遍,再用穩定度自動挑最好的群。少了調 eps 的痛苦、又能處理密度不均,代價是更吃計算、概念更深。

🎯 六、什麼時候用 HDBSCAN?

✅ 最適場景

各群密度差異大、形狀不規則、又不想費心調 eps 的真實複雜資料——HDBSCAN 通常比 DBSCAN 更穩健,還能自動辨識雜訊、給出群數。代價是計算較重、概念較複雜;資料簡單時用 DBSCAN 就夠了。

🧪 七、觀念自我檢測

先想再點開。

Q1. HDBSCAN 和 DBSCAN 最大的差別?

DBSCAN 用單一 eps,密度不均就分不好;HDBSCAN 把它階層化,掃過各密度層級、用穩定度自動萃取最好的群,幾乎不用調 eps。

Q2. HDBSCAN 主要調什麼參數?

min_cluster_size(最小群大小)——「群至少要幾個點」。比 DBSCAN 的 eps 直覺;群數與雜訊都自動決定。

Q3. 什麼是群的「穩定度」?

一個群在密度階層(水位變化)中存活多久。撐越久、不分裂也不消失=越穩定,HDBSCAN 就挑最穩定的當最終結果。

Q4. 什麼時候選 HDBSCAN?代價是什麼?

密度差異大、形狀不規則、不想調 eps 時。它自動找穩定群、辨識雜訊、還給成員機率;代價是計算較重、概念較複雜

✅ 八、30 秒重點整理

DBSCAN 的階層版掃過各密度層級,解決「單一 eps」的痛點。
三概念核心距離(濾雜訊)、MST(建階層樹)、穩定度(挑群)。
看穩定度挑群撐最久的群=好群,取代猜 eps。
主要參數 min_cluster_size比 eps 直覺;群數自動、給成員機率。
處理變動密度密度不均、形狀不規則時比 DBSCAN 穩健。
代價計算較重、概念較複雜,簡單資料用 DBSCAN 即可。

📝 iPAS 考點提醒

HDBSCAN 是 DBSCAN 的階層版,iPAS 分群進階考點(中級科目三)。重點:在不同密度層級建群、自動萃取最穩定的群,能處理密度不均、不必硬指定單一 eps,並提供成員歸屬機率。易混點:相對 DBSCAN 的 eps,HDBSCAN 主要調 min_cluster_size(最小群大小)更直覺;代價是計算較重。情境:密度差異大、形狀不規則、不想調 eps 的真實資料。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

HDBSCAN 和 DBSCAN 差在哪?

HDBSCAN 是 DBSCAN 的階層版;它在不同密度層級建群,能處理密度不均、且不必硬指定單一 eps。

HDBSCAN 的主要參數?

最重要是 min_cluster_size(最小群大小);相對 DBSCAN 的 eps 更直覺,演算法會自動從階層中萃取穩定的群。

HDBSCAN 的優點?

處理變動密度、自動找群數、辨識雜訊、提供成員歸屬機率;對真實複雜資料常比 DBSCAN 穩健。

什麼是群的穩定度?

HDBSCAN 用群在密度階層中存活的長短衡量穩定度,挑出最穩定的群作為最終結果。

何時選 HDBSCAN?

群密度差異大、形狀不規則、不想費心調 eps 時;它自動找穩定群、辨識雜訊,代價是計算較重、概念較複雜。

🧭 相關主題

← 返回 AI 學習與考證地圖