🌌 密度型分群 · iPAS 常考

DBSCAN:靠「密度」分群,還能自動抓出雜訊

K-Means 看「離中心多近」,DBSCAN 則看「點擠不擠」。它把高密度的區域連成一群、把落單的點當成雜訊。好處是:不必先決定群數、能分出環形/月形這種怪形狀、還會自動標出離群點。

密度為基礎核心/邊界/雜訊ε 與 MinPts任意形狀不需定 K自動抓離群

🤔 一、DBSCAN 在做什麼?

一句話:把「擠在一起」的點連成一群,落單的當雜訊

💡 白話定義(密度型分群)

想像一個廣場:人潮密集的地方自然形成一團一團,而在角落落單的零星幾個人,就是「雜訊」。DBSCAN 就是這樣——它不看「中心」,只看每個點周圍夠不夠密集,把密集區一塊塊連起來。

⭐ 三大強項(vs K-Means)

不必先決定 K(群數自己浮現);② 能分出任意形狀的群(環形、月形也行,K-Means 只會切球狀);③ 會自動標出雜訊/離群點,所以也常拿來做異常偵測

🎯 二、三種點:核心、邊界、雜訊(最常考)

DBSCAN 先用兩個參數把每個點分成三類。

核心點 Core在半徑 ε 內,鄰居數 ≥ MinPts(含自己)。它是群聚的「種子」。
邊界點 Border自己鄰居不到 MinPts,但落在某個核心點的 ε 範圍內。是群的邊緣。
雜訊 Noise既不是核心、也不在任何核心點的鄰域內 → 視為離群值(Outlier)
核心點(鄰居 ≥ MinPts) 邊界點(在核心 ε 內、自己鄰居不足) 雜訊(離群)→

🎛️ 三、兩個關鍵參數:ε 與 MinPts

ε(Epsilon,鄰域半徑)「搜尋鄰居的圓圈」要畫多大。ε 太小→大家都變雜訊;太大→所有點併成一坨。
MinPts(最小點數)「要幾個鄰居才算核心點」。越大→越嚴格、雜訊越多;越小→越寬鬆。

📐 怎麼設?

MinPts 經驗上常取約 2 × 維度(2D 資料就用 4 左右)。εk-距離圖估:把每個點到「第 k 近鄰」的距離由小到大排序畫出來,找曲線的手肘轉折那個距離當 ε。兩個參數要一起調。

🎮 四、動手玩:看密度怎麼分群、抓雜訊

切換資料形狀、調 ε 與 MinPts。滑鼠移到任一點上,會畫出它的 ε 搜尋圈並高亮鄰居。

🗺️ 怎麼看(一定要試「同心圓 / 雙月形」)

點依群上色,灰色=雜訊;大點=核心、小點=邊界。切到「同心圓」或「雙月形」——DBSCAN 能漂亮地分開這些怪形狀,而 K-Means 在這裡一定會分錯,這就是 DBSCAN 最大的亮點。再把 ε 調很小,看大家怎麼變成雜訊。
搜尋鄰居的圓圈大小
成為核心點所需的鄰居數量
核心點 (Core)
邊界點 (Border)
雜訊 (Noise)
目前偵測到的群聚數量:0

🆚 五、DBSCAN vs K-Means

比較DBSCANK-Means
依據密度(點擠不擠)到中心的距離
要先定 K?不用
群形狀任意(環形、月形也行)球狀、大小相近
雜訊/離群自動標出(可做異常偵測)沒有雜訊概念、對離群敏感
參數ε、MinPtsK

⚠️ 六、限制與何時不要用

密度差異大時吃力各群密度差很多時,單一組 ε/MinPts 難同時適配 → 改用 HDBSCAN
高維失效維度高時距離鑑別力下降(維度詛咒),分群變難。
兩參數要調ε、MinPts 設不好結果差很多,需用 k-距離圖等方法輔助。

🧪 七、觀念自我檢測

先想再點開。

Q1. DBSCAN 以什麼為基礎分群?

密度。用 ε(鄰域半徑)與 MinPts(成為核心點所需鄰居數)定義稠密區,把相連的稠密區連成一群,密度不足的點標為雜訊。

Q2. 核心點、邊界點、雜訊怎麼分?

核心點:ε 內鄰居 ≥ MinPts;邊界點:鄰居不足,但落在某核心點的 ε 內;雜訊:都不是 → 離群。

Q3. DBSCAN 比 K-Means 強在哪?

不需先定 K、能找任意形狀的群(環形/月形)、會自動標出雜訊與離群;K-Means 要 K、只找球狀、對離群敏感。

Q4. ε 怎麼估?DBSCAN 有什麼限制?

k-距離圖找手肘轉折估 ε(MinPts 約 2×維度)。限制:各群密度差異大時單一參數難適配(用 HDBSCAN)、高維失效。

✅ 八、30 秒重點整理

密度型分群把擠在一起的點連成群,落單的當雜訊。
三種點核心(鄰居≥MinPts)、邊界(在核心ε內)、雜訊(離群)。
兩參數ε(半徑)、MinPts(最小鄰居數),用 k-距離圖估 ε。
三大強項不需定 K、任意形狀、自動抓雜訊。
限制密度差異大吃力(HDBSCAN)、高維失效、要調參。
vs K-Means密度 vs 距離;環形/月形 DBSCAN 才分得開。

📝 iPAS 考點提醒

DBSCAN 是基於密度的分群法,iPAS 中級科目三考點。重點:把高密度區連成群、低密度點視為雜訊,不需先指定群數、能找任意形狀的群並自動偵測離群。易混點:與 K-means 差很多——K-means 需定 k、只找球狀、對離群敏感;DBSCAN 靠 eps(鄰域半徑)與 minPts 兩參數,對密度差異大的資料較吃力(可用 HDBSCAN)。情境:離群偵測、不規則形狀分群。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

DBSCAN 怎麼分群?

以密度為基礎:用 eps(鄰域半徑)與 minPts(成為核心點所需的鄰居數)定義稠密區,把相連的稠密區聚成一群,密度不足的點標為雜訊(離群)。

DBSCAN 比 K-means 好在哪?

不需事先指定群數、能找出任意形狀的群、能自動標出雜訊與離群點;K-means 需給 K 且假設群為球形。

eps 和 minPts 怎麼設?

minPts 經驗上常取約 2 倍維度;eps 可用 k-距離圖(把每點到第 k 近鄰的距離排序,找曲線的手肘轉折)來估,兩者需一起調。

DBSCAN 的限制?

當各群密度差異很大時,單一組 eps/minPts 難以同時適配(可改用 HDBSCAN);高維時距離鑑別力下降也會變難。

哪些點會被當成雜訊?

既不是核心點、也不在任何核心點鄰域內的點;能自然處理離群值是 DBSCAN 的特色。

🧭 相關主題

← 返回 AI 學習與考證地圖