🧪 DBSCAN 參數實驗室 · iPAS 常考

DBSCAN 參數實驗室:ε 和 MinPts 怎麼改變分群?

這頁專注在「調參數」——拖動 ε(掃描半徑)和 MinPts(最小點數),即時看群數、雜訊怎麼變。想先搞懂 DBSCAN 的完整原理,可看 DBSCAN 概念頁

ε 掃描半徑MinPts 最小點數核心/邊界/雜訊參數效應k-距離圖

⚡ 一、30 秒快速回顧

DBSCAN =「基於密度的空間分群」:不必先說有幾群,只看「點密不密」。

三種點(這頁 demo 的顏色)

核心點 Core:在 ε 半徑內鄰居 ≥ MinPts(含自己)。
邊界點 Border:自己鄰居不足,但落在某核心點的 ε 範圍內(demo 用半透明)。
雜訊 Noise:都不是 → 孤獨的離群值(demo 用灰色)。

🎛️ 二、要調的就這兩個參數

ε(Epsilon,掃描半徑)以每個點為圓心,畫多大的圓找鄰居。圓越大→越容易找到鄰居。
MinPts(最小點數)圓內至少要幾個點,才算「核心點」、足以撐起一個群。

🎮 三、動手玩:拉滑桿,看群數與雜訊即時變

滑鼠移到畫布上會看到當前 ε 的探測圈;點畫布可手動加點。一邊拉滑桿一邊看右下角的「群集數」「雜訊數」。

以每個點為圓心,畫出多大的圓來尋找鄰居。

在半徑 (ε) 內至少要包含幾個點,才能形成一個「核心群集」。

即時運算結果:
發現群集數量:0
雜訊點 (Noise):0
💡 滑鼠移到畫布看 ε 探測圈;點擊畫布可手動新增資料點。
核心 Core
邊界 Border
雜訊 Noise

📊 四、參數效應:這頁的重點

記住下面這張表,調參數就不會瞎猜。邊看表、邊在上面 demo 驗證。

調整會發生什麼
ε 調大 ↑探測圈變大 → 更容易找到鄰居 → 群容易合併成一大坨、雜訊變少
ε 調小 ↓探測圈變小 → 不容易找到鄰居 → 群容易分裂、雜訊變多
MinPts 調大 ↑成為核心點更嚴格 → 邊緣稍稀疏的點被判為雜訊 → 群更緊湊、雜訊變多
MinPts 調小 ↓標準變寬鬆 → 更多點達標 → 雜訊變少、群可能變大或變多

🧠 一句話

ε 管「圈多大」、MinPts 管「要多少人」。兩個都「放寬」(ε 大、MinPts 小) → 雜訊少、群大;兩個都「收緊」 → 雜訊多、群碎。實務上常一起調、互相搭配。

📐 五、ε 到底要設多少?k-距離圖

💪 k-距離圖(最常用的估法)

每個點到「第 k 近鄰」的距離由小到大排序、畫成曲線。大多數點的距離都差不多(曲線平緩),但到了某處會急速上揚(那些是雜訊/邊緣點)——那個手肘轉折的距離,就是不錯的 ε 起點,再用上面 demo 微調看雜訊比例。MinPts 經驗上常取約 2 × 維度(2D 用 4 左右)。

⚠️ 六、弱點與替代方案

對參數敏感ε、MinPts 設不好,結果差很多——這也是這頁讓你練手感的原因。
密度差異大就吃力有的群密、有的群鬆時,單一 ε 難兩全 → 改用 HDBSCAN
高維失效維度高時距離鑑別力下降(維度詛咒),分群變難。

🧪 七、觀念自我檢測

先想再點開。

Q1. ε 調大,群數和雜訊會怎麼變?

探測圈變大、更容易找到鄰居 → 群容易合併(群數可能變少)、雜訊變少

Q2. MinPts 調大,會怎麼樣?

成為核心點的標準變嚴 → 邊緣稀疏的點被判為雜訊 → 群更緊湊、雜訊變多

Q3. 三種點怎麼分?

核心:ε 內鄰居 ≥ MinPts;邊界:自己不足但在某核心的 ε 內;雜訊:都不是。

Q4. ε 怎麼估?

k-距離圖找手肘轉折當 ε(MinPts 約 2×維度),再微調看雜訊比例。

✅ 八、30 秒重點整理

兩參數:ε 與 MinPtsε 管圈多大、MinPts 管要幾個鄰居。
ε 大 → 群合併、雜訊少ε 小 → 群分裂、雜訊多。
MinPts 大 → 雜訊多、群緊湊MinPts 小 → 雜訊少。
三種點核心、邊界、雜訊。
ε 用 k-距離圖估找手肘轉折,再微調。
密度差異大 → HDBSCAN對參數敏感、高維失效。

📝 iPAS 考點提醒

DBSCAN 是基於密度的分群法,iPAS 非監督學習考點(中級科目三)。重點:把高密度區連成群、低密度點視為雜訊,不需先指定群數,能找任意形狀的群。易混點:與 K-means 不同——K-means 需先定 k、只找球狀群、對離群敏感;DBSCAN 靠 eps(鄰域半徑)與 minPts 兩參數,對密度差異大的資料較吃力。情境:離群偵測、任意形狀分群。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

DBSCAN 是什麼?

基於密度的聚類法;把高密度區域連成群、低密度點視為雜訊,不需事先指定群數、能找任意形狀的群。

兩個關鍵參數是什麼?

eps(鄰域半徑)與 minPts(成為核心點所需的最少鄰居數);兩者決定何謂密集,影響分群結果。

DBSCAN 比 K-means 好在哪?

能找任意形狀的群、自動偵測離群(雜訊)、不必先定群數;K-means 只適合球狀且需指定 k。

DBSCAN 的弱點?

對 eps 與 minPts 敏感、難處理密度差異大的資料、高維時距離失效;此時可考慮 HDBSCAN。

怎麼挑 eps?

常用 k-距離圖:把每點到第 k 近鄰的距離排序畫出,找曲線手肘轉折處作為 eps,再微調看雜訊比例。

🧭 相關主題

← 返回 AI 學習與考證地圖