這頁專注在「調參數」——拖動 ε(掃描半徑)和 MinPts(最小點數),即時看群數、雜訊怎麼變。想先搞懂 DBSCAN 的完整原理,可看 DBSCAN 概念頁。
DBSCAN =「基於密度的空間分群」:不必先說有幾群,只看「點密不密」。
把滑鼠移到畫布上會看到當前 ε 的探測圈;點畫布可手動加點。一邊拉滑桿一邊看右下角的「群集數」「雜訊數」。
以每個點為圓心,畫出多大的圓來尋找鄰居。
在半徑 (ε) 內至少要包含幾個點,才能形成一個「核心群集」。
記住下面這張表,調參數就不會瞎猜。邊看表、邊在上面 demo 驗證。
| 調整 | 會發生什麼 |
|---|---|
| ε 調大 ↑ | 探測圈變大 → 更容易找到鄰居 → 群容易合併成一大坨、雜訊變少。 |
| ε 調小 ↓ | 探測圈變小 → 不容易找到鄰居 → 群容易分裂、雜訊變多。 |
| MinPts 調大 ↑ | 成為核心點更嚴格 → 邊緣稍稀疏的點被判為雜訊 → 群更緊湊、雜訊變多。 |
| MinPts 調小 ↓ | 標準變寬鬆 → 更多點達標 → 雜訊變少、群可能變大或變多。 |
先想再點開。
探測圈變大、更容易找到鄰居 → 群容易合併(群數可能變少)、雜訊變少。
成為核心點的標準變嚴 → 邊緣稀疏的點被判為雜訊 → 群更緊湊、雜訊變多。
核心:ε 內鄰居 ≥ MinPts;邊界:自己不足但在某核心的 ε 內;雜訊:都不是。
用 k-距離圖找手肘轉折當 ε(MinPts 約 2×維度),再微調看雜訊比例。
DBSCAN 是基於密度的分群法,iPAS 非監督學習考點(中級科目三)。重點:把高密度區連成群、低密度點視為雜訊,不需先指定群數,能找任意形狀的群。易混點:與 K-means 不同——K-means 需先定 k、只找球狀群、對離群敏感;DBSCAN 靠 eps(鄰域半徑)與 minPts 兩參數,對密度差異大的資料較吃力。情境:離群偵測、任意形狀分群。
想練情境題與詳解 → AI 學習與考證地圖
基於密度的聚類法;把高密度區域連成群、低密度點視為雜訊,不需事先指定群數、能找任意形狀的群。
eps(鄰域半徑)與 minPts(成為核心點所需的最少鄰居數);兩者決定何謂密集,影響分群結果。
能找任意形狀的群、自動偵測離群(雜訊)、不必先定群數;K-means 只適合球狀且需指定 k。
對 eps 與 minPts 敏感、難處理密度差異大的資料、高維時距離失效;此時可考慮 HDBSCAN。
常用 k-距離圖:把每點到第 k 近鄰的距離排序畫出,找曲線手肘轉折處作為 eps,再微調看雜訊比例。