Clustering · 非監督式學習

分群 Clustering

把沒有標籤的資料,依相似度自動分堆

沒有標準答案的世界裡,分群讓資料「物以類聚」。
最經典的 K-Means:選定群數,反覆「指派 → 移動中心」直到穩定。

argmin Σ Σ ‖x − μ_k‖² (最小化群內距離)
01 — 白話直覺

沒有標準答案,自己把資料分堆

分群是非監督式學習:沒有人事先告訴你「這是 A 類、那是 B 類」,演算法要自己從資料的相似度把它們分成幾群。像把一堆沒貼標籤的客戶,依消費行為自動分成「小資族 / 高消費 / 偶爾來」。

K-Means
中心點分群

先決定要分幾群(K),反覆把點分給最近的中心,再更新中心。

DBSCAN
密度分群

看資料密不密集,能找出任意形狀的群、自動標出雜訊。

階層式
樹狀合併

從每個點各自一群,一層層合併,畫成樹狀圖再切。

02 — 核心互動

親手跑一次 K-Means

選擇要分幾群 K,按「下一步」一格一格看演算法怎麼運作:① 把每個點指派給最近的中心 → ② 把中心移到該群的平均位置,反覆直到不再變動。

3
目前步驟
指派
疊代次數
0
群內誤差 SSE

觀察十字星(中心)怎麼一步步「滑」到每群的中央。SSE(群內平方和)會越來越小,最後收斂不動。

03 — 評估與選擇

怎麼選 K、怎麼評估分得好不好?

常用:手肘法 (Elbow) 找 SSE 下降變平緩的轉折點當 K;輪廓係數 (Silhouette) 衡量點「離自己這群近、離別群遠」的程度,越接近 1 越好。

優點

  • 不需要標註資料,省去大量人工
  • 能快速發現資料的自然結構
  • K-Means 計算快、易於擴展到大資料

缺點 / 限制

  • K-Means 要先指定群數 K
  • 對初始中心與離群值敏感
  • 只擅長找「球狀」群,奇形怪狀要靠 DBSCAN

典型應用場景

👥
客戶分群
依行為自動分眾、差異化行銷
🖼️
影像壓縮
顏色量化、把相近色歸成一群
🚨
異常偵測
離群點=可能的詐欺或故障

📝 iPAS 考點提醒

分群(聚類)是非監督學習,把相似資料自動分組,iPAS 必考(初級科目一、中級科目三)。重點:沒有標籤,靠距離或密度找結構;常見 K-means(球狀、需定 k)、階層式(樹狀圖)、DBSCAN(密度、找任意形狀與雜訊)。易混點:分群是非監督(與分類的監督不同),評估不用準確率、改用輪廓係數等內部指標;群的編號是任意的。情境:客戶分群、異常偵測、市場區隔。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

分群(Clustering)是什麼?

非監督式學習的一種,把沒有標籤的資料依相似度自動分成若干組,使同組相似、不同組相異,常用於顧客分群、異常偵測。

分群和分類差在哪?

分類是監督式、有預先定義的類別標籤要學;分群是非監督式、沒有標籤,群是演算法自己發現的。

常見的分群方法有哪些?

K-means(指定 K、球形)、階層式(可切樹狀圖)、DBSCAN(依密度、找任意形狀並標雜訊)、GMM(機率軟分群),依資料形狀與需求選擇。

沒有標籤怎麼評估分群好壞?

用內部指標如輪廓係數(Silhouette)、組內平方和(SSE)、DBCV;若剛好有真實標籤,可用 ARI、NMI 等外部指標。

分群前要注意什麼?

通常要先標準化(多數方法靠距離)、處理離群值、決定群數(手肘法或輪廓係數),並留意維度詛咒對距離的影響。

🧭 相關主題

← 返回 AI 學習與考證地圖