沒有標準答案的世界裡,分群讓資料「物以類聚」。
最經典的 K-Means:選定群數,反覆「指派 → 移動中心」直到穩定。
分群是非監督式學習:沒有人事先告訴你「這是 A 類、那是 B 類」,演算法要自己從資料的相似度把它們分成幾群。像把一堆沒貼標籤的客戶,依消費行為自動分成「小資族 / 高消費 / 偶爾來」。
先決定要分幾群(K),反覆把點分給最近的中心,再更新中心。
看資料密不密集,能找出任意形狀的群、自動標出雜訊。
從每個點各自一群,一層層合併,畫成樹狀圖再切。
選擇要分幾群 K,按「下一步」一格一格看演算法怎麼運作:① 把每個點指派給最近的中心 → ② 把中心移到該群的平均位置,反覆直到不再變動。
觀察十字星(中心)怎麼一步步「滑」到每群的中央。SSE(群內平方和)會越來越小,最後收斂不動。
常用:手肘法 (Elbow) 找 SSE 下降變平緩的轉折點當 K;輪廓係數 (Silhouette) 衡量點「離自己這群近、離別群遠」的程度,越接近 1 越好。
分群(聚類)是非監督學習,把相似資料自動分組,iPAS 必考(初級科目一、中級科目三)。重點:沒有標籤,靠距離或密度找結構;常見 K-means(球狀、需定 k)、階層式(樹狀圖)、DBSCAN(密度、找任意形狀與雜訊)。易混點:分群是非監督(與分類的監督不同),評估不用準確率、改用輪廓係數等內部指標;群的編號是任意的。情境:客戶分群、異常偵測、市場區隔。
想練情境題與詳解 → AI 學習與考證地圖
非監督式學習的一種,把沒有標籤的資料依相似度自動分成若干組,使同組相似、不同組相異,常用於顧客分群、異常偵測。
分類是監督式、有預先定義的類別標籤要學;分群是非監督式、沒有標籤,群是演算法自己發現的。
K-means(指定 K、球形)、階層式(可切樹狀圖)、DBSCAN(依密度、找任意形狀並標雜訊)、GMM(機率軟分群),依資料形狀與需求選擇。
用內部指標如輪廓係數(Silhouette)、組內平方和(SSE)、DBCV;若剛好有真實標籤,可用 ARI、NMI 等外部指標。
通常要先標準化(多數方法靠距離)、處理離群值、決定群數(手肘法或輪廓係數),並留意維度詛咒對距離的影響。