🔵 分群 Clustering
把相似的樣本聚成一組,例如顧客分群、影像分割、異常偵測。
非監督式學習餵給模型的資料完全沒有答案(標籤),演算法得自己從資料裡找出隱藏的結構。兩大分支:把資料分群,或把資料降維。
下面的點一開始全是灰色(沒有標籤)。按「開始分群」,演算法會反覆做兩件事:① 每個點歸到最近的群中心;② 群中心移到該群的平均位置——直到穩定。
iPAS 常考:分群是「把樣本分組」,降維是「把特徵變少」。兩者都不需要標籤。
把相似的樣本聚成一組,例如顧客分群、影像分割、異常偵測。
把高維特徵壓縮到少數維度,用於視覺化、去雜訊、加速運算。
當資料沒有現成答案時,非監督式學習就像偵探,從相似度、距離與密度中找出可用線索。
「加入少量標籤就變成監督式」是錯的——那是半監督式。非監督式的評估也沒有單一標準答案,分群用輪廓係數、降維看結構保留度。
非監督式學習不靠標準答案,而是從資料本身的形狀與關係中整理出結構。
分群:把相似的樣本放在一起,回答「誰和誰比較像?」
降維:用更少的特徵保留重要結構,讓資料更容易看懂與運算。