💡一句話定義
影像分割(Image Segmentation)= 對影像做逐像素分類,標出每個像素屬於哪個物件或區域——比物件偵測的方框更精細,能描出輪廓。差別在於「要不要區分同類的不同個體」與「要不要管背景」。
🐱用「兩貓一狗」來想
🖼️一圖看懂四種任務
同一張街景,在物件偵測 / 語意分割 / 實例分割 / 全景分割下的呈現差異。
📊三種分割對照表
| 任務 | 分同類個體? | 管背景? | 代表模型 |
|---|---|---|---|
| 語意分割 | ❌ 同類同色 | ✅ | U-Net、FCN、DeepLab |
| 實例分割 | ✅ 每個體獨立遮罩 | ❌ | Mask R-CNN、YOLACT |
| 全景分割 | ✅ 前景分個體 | ✅ 背景做語意 | Panoptic FPN、Mask2Former |
一句話:語意「只分類別」、實例「還分個體」、全景「個體+背景全包」。
🔲分割 vs 偵測,怎麼評估?
偵測畫框、分割描輪廓——分割比邊界框精細很多。評估上,分割用 IoU(預測與真實區域的重疊比)與 Dice 係數,以及各類平均的 mIoU;不是用整張圖的準確率。醫療等小目標、類別不平衡的場景,常偏好對小區域更敏感的 Dice。
✅自我檢測
Q1. 語意分割和實例分割差在哪?
語意分割只分類別,同類(如所有人)都標成同一類、不分個體;實例分割還要區分同類的不同個體(人1、人2 分開),每個體有自己的遮罩。
Q2. 全景分割是什麼?
結合語意與實例分割:對可數的前景物件做實例區分,對背景區域(天空、道路)做語意標註,讓每個像素都有歸屬,給出完整場景理解。
Q3. 分割和物件偵測的差別?
偵測輸出的是「方框+類別」,只框大概位置;分割是逐像素分類,能精確描出物件輪廓,比方框精細許多。
Q4. 分割用什麼指標評估?
用 IoU(Jaccard)與 Dice 係數衡量預測區域與真實區域的重疊,以及各類平均的 mIoU;醫療等不平衡場景常偏好 Dice。
🎯重點整理
- 分割:逐像素分類,描輪廓,比偵測方框精細。
- 語意:只分類別,同類同色,管背景。
- 實例:分同類個體,各自遮罩,不管背景。
- 全景:前景分個體+背景做語意,全包。
- 評估:IoU、Dice、mIoU(不是準確率)。