深度學習 · 電腦視覺

影像分割方式比較

同一張圖,四種看法:偵測畫框、語意同色、實例分個體、全景連背景都標——一圖看懂它們的差別。

語意分割實例分割全景分割逐像素IoU · Dice

💡一句話定義

影像分割(Image Segmentation)= 對影像做逐像素分類,標出每個像素屬於哪個物件或區域——比物件偵測的方框更精細,能描出輪廓。差別在於「要不要區分同類的不同個體」與「要不要管背景」。

🐱用「兩貓一狗」來想

一張有兩隻貓、一隻狗的照片:物件偵測畫三個框標「貓、貓、狗」(只管位置類別);語意分割把兩隻貓都塗同一種顏色(同類不分個體);實例分割貓A、貓B、狗各一色(分個體、但不管背景);全景分割前景分個體、背景(天空、草地)也各塗一色(每個像素都有歸屬)。

🖼️一圖看懂四種任務

電腦視覺分割方式比較圖:物件偵測、語意分割、實例分割、全景分割

同一張街景,在物件偵測 / 語意分割 / 實例分割 / 全景分割下的呈現差異。

📊三種分割對照表

任務分同類個體?管背景?代表模型
語意分割❌ 同類同色U-Net、FCN、DeepLab
實例分割✅ 每個體獨立遮罩Mask R-CNN、YOLACT
全景分割✅ 前景分個體✅ 背景做語意Panoptic FPN、Mask2Former
一句話:語意「只分類別」、實例「還分個體」、全景「個體+背景全包」。

🔲分割 vs 偵測,怎麼評估?

偵測畫框、分割描輪廓——分割比邊界框精細很多。評估上,分割用 IoU(預測與真實區域的重疊比)與 Dice 係數,以及各類平均的 mIoU不是用整張圖的準確率。醫療等小目標、類別不平衡的場景,常偏好對小區域更敏感的 Dice

自我檢測

Q1. 語意分割和實例分割差在哪?
語意分割只分類別,同類(如所有人)都標成同一類、不分個體;實例分割還要區分同類的不同個體(人1、人2 分開),每個體有自己的遮罩。
Q2. 全景分割是什麼?
結合語意與實例分割:對可數的前景物件做實例區分,對背景區域(天空、道路)做語意標註,讓每個像素都有歸屬,給出完整場景理解。
Q3. 分割和物件偵測的差別?
偵測輸出的是「方框+類別」,只框大概位置;分割是逐像素分類,能精確描出物件輪廓,比方框精細許多。
Q4. 分割用什麼指標評估?
用 IoU(Jaccard)與 Dice 係數衡量預測區域與真實區域的重疊,以及各類平均的 mIoU;醫療等不平衡場景常偏好 Dice。

🎯重點整理

📝 iPAS 考點提醒

影像分割是逐像素分類,iPAS 中級科目一考點。重點:語意分割把同類像素歸一類(所有人都標成人)、實例分割再區分個體(人1、人2)、全景分割兩者結合。易混點:分割比邊界框更精細,評估用 IoU 與 Dice 而非準確率;醫療等小目標、不平衡場景常偏好 Dice。情境:常見模型 U-Net、DeepLab、Mask R-CNN,近年有 SAM 通用分割。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

影像分割是什麼?

對影像逐像素分類,標出每個像素屬於哪個物件或區域;比邊界框更精細地描繪物件輪廓。

語意分割和實例分割差在哪?

語意分割同類像素歸為一類(所有人都標成人);實例分割再區分個體(人1、人2),能分開同類的不同物件。

什麼是全景分割?

結合語意與實例分割:對可數物件做實例區分、對背景區域(天空、道路)做語意標註,給出完整場景理解。

分割怎麼評估?

常用 IoU 與 Dice(逐像素重疊),以及各類平均的 mIoU;醫療等不平衡場景常偏好 Dice。

常見的分割模型?

U-Net(醫療常用)、FCN、DeepLab(空洞卷積)、Mask R-CNN(實例分割);近年也有 Transformer 系與 SAM 等通用分割模型。

🧭 相關主題

← 返回 AI 學習與考證地圖