📦 物件偵測 Object Detection
重疊時方框也會互相蓋住。
輸出:五個框與分數;能計數與定位,但框內包含背景,輪廓不精確。
🐾 MOCHI 分割觀察站
同一張「五隻 Mochi 大合照」,切換五種視角,親眼看懂框選、同類上色、個體分開,以及連背景都不能漏掉的差異。
#1
#2
#3
#4
#5
角色位置完全不變;只看模型輸出的框、同類色塊、實例色塊與背景分類如何不同。
重疊時方框也會互相蓋住。
輸出:五個框與分數;能計數與定位,但框內包含背景,輪廓不精確。
同類同色,重疊後合成一大片。
輸出:只知道紫色像素都是 Mochi;重疊後無法看出共有幾個個體。
同類不同色,重疊仍能分開。
輸出:五種實色 mask 與五個 ID;即使輪廓交疊,仍可分辨五隻 Mochi。
前景分個體,背景也全部分類。
輸出:五個 Mochi 實例,加上天空、建築、窗戶、植栽、道路與地面;每個像素都有答案。
*切換模式後,左側操作台不會離開視線;移到任一色塊可查看類別或實例 ID。
想像一張照片裡有兩隻貓和一隻狗,電腦視覺的四大任務會怎麼處理?
| 任務 | 輸出 | 分個體? | 管背景? | 代表模型 |
|---|---|---|---|---|
| 物件偵測 Object Detection |
邊界框 (Bounding Box) + 類別 + 信心分數 | ✅ 每個框獨立 | ❌ | YOLO、Faster R-CNN、SSD |
| 語義分割 Semantic Segmentation |
每個像素的類別標籤 | ❌ 同類別不分 | ✅ | U-Net、DeepLab、FCN |
| 實例分割 Instance Segmentation |
每個物體的精確遮罩 (Mask) | ✅ 每個體獨立 | ❌ | Mask R-CNN、YOLACT |
| 全景分割 Panoptic Segmentation |
前景實例遮罩 + 背景語義標籤 | ✅ 前景分個體 | ✅ | Panoptic FPN、Mask2Former |
You Only Look Once,一次掃描整張圖就能同時預測所有物體的位置和類別。速度極快,適合即時應用(自動駕駛、監控)。
U 字型結構,左邊 Encoder 壓縮特徵,右邊 Decoder 還原尺寸。關鍵在於 Skip Connection,將淺層特徵直接複製到右邊,讓邊緣更清晰。原本用於醫療影像。
Faster R-CNN 的升級版,除了預測邊界框和類別外,多一個分支預測 Mask (遮罩),精確描繪每個物體的輪廓。
統一架構處理語義、實例、全景三種分割任務。用 Transformer 的注意力機制取代傳統方法,一個模型搞定所有分割需求。
| 指標 | 用途 | 公式概念 |
|---|---|---|
| IoU (Intersection over Union) |
所有分割任務通用 | 預測區域與真實區域的重疊比例 |
| mAP (mean Average Precision) |
物件偵測、實例分割 | 各類別 AP 的平均值,綜合衡量偵測品質 |
| Dice Coefficient | 醫學影像分割常用 | 與 IoU 類似但對小物體更敏感 |
| PQ (Panoptic Quality) |
全景分割專用 | PQ = SQ × RQ(分割品質 × 辨識品質) |
影像分割對影像逐像素標註,是 iPAS 中級科目一考點。重點:語意分割(同類歸一)、實例分割(分個體)、全景分割(兩者合),評估用 IoU、Dice 與各類平均 mIoU。易混點:分割不是物件偵測——偵測畫框、分割描輪廓;與分類(整張一個標籤)更不同。情境:U-Net(醫療)、DeepLab(空洞卷積)、Mask R-CNN(實例)、SAM(通用)。
想練情境題與詳解 → AI 學習與考證地圖
對影像逐像素分類,標出每個像素屬於哪個物件或區域;比偵測的方框更精細,能描出物件輪廓。
語意分割只分類別(所有人都同一類);實例分割還要區分同類的不同個體(人1、人2分開);全景分割結合兩者。
編碼器-解碼器結構(U-Net、FCN、DeepLab);編碼器抽特徵、解碼器還原到像素級,常用跳接保留細節。
用 IoU(Jaccard)與 Dice 係數衡量預測區域與真實區域的重疊;對不平衡的小區域 Dice 較敏感。
醫療影像(腫瘤、器官)、自駕(道路、行人)、衛星影像、影像去背與編輯等需要像素級精度的場景。