想像一張照片裡有兩隻貓和一隻狗,電腦視覺的四大任務會怎麼處理?
| 任務 | 輸出 | 分個體? | 管背景? | 代表模型 |
|---|---|---|---|---|
| 物件偵測 Object Detection |
邊界框 (Bounding Box) + 類別 + 信心分數 | ✅ 每個框獨立 | ❌ | YOLO、Faster R-CNN、SSD |
| 語義分割 Semantic Segmentation |
每個像素的類別標籤 | ❌ 同類別不分 | ✅ | U-Net、DeepLab、FCN |
| 實例分割 Instance Segmentation |
每個物體的精確遮罩 (Mask) | ✅ 每個體獨立 | ❌ | Mask R-CNN、YOLACT |
| 全景分割 Panoptic Segmentation |
前景實例遮罩 + 背景語義標籤 | ✅ 前景分個體 | ✅ | Panoptic FPN、Mask2Former |
You Only Look Once,一次掃描整張圖就能同時預測所有物體的位置和類別。速度極快,適合即時應用(自動駕駛、監控)。
U 字型結構,左邊 Encoder 壓縮特徵,右邊 Decoder 還原尺寸。關鍵在於 Skip Connection,將淺層特徵直接複製到右邊,讓邊緣更清晰。原本用於醫療影像。
Faster R-CNN 的升級版,除了預測邊界框和類別外,多一個分支預測 Mask (遮罩),精確描繪每個物體的輪廓。
統一架構處理語義、實例、全景三種分割任務。用 Transformer 的注意力機制取代傳統方法,一個模型搞定所有分割需求。
| 指標 | 用途 | 公式概念 |
|---|---|---|
| IoU (Intersection over Union) |
所有分割任務通用 | 預測區域與真實區域的重疊比例 |
| mAP (mean Average Precision) |
物件偵測、實例分割 | 各類別 AP 的平均值,綜合衡量偵測品質 |
| Dice Coefficient | 醫學影像分割常用 | 與 IoU 類似但對小物體更敏感 |
| PQ (Panoptic Quality) |
全景分割專用 | PQ = SQ × RQ(分割品質 × 辨識品質) |
影像分割對影像逐像素標註,是 iPAS 中級科目一考點。重點:語意分割(同類歸一)、實例分割(分個體)、全景分割(兩者合),評估用 IoU、Dice 與各類平均 mIoU。易混點:分割不是物件偵測——偵測畫框、分割描輪廓;與分類(整張一個標籤)更不同。情境:U-Net(醫療)、DeepLab(空洞卷積)、Mask R-CNN(實例)、SAM(通用)。
想練情境題與詳解 → AI 學習與考證地圖
對影像逐像素分類,標出每個像素屬於哪個物件或區域;比偵測的方框更精細,能描出物件輪廓。
語意分割只分類別(所有人都同一類);實例分割還要區分同類的不同個體(人1、人2分開);全景分割結合兩者。
編碼器-解碼器結構(U-Net、FCN、DeepLab);編碼器抽特徵、解碼器還原到像素級,常用跳接保留細節。
用 IoU(Jaccard)與 Dice 係數衡量預測區域與真實區域的重疊;對不平衡的小區域 Dice 較敏感。
醫療影像(腫瘤、器官)、自駕(道路、行人)、衛星影像、影像去背與編輯等需要像素級精度的場景。