🗺️ AI 學習與考證地圖

🐾 MOCHI 分割觀察站

🖼️ 影像分割 (Image Segmentation) 互動演示

同一張「五隻 Mochi 大合照」,切換五種視角,親眼看懂框選、同類上色、個體分開,以及連背景都不能漏掉的差異。

Mochi 貓老師用彩色像素遮罩介紹影像分割
貓老師提醒:分割真正處理的是「每一個像素」。
天空建築 窗戶植栽 道路地面
揮手的 Mochi #1
抱著書本的 Mochi #2
玩小球的 Mochi #3
拿著放大鏡的 Mochi #4
拿著教鞭的 Mochi #5

同一個重疊場景,四種答案

角色位置完全不變;只看模型輸出的框、同類色塊、實例色塊與背景分類如何不同。

📦 物件偵測 Object Detection

重疊時方框也會互相蓋住。

輸出:五個框與分數;能計數與定位,但框內包含背景,輪廓不精確。

🎨 語義分割 Semantic Segmentation

同類同色,重疊後合成一大片。

輸出:只知道紫色像素都是 Mochi;重疊後無法看出共有幾個個體。

🏷️ 實例分割 Instance Segmentation

同類不同色,重疊仍能分開。

輸出:五種實色 mask 與五個 ID;即使輪廓交疊,仍可分辨五隻 Mochi。

🌐 全景分割 Panoptic Segmentation

前景分個體,背景也全部分類。

輸出:五個 Mochi 實例,加上天空、建築、窗戶、植栽、道路與地面;每個像素都有答案。

*切換模式後,左側操作台不會離開視線;移到任一色塊可查看類別或實例 ID。

原理說明

1. 用一張圖秒懂四大任務

Mochi 貓老師比較物件偵測、語意分割、實例分割與全景分割
同一個場景,任務不同,模型交出的答案也不同。

想像一張照片裡有兩隻貓和一隻狗,電腦視覺的四大任務會怎麼處理?

📦 物件偵測:畫三個框框,標上「貓」「貓」「狗」→ 只管位置和類別
🎨 語義分割:所有貓的像素塗紅色、狗塗藍色、背景塗灰色 → 分不出兩隻貓誰是誰
🏷️ 實例分割:貓A 紅色、貓B 橘色、狗 藍色 → 每個個體有自己的遮罩
🌐 全景分割:前景用實例分割 + 背景也塗色(天空、草地各一色)→ 每個像素都有歸屬

2. 四大任務完整比較

任務 輸出 分個體? 管背景? 代表模型
物件偵測
Object Detection
邊界框 (Bounding Box) + 類別 + 信心分數 ✅ 每個框獨立 YOLO、Faster R-CNN、SSD
語義分割
Semantic Segmentation
每個像素的類別標籤 ❌ 同類別不分 U-Net、DeepLab、FCN
實例分割
Instance Segmentation
每個物體的精確遮罩 (Mask) ✅ 每個體獨立 Mask R-CNN、YOLACT
全景分割
Panoptic Segmentation
前景實例遮罩 + 背景語義標籤 ✅ 前景分個體 Panoptic FPN、Mask2Former

3. 常用模型架構

Mochi 貓老師指向分割模型的編碼器解碼器流程
Encoder 抓重點,Decoder 把位置與邊界還原回來。

4. 評估指標

Mochi 貓老師用重疊遮罩說明 IoU、Dice、mAP 與 PQ
遮罩重疊得越完整,IoU 與 Dice 通常越高。
指標用途公式概念
IoU
(Intersection over Union)
所有分割任務通用 預測區域與真實區域的重疊比例
mAP
(mean Average Precision)
物件偵測、實例分割 各類別 AP 的平均值,綜合衡量偵測品質
Dice Coefficient 醫學影像分割常用 與 IoU 類似但對小物體更敏感
PQ
(Panoptic Quality)
全景分割專用 PQ = SQ × RQ(分割品質 × 辨識品質)
$ IoU = \frac{\text{Area}(A \cap B)}{\text{Area}(A \cup B)} \qquad Dice = \frac{2 \times |A \cap B|}{|A| + |B|} $

5. 應用場景

Mochi 貓老師展示自動駕駛、醫療影像、視訊與機器人分割應用
從道路到醫療影像,只要需要像素級輪廓,就可能用到分割。
🚗 自動駕駛 語義分割辨識路面/人行道;物件偵測框出車輛/行人;實例分割追蹤每台車的軌跡。三種任務協同工作。

🏥 醫療影像 U-Net 分割腫瘤範圍、器官位置,輔助醫生精準診斷。Dice Coefficient 是醫療領域最常用的評估指標。

📹 視訊會議背景虛化 即時人像語義分割,將「人」的像素保留,「背景」像素模糊處理(Zoom/Teams 天天在用)。

🤖 機器人視覺 全景分割讓機器人理解整個場景:哪裡是地板可以走、哪裡是桌子要避開、桌上有哪些物品可以抓取。

📝 iPAS 考點提醒

影像分割對影像逐像素標註,是 iPAS 中級科目一考點。重點:語意分割(同類歸一)、實例分割(分個體)、全景分割(兩者合),評估用 IoU、Dice 與各類平均 mIoU。易混點:分割不是物件偵測——偵測畫框、分割描輪廓;與分類(整張一個標籤)更不同。情境:U-Net(醫療)、DeepLab(空洞卷積)、Mask R-CNN(實例)、SAM(通用)。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

影像分割是什麼?

對影像逐像素分類,標出每個像素屬於哪個物件或區域;比偵測的方框更精細,能描出物件輪廓。

語意分割和實例分割差在哪?

語意分割只分類別(所有人都同一類);實例分割還要區分同類的不同個體(人1、人2分開);全景分割結合兩者。

常用什麼架構?

編碼器-解碼器結構(U-Net、FCN、DeepLab);編碼器抽特徵、解碼器還原到像素級,常用跳接保留細節。

怎麼評估分割品質?

用 IoU(Jaccard)與 Dice 係數衡量預測區域與真實區域的重疊;對不平衡的小區域 Dice 較敏感。

分割的典型應用?

醫療影像(腫瘤、器官)、自駕(道路、行人)、衛星影像、影像去背與編輯等需要像素級精度的場景。

🧭 相關主題

← 返回 AI 學習與考證地圖