深度學習 · 物件偵測

YOLO 物件偵測

You Only Look Once——只看一次整張圖,就同時把「有哪些物件、各在哪裡」全部框出來,快到能做即時偵測。

You Only Look Once一次前向網格系統one-stageIoU · mAP · NMS

💡一句話定義

YOLO(You Only Look Once)= 一種即時物件偵測方法:一次前向傳播就同時預測影像中所有物件的位置(bounding box)與類別,因此速度很快。

它把「物件偵測」當成一個迴歸問題來解——不像 R-CNN 系列要先產生數千個候選區再一一分類,YOLO 看一眼就給答案。

🆚先分清:分類 vs 偵測

影像分類只回答「這整張圖是什麼」(一張圖一個標籤);物件偵測要回答「圖裡有哪些物件、各自在哪裡」——同時做定位(畫框)分類,輸出多個邊界框與類別。YOLO 解的是後者。

🎮互動:哪個網格負責偵測?

把滑鼠移到圖片裡物件的中心點:只有「中心落在該格」的網格會輸出高信心度、畫出邊界框、並在右側點亮對應類別。移到背景則只有雜訊。

YOLO (You Only Look Once) 互動演示
CAR Person Dog Label
單一網格輸出 (Output Vector $y$)
Confidence ($p_c$): 0.00
Box Center ($b_x, b_y$): -, -
Box Size ($b_w, b_h$): -, -
類別機率 (Class Probabilities)
🚗 Car ($c_1$)0%
🚶 Person ($c_2$)0%
🐕 Dog ($c_3$)0%
* 試著將滑鼠移到圖片中的「物件中心點」。只有負責該物件中心的網格 (Grid Cell) 才會輸出高信心度。

🔲網格系統與輸出向量

YOLO 把圖切成 S×S 網格(demo 為 5×5)。關鍵規則:物件的「中心點」落在哪個網格,那個網格就負責偵測它。每個網格輸出一個向量:

y = [ p_c, b_x, b_y, b_w, b_h, c_1, c_2, c_3 ]

p_c=這格有物件的信心度;b_x, b_y=框中心(相對網格的偏移);b_w, b_h=框的寬高(相對整張圖);c₁…c₃=各類別機率。看一眼整張圖,就把每一格的這個向量全部算出來。

⚖️one-stage vs two-stage

面向one-stage(YOLO、SSD)two-stage(Faster R-CNN 系)
做法一次前向直接回歸框+類別先產生候選區,再分類+修框
速度,適合即時較慢
精度好;小物件曾較弱(新版已大幅改善)傳統上較準
場景即時監控、自駕、無人機離線、追求精度的任務

📏評估與後處理

🔲IoU
預測框與真實框的重疊度,用來判定是否算「命中」。
📈mAP
各類別 AP 的平均(mean Average Precision),偵測的主要指標。
🧹NMS
非極大值抑制:同一物件常有多個框,NMS 去掉重複、只留最好的。
🎚️信心閾值
低於門檻的框直接丟棄,控制精確率與召回率的取捨。

🏭應用場景

即時監控(車流統計、闖紅燈偵測)、自動駕駛(毫秒級偵測行人與車輛)、無人機/產線瑕疵檢測——凡是需要「快速、即時」框出物件的場合,YOLO 都是首選之一。

自我檢測

Q1. 影像分類和物件偵測差在哪?
分類只回答「整張圖是什麼」(一個標籤);偵測要找出「有哪些物件、各在哪裡」,同時做定位(畫框)與分類,輸出多個邊界框與類別。
Q2. YOLO 為什麼快?
它把偵測當成單一迴歸問題、一次前向就處理整張圖(one-stage),不像兩階段法要先產生候選區再分類,因此適合即時應用。
Q3. 「哪個網格負責一個物件」的規則是什麼?
物件的中心點落在哪個網格,那個網格就負責偵測它,並輸出該物件的信心度、邊界框與類別機率。
Q4. 偵測結果怎麼評估?NMS 做什麼?
用 IoU 判定預測框是否命中真實框,再算各類 AP 與整體 mAP。NMS(非極大值抑制)用來去掉同一物件的重複框,只保留信心最高的那個。

🎯重點整理

📝 iPAS 考點提醒

YOLO(You Only Look Once)是一階段即時物件偵測的代表,iPAS 中級科目一案例常見。重點:一次前向就同時預測所有物件的框與類別,速度快、適合即時應用。易混點:一階段(YOLO)重速度、兩階段(Faster R-CNN)重精度;YOLO 輸出仍需 NMS 去重複框,並用 IoU、mAP 評估。情境:即時監控、自駕、無人機、產線檢測等講求速度的場景。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

YOLO 是什麼?

You Only Look Once,一種即時物件偵測法:一次前向就同時預測影像中物件的位置(bounding box)與類別,速度很快。

物件偵測和影像分類差在哪?

分類只回答整張圖是什麼;偵測要找出有哪些物件、各在哪裡(定位加分類),輸出多個邊界框與類別。

YOLO 為什麼快?

把偵測當成單一迴歸問題、一次處理整張圖(one-stage),不像兩階段法(如 Faster R-CNN)先找候選區再分類,適合即時應用。

怎麼評估物件偵測?

用 IoU(預測框與真實框的重疊度)判定是否命中,再算各類別的 AP 與整體 mAP(mean Average Precision)。

one-stage 和 two-stage 偵測差在哪?

one-stage(YOLO、SSD)快、適合即時但小物件略弱;two-stage(R-CNN 系)較準但慢,依速度與精度需求選擇。

🧭 相關主題

← 返回 AI 學習與考證地圖