💡一句話定義
它把「物件偵測」當成一個迴歸問題來解——不像 R-CNN 系列要先產生數千個候選區再一一分類,YOLO 看一眼就給答案。
🆚先分清:分類 vs 偵測
🎮互動:哪個網格負責偵測?
把滑鼠移到圖片裡物件的中心點:只有「中心落在該格」的網格會輸出高信心度、畫出邊界框、並在右側點亮對應類別。移到背景則只有雜訊。
🔲網格系統與輸出向量
YOLO 把圖切成 S×S 網格(demo 為 5×5)。關鍵規則:物件的「中心點」落在哪個網格,那個網格就負責偵測它。每個網格輸出一個向量:
p_c=這格有物件的信心度;b_x, b_y=框中心(相對網格的偏移);b_w, b_h=框的寬高(相對整張圖);c₁…c₃=各類別機率。看一眼整張圖,就把每一格的這個向量全部算出來。
⚖️one-stage vs two-stage
| 面向 | one-stage(YOLO、SSD) | two-stage(Faster R-CNN 系) |
|---|---|---|
| 做法 | 一次前向直接回歸框+類別 | 先產生候選區,再分類+修框 |
| 速度 | 快,適合即時 | 較慢 |
| 精度 | 好;小物件曾較弱(新版已大幅改善) | 傳統上較準 |
| 場景 | 即時監控、自駕、無人機 | 離線、追求精度的任務 |
📏評估與後處理
預測框與真實框的重疊度,用來判定是否算「命中」。
各類別 AP 的平均(mean Average Precision),偵測的主要指標。
非極大值抑制:同一物件常有多個框,NMS 去掉重複、只留最好的。
低於門檻的框直接丟棄,控制精確率與召回率的取捨。
🏭應用場景
✅自我檢測
Q1. 影像分類和物件偵測差在哪?
Q2. YOLO 為什麼快?
Q3. 「哪個網格負責一個物件」的規則是什麼?
Q4. 偵測結果怎麼評估?NMS 做什麼?
🎯重點整理
- 是什麼:一次前向同時預測所有物件的框與類別的即時偵測法。
- 分類 vs 偵測:偵測=定位+分類,輸出多個框。
- 網格:物件中心落在哪格,哪格負責,輸出 [p_c, 框, 類別]。
- 取捨:one-stage 快(YOLO)、two-stage 準(Faster R-CNN)。
- 評估:IoU、mAP;後處理用 NMS 去重複框。