Computer Vision

電腦視覺

你一眼就看出「那是一隻貓」,機器看到的卻是一整片數字亂碼。
這是一場「教電腦長眼睛」的漫長開眼修行。

—— 犬蔥評論 · 機器開眼特輯

先講個殘酷的事實:對電腦來說,一張照片根本不是「照片」,而是一大堆數字。每個像素就是幾個 0 到 255 的數值。你我一眼認出「這是貓」,機器看到的是一片密密麻麻、比報稅表還讓人絕望的數字海。電腦視覺,就是想辦法讓它從這片數字海裡,撈出「意義」這兩個字。

而且「看懂」是有等級的,一級比一級難:這張圖是啥?(分類)東西在哪?(偵測)每個像素是誰的?(分割)上面寫了什麼字?(OCR)。問得越細,機器越頭痛。

這集我們把電腦視覺這棵樹上的五位主角一個個叫上台——奠基老祖 CNN、快到起飛的 YOLO、龜毛到像素的影像分割、專門認字的 OCR,還有掀桌改朝換代的 ViT

五種「看」的方式 · 一級比一級龜毛

電腦視覺

同一張圖,五種問法、五種答案。從「這是什麼」一路刁難到「每個像素到底是誰」。

01

CNN

卷積神經網路
「拿個小放大鏡在圖上到處滑,先看邊邊角角,再一層層拼出一整隻貓。」

CNN 是整個電腦視覺的開山老祖。它不像笨方法把整張圖攤平硬吞,而是拿一個個小「放大鏡」(卷積核)在圖上滑來滑去,先抓低階特徵(邊緣、顏色、紋理),再一層層拼成高階概念(眼睛、輪子、臉)。

加上「權重共享」跟「池化」,讓它參數少、又不怕位移——貓躲在左上角還是右下角,它都認得出來。它負責回答最基本那題:這張圖到底是啥,也是後面所有模型的骨架零件,祖師爺級的存在。

評估指標 Top-1 / Top-5 Accuracy、Precision / Recall、混淆矩陣
02

YOLO

You Only Look Once · 物件偵測
「掃一眼,就同時把畫面裡所有東西圈起來、貼上名牌——名字取得很嗆:你只需看一次。」

光知道「有貓」不夠,還要知道貓在哪、有幾隻。這叫物件偵測——畫框、貼名字。YOLO 的絕活全寫在名字裡:只看一次。老方法要在圖上掃描上千個候選區慢慢挑,它一眼就把整張圖的框跟分類全吐出來。

結果就是快到能即時處理影片——自駕車、監視器、無人機全靠它盯場。速度跟精度平衡得極好,是工業界物件偵測的當紅炸子雞。

評估指標 mAP(平均精度均值)、IoU(交並比)、FPS(每秒幀數)
03

影像分割

Image Segmentation
「框?太粗糙了。它要把貓的每一根毛都精準塗上色——龜毛到像素等級。」

偵測只給你一個粗框,分割覺得那太隨便——它要替每一個像素分類,把物體的輪廓描得一絲不苟。語意分割把同類全塗一色;實例分割更狠,連「這三隻貓誰是誰」都分得清清楚楚。

這種像素級的龜毛,正是醫療影像(腫瘤邊界)、自駕(可行駛區域)、影像去背的命根子。代表作有 U-Net、Mask R-CNN,還有近年通吃萬物的 SAM。

評估指標 mIoU(平均交並比)、Dice 係數、Pixel Accuracy
04

OCR

光學字元辨識
「把圖片裡的字『讀』出來,變成你能複製貼上的文字——文件數位化的無名英雄。」

OCR 一生專攻一件事:看到字,把它變成文字。掃描的合約、路邊的招牌、發票、車牌、你鬼畫符的手寫筆記——它先找出字在哪(偵測),再認出每個字是啥(辨識),兩步合力把像素變成能搜尋、能編輯的文本。

看似簡單,魔鬼全在細節:歪斜、模糊、藝術字、多國語言、龍飛鳳舞的手寫體,每一關都是地獄。它默默扛下了文件數位化的髒活累活,是名副其實的無名英雄。

評估指標 字元錯誤率 CER、詞錯誤率 WER、辨識準確率
05

ViT

Vision Transformer
「把圖切成一格格拼圖,然後——用讀文章的方法,來『讀』一張圖。」

ViT 是視覺界的改朝換代者。它把 NLP 界的王者 Transformer 整個搬過來:把圖片切成一小塊一小塊(Patch),當成一串「單字」,再用注意力機制去看每一塊跟其他塊的關係。CNN 只顧著看局部,ViT 天生擅長綜觀全局

資料一大(超大規模預訓練),它就能反壓 CNN。缺點是胃口大得嚇人,要海量資料才餵得飽——小資料集餵它,它會鬧脾氣。它是現代多模態、大型視覺模型的主流骨架。

評估指標 Top-1 Accuracy、遷移學習表現、參數量 / 運算量
從「這是什麼」到「每個像素是誰」,難度一階一階往上爬。
但它們信的是同一句話:
只要層數夠深、資料夠多,機器終究能從一片數字海裡,看見這個世界。
Reality Check · 那排紅點

不同任務,考卷完全不一樣

拿分類的考卷去改偵測,等於用數學卷改作文——分數再高也是笑話。

分類看準確率

CNN / ViT 這種「這是啥」的任務,直接看 Top-1 / Top-5 Accuracy,最乾脆。

偵測看 mAP + IoU

YOLO 不只要分對類,框還得圈得準。IoU 量框重疊多少,mAP 綜合打總分。

分割看 IoU / Dice

像素級任務用 mIoU、Dice 算「塗對的區域」佔多少,醫療影像尤其愛 Dice。

OCR 看錯誤率

CER / WER 算它讀錯幾個字、幾個詞——注意,這個是越低越好,跟前面全反過來。