💡一句話定義
傳統全連接網路把整張圖攤平來看,參數爆炸又丟失空間關係;CNN 用「局部掃描+共享濾鏡」把這兩個問題一次解決。
🔍用「放大鏡」來想
🎮互動:卷積是怎麼算的
切換濾鏡,再把滑鼠移到右邊 Feature Map 的格子上:左圖的黃框會跳到對應區域,下方顯示「對應相乘再相加」的完整算式。
🧮卷積的數學
說穿了,卷積就是對應位置相乘後全部相加(Sum of Products):
x 是輸入像素、w 是卷積核權重、y 是輸出的特徵圖數值。沒加 Padding 時,5×5 的圖被 3×3 的核掃過,輸出會縮成 3×3(5−3+1)。
⚡為什麼 CNN 這麼有效?
每個神經元只看一小塊(如貓的耳朵),符合視覺原理。
同一個濾鏡掃整張圖 → 參數大減,還能偵測任何位置的特徵。
特徵出現在左上或右下都認得,物體移位仍能辨識。
淺層抓邊緣紋理、深層組成眼睛、臉、物體。
🏗️一個完整 CNN 的組件
| 層 | 做什麼 | 會不會學參數 |
|---|---|---|
| 卷積層 Conv | 用濾鏡萃取邊緣、紋理等局部特徵 | 會(學濾鏡權重) |
| ReLU | 去除負值、加入非線性 | 不會 |
| 池化層 Pooling | 降採樣縮小尺寸、保留最顯著訊號 | 不會(只降維) |
| 全連接層 FC | 把特徵攤平後做最終分類 | 會 |
🆚CNN vs 全連接網路(影像)
| 面向 | 全連接 MLP | CNN |
|---|---|---|
| 看圖方式 | 攤平整張圖 | 卷積核局部滑動 |
| 參數量 | 爆炸(每個像素都連) | 少很多(權重共享) |
| 空間結構 | 攤平就丟失了 | 保留 |
| 平移不變性 | 幾乎沒有 | 有 |
也因此,CNN 廣泛用於醫療影像診斷、自動駕駛、人臉辨識等視覺任務。而 1D 卷積可用於文字/語音/時間序列,3D 卷積用於影片與立體醫療影像。
✅自我檢測
Q1. 卷積運算實際上在算什麼?
Q2. 局部連接與權重共享為什麼重要?
Q3. 卷積層和池化層的差別?
Q4. CNN 只能用在影像嗎?
🎯重點整理
- 是什麼:用卷積核滑動掃描影像、萃取局部特徵的網路。
- 卷積:對應相乘再相加;無 Padding 時輸出尺寸縮小。
- 三大優勢:局部連接、權重共享、平移不變性。
- 組件:Conv(學特徵)→ ReLU → Pooling(只降維)→ FC(分類)。
- 應用:醫療影像、自動駕駛、人臉辨識;1D/3D 卷積延伸到語音與影片。