深度學習 · 電腦視覺

卷積神經網路 CNN

不是「一次看整張圖」,而是「拿放大鏡在圖上滑動」——用小小的卷積核掃出邊緣、紋理,一層層拼成物體。

卷積核局部連接權重共享池化平移不變性

💡一句話定義

卷積神經網路(CNN)= 專門處理影像等有空間結構資料的網路。它用小小的卷積核(濾鏡)在圖上滑動、萃取邊緣與紋理等局部特徵,並具平移不變性——物體移個位置仍然認得。

傳統全連接網路把整張圖攤平來看,參數爆炸又丟失空間關係;CNN 用「局部掃描+共享濾鏡」把這兩個問題一次解決。

🔍用「放大鏡」來想

一般神經網路(MLP)像是「攤開整張圖一次看完」;CNN 則像拿一個放大鏡(卷積核)在圖上一格一格滑動,每次只看一小塊、算出這塊有多像某種特徵(例如垂直線、邊緣)。同一個放大鏡掃過整張圖,所以無論特徵出現在左上或右下都認得出來。

🎮互動:卷積是怎麼算的

切換濾鏡,再把滑鼠移到右邊 Feature Map 的格子上:左圖的黃框會跳到對應區域,下方顯示「對應相乘再相加」的完整算式。

卷積神經網路 (CNN) 互動演示
選擇濾鏡 (Filter):
Input Image (5x5)
×
Kernel (3x3)
=
Feature Map (3x3)
請將滑鼠移到最右側的 Feature Map 格子上,查看卷積運算細節。
* 註:Feature Map 尺寸變小是因為我們沒有使用 Padding。 (5-3+1 = 3)

🧮卷積的數學

說穿了,卷積就是對應位置相乘後全部相加(Sum of Products):

yi,j = Σm Σn   xi+m, j+n · wm,n

x 是輸入像素、w 是卷積核權重、y 是輸出的特徵圖數值。沒加 Padding 時,5×5 的圖被 3×3 的核掃過,輸出會縮成 3×3(5−3+1)。

為什麼 CNN 這麼有效?

🔬局部連接
每個神經元只看一小塊(如貓的耳朵),符合視覺原理。
♻️權重共享
同一個濾鏡掃整張圖 → 參數大減,還能偵測任何位置的特徵。
📍平移不變性
特徵出現在左上或右下都認得,物體移位仍能辨識。
🧱層層抽象
淺層抓邊緣紋理、深層組成眼睛、臉、物體。

🏗️一個完整 CNN 的組件

做什麼會不會學參數
卷積層 Conv用濾鏡萃取邊緣、紋理等局部特徵會(學濾鏡權重)
ReLU去除負值、加入非線性不會
池化層 Pooling降採樣縮小尺寸、保留最顯著訊號不會(只降維)
全連接層 FC把特徵攤平後做最終分類
易混:卷積層「學參數、抓特徵」;池化層「只降維、保訊號,不學參數」,還能增強平移不變性——這是考試常見的判斷點。

🆚CNN vs 全連接網路(影像)

面向全連接 MLPCNN
看圖方式攤平整張圖卷積核局部滑動
參數量爆炸(每個像素都連)少很多(權重共享)
空間結構攤平就丟失了保留
平移不變性幾乎沒有

也因此,CNN 廣泛用於醫療影像診斷、自動駕駛、人臉辨識等視覺任務。而 1D 卷積可用於文字/語音/時間序列,3D 卷積用於影片與立體醫療影像。

自我檢測

Q1. 卷積運算實際上在算什麼?
把卷積核蓋在輸入的一小塊上,對應位置相乘後全部相加,得到特徵圖上的一個數值;核滑過整張圖就得到整張特徵圖。
Q2. 局部連接與權重共享為什麼重要?
局部連接讓每個神經元只看一小塊、符合視覺原理;權重共享讓同一濾鏡掃整張圖,大幅減少參數,並能在任何位置偵測同一特徵(平移不變性)。
Q3. 卷積層和池化層的差別?
卷積層會學參數、負責萃取特徵;池化層不學參數,只是降採樣縮小尺寸、保留最顯著訊號,並增強平移不變性。
Q4. CNN 只能用在影像嗎?
不是。1D 卷積可用於文字、語音、時間序列;3D 卷積用於影片與立體醫療影像(如 CT、MRI)。凡是有「局部結構」的資料都適合。

🎯重點整理

📝 iPAS 考點提醒

CNN(卷積神經網路)是電腦視覺的基石,iPAS 高頻考點(初級科目一、中級科目一與三)。重點:卷積核掃描局部抓邊緣紋理、池化降採樣,具參數共享與平移不變性,參數遠少於全連接又保留空間結構。易混點:卷積學參數抓特徵、池化只降維保訊號不學參數;越深層特徵越抽象。情境:影像分類、物件偵測、語意分割、醫療影像。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

CNN 適合處理什麼資料?

影像等具空間結構的資料;用卷積核掃描局部區域萃取邊緣紋理特徵,並對平移具不變性(物體移位仍認得)。

卷積層和池化層各做什麼?

卷積層用濾鏡萃取邊緣、紋理等局部特徵;池化層縮小尺寸、保留重要訊號,降低運算並增強平移不變性。

為什麼 CNN 比全連接網路更適合影像?

局部連接與權重共享讓參數大減,且同一特徵(如邊緣)出現在影像任何位置都能偵測到(平移不變性)。

CNN 只能用在影像嗎?

不是;1D 卷積可用於文字、語音與時間序列訊號,3D 卷積用於影片與立體醫療影像(如 CT、MRI)。

經典的 CNN 架構有哪些?

LeNet、AlexNet、VGG、GoogLeNet、ResNet 等;越新越深、用殘差等技巧解決深層訓練難題。

🧭 相關主題

← 返回 AI 學習與考證地圖