深度學習 · 電腦視覺

CNN vs 全連接:為什麼影像要用 CNN

全連接把每個像素都拉一條線到每個神經元——參數瞬間爆炸;CNN 只用一個小卷積核滑動掃描,參數少、又保留空間結構。

全連接爆炸局部感知參數共享平移不變池化

💡一句話定義

處理影像時,全連接網路(FCNN)讓每個像素都連到每個神經元,參數量隨像素暴增、又丟失空間關係;CNN 改用小小的卷積核滑動掃描局部區域、同一套規則掃全圖(參數共享),參數少、效率高、還具平移不變性。

這頁不談卷積怎麼算(那在 CNN 卷積互動頁),而是回答一個更前面的問題:為什麼影像不直接用全連接?

🔍用「放大鏡」來想

全連接像是「把整張圖每個點都牽一條線到大腦」——一個 8×8 的小圖就要 64 條線,換成百萬像素的監視器直接爆炸,而且車子移一下位置就認不得。CNN 像拿一個放大鏡(卷積核)在圖上滑動,一次只看 3×3 的小區塊、用同一套尋找規則掃全圖:參數極少,車輪出現在哪都認得。

🎮互動:全連接爆炸 vs 卷積掃描

點「體驗 FCNN」看 64 條線全部連到一個神經元(而這才一個神經元!);點「體驗 CNN」看黃色放大鏡如何用同一套規則滑過整張圖。深色方塊是要找的「車輛」。

車輛辨識系統:CNN vs FCNN
請點擊上方的按鈕,看看 AI 是如何觀察一張圖片的!
(深色方塊代表我們要尋找的「車輛」)

💥參數爆炸:FCNN vs CNN

面向全連接 FCNNCNN
連接方式每個像素連到每個神經元卷積核只看局部、滑動掃全圖
參數量隨像素暴增(百萬像素→天文數字)只有一個小核的權重,少很多
空間結構攤平就丟失保留
平移不變性幾乎沒有(移位就認不得)有(同一套規則掃全圖)

🎯CNN 的三招(+池化)

🔬局部感知
一次只看一小塊區域找邊緣/紋理,運算量大減。
♻️參數共享
同一個卷積核掃全圖,規則不變 → 參數極少、效率極高。
📍平移不變
特徵出現在哪都用同一套規則認得,物體移位仍辨識。
🗜️池化降維
對特徵圖降採樣,縮小尺寸、保留重要訊號、增加平移容忍。

🪜為什麼要疊很多層?

單一層只能看到很淺的特徵。堆疊多層後會形成由簡到繁的特徵階層:淺層學邊緣、紋理 → 中層學部件(如車輪、眼睛)→ 深層學完整物件(整台車、整張臉)。這種層層抽象,正是深層 CNN 強大的原因。

自我檢測

Q1. 為什麼影像不直接用全連接網路?
全連接讓每個像素都連到每個神經元,參數量隨像素暴增、運算極差,還會攤平丟失空間結構,且物體移位就認不得。CNN 用局部卷積+參數共享解決這些問題。
Q2. 「參數共享」是什麼意思?為什麼能省參數?
同一個卷積核(一套權重)滑過整張圖,每個位置都用同一套規則,而不是每個位置各學一套。所以參數量只等於一個小核,遠少於全連接。
Q3. 池化層的作用是什麼?
對特徵圖降採樣(如最大池化),縮小尺寸、保留最重要訊號、增加平移容忍度,並降低運算與過擬合。它不學參數。
Q4. 為什麼 CNN 要堆很多層?
層層堆疊形成由簡到繁的特徵階層:淺層邊緣紋理、中層部件、深層完整物件。越深的層能組合出越抽象、越有意義的特徵。

🎯重點整理

📝 iPAS 考點提醒

CNN(卷積神經網路)是電腦視覺的基石,iPAS 影像考點(初級科目一、中級科目一與三)。重點:卷積核掃描局部抓邊緣紋理、池化降採樣,具參數共享與平移不變性,參數遠少於全連接又保留空間結構。易混點:卷積抓局部特徵、池化只降維保訊號不學參數;越深層特徵越抽象(邊緣到部件到物件)。情境:分類、物件偵測、語意分割、醫療影像。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

CNN 為什麼適合影像?

用卷積核掃描局部區域抓圖樣(邊緣、紋理),具參數共享與平移不變性,參數遠少於全連接、又能保留空間結構。

卷積層在做什麼?

用小濾波器在影像上滑動做內積,產生特徵圖;不同濾波器偵測不同特徵,越深層特徵越抽象(邊緣到物件)。

池化層的作用?

對特徵圖降採樣(如最大池化),縮小尺寸、保留重要訊號、增加平移容忍度、降低運算與過擬合。

為什麼要用多層?

淺層學邊緣與紋理、中層學部件(如眼睛)、深層學完整物件;層層堆疊形成由簡到繁的特徵階層。

CNN 常見應用?

影像分類、物件偵測、語意分割、人臉辨識、醫療影像;也用於語音頻譜與部分序列任務。

🧭 相關主題

← 返回 AI 學習與考證地圖