💡一句話定義
它是現代 CNN 的里程碑,也是影像分類與遷移學習最常用的骨幹(backbone)之一。
📉先搞懂:什麼是「退化問題」
🏭用「工廠輸送帶」來想
🎮互動:單線道 vs 殘差高速公路
切換三種模式:① 傳統單線道(顏色一路磨損到灰)② 殘差高速公路(主線保留原文+支線補殘差)③ 注意力殘差(Transformer 的味道:保留原文+畫重點)。
🧮殘差怎麼運作
一般網路要一層層學出目標映射 H(x)。ResNet 換個想法:讓這一段只學殘差 F(x) = H(x) − x,再把輸入 x 從捷徑加回來:
好處是:如果這一段的最佳解其實接近「什麼都別動」(恆等映射),那讓 F(x) 趨近 0 非常容易;反觀要一疊非線性層自己學出恆等映射卻很難。而且反向傳播時,梯度能順著捷徑(+x)直接回傳,緩解梯度消失。
⭐為什麼 ResNet 這麼重要
梯度沿 skip connection 直接回傳,深層也不易消失。
ResNet-50/101/152 都練得動,突破深度瓶頸。
常拿預訓練的 ResNet 當 backbone 做微調。
Transformer 也大量用殘差+正規化,是通用技巧。
⚠️常見誤解:深 ≠ 一定更準
✅自我檢測
Q1. ResNet 解決了什麼問題?
Q2. 殘差連接(skip connection)怎麼運作?
Q3. 為什麼「學殘差」比「直接學」容易?
Q4. 殘差連接只用在 CNN 嗎?深就一定更好嗎?
🎯重點整理
- 問題:普通網路太深會「退化」,訓練誤差反升。
- 解法:殘差連接,輸出 = F(x) + x,只學差異。
- 好處:梯度走捷徑不消失、能訓練 50/101/152 層。
- 用途:影像分類骨幹、遷移學習;Transformer 也用。
- 澄清:殘差解決可訓練性,深 ≠ 一定更準。