🔵 ANN / MLP · iPAS 必考基礎

人工神經網路 (ANN/MLP):最基礎的神經網路長什麼樣?

MLP(多層感知器)是所有深度網路的起點:輸入層、隱藏層、輸出層,層與層之間全連接。訊號一路加權、加偏差、過激活函數往後傳,就能學會複雜的「輸入 → 輸出」對應。

全連接前饋網路權重 + 偏差激活函數前向傳播通用近似定理

🧩 一、結構:三種層 + 全連接

ANN 模仿人腦神經元:每個神經元收到很多訊號、加權整合、再決定要不要「興奮」傳下去。

輸入層 Input接收外部資料(像素、感測器數值、特徵)。
隱藏層 Hidden做特徵提取與運算——「深度」就發生在這裡,可以有很多層。
輸出層 Output給出最終結果(分類機率、回歸數值)。

🎮 二、動手玩:2-4-1 的迷你網路

拖動兩個輸入 $x_1$、$x_2$,看訊號怎麼流過網路。神經元越藍=激活值越高;連線藍色是正權重紅色是負權重,粗細代表大小。按「隨機重置權重」換一組參數。

正權重 (激發)
負權重 (抑制)
神經元亮度 = 激活程度
最終輸出 Output: 0.00

🗺️ 怎麼看

調 $x_1$、$x_2$,隱藏層每個神經元會依「收到的加權總和」變亮或變暗,訊號一層層傳到輸出。隨機重置權重會換掉所有連線的正負與粗細——你會看到同樣的輸入,輸出完全不同。訓練做的事,就是慢慢調這些權重,讓輸出變準。

➡️ 三、前向傳播:一個神經元在算什麼

資料怎麼從輸入變成輸出?每個神經元都做同一件事:

$$ y = \sigma\left(\sum_i (w_i \cdot x_i) + b\right) $$
$x_i$ 輸入上一層傳來的訊號。
$w_i$ 權重 Weight連接的強弱(正=激發、負=抑制)。學習就是在調它。
$b$ 偏差 Bias神經元的激活門檻,整體上下平移。
$\sigma$ 激活函數加入非線性、決定神經元要不要「興奮」(demo 用 Sigmoid 壓到 0~1)。

⚡ 四、為什麼一定要激活函數?

沒有它,堆再多層都白搭

如果每層只做線性運算(沒有非線性激活),那多層線性疊加起來,數學上仍然等於「一個線性模型」——再深也學不到彎曲的非線性關係。激活函數(ReLU、sigmoid、tanh…)的作用就是在每層之間塞進非線性,網路才真正有「表達複雜函數」的能力。詳見 激活函數

🌌 五、為什麼「多層」這麼強?通用近似定理

Universal Approximation Theorem

這個定理說:只要隱藏層的神經元夠多,MLP 理論上可以逼近任何連續函數。這就是為什麼神經網路能學會開車、畫畫、寫作——它是個超級有彈性的「萬能曲線擬合器」。
(實務上「夠多」可能天文數字,所以我們才會用 CNN、Transformer 這些更聰明的結構來省參數。)

🔄 六、怎麼訓練?前向 → 損失 → 反向傳播

① 前向傳播算出預測,和真實答案比對得到損失
② 反向傳播 Backprop鏈式法則算出「每個權重該負多少責任」(梯度)。
③ 梯度下降沿梯度反方向微調每個權重,讓損失下降。見 梯度下降
④ 反覆迭代跑很多次,權重越調越好,輸出越來越準。

⚖️ 七、MLP vs CNN / RNN:什麼時候用哪個

資料型態適合的網路為什麼
表格 / 向量MLP一般用途、夠用
影像CNN局部連接、權重共享,抓空間特徵、省參數
序列 / 文字RNN/LSTMTransformer處理先後順序與長距依賴

🧠 MLP 對影像的痛點

全連接 MLP 用在影像會參數爆炸(每個像素都連到每個神經元)、又沒利用「相鄰像素相關」的空間結構——所以影像改用 CNN。

⚠️ 八、MLP 常見的訓練問題

過擬合參數多易背雜訊 → Dropout、正則化、早停。
梯度消失深層難訓練 → 用 ReLUBatchNorm、好的初始化。
對特徵尺度敏感用前先標準化

🧪 九、觀念自我檢測

先想再點開。

Q1. MLP 由哪三種層組成?

輸入層、隱藏層、輸出層,層間全連接

Q2. 一個神經元怎麼算輸出?

$y = \sigma(\sum w_i x_i + b)$:加權和 + 偏差,再過激活函數。

Q3. 為什麼一定要激活函數?

沒有非線性,多層線性疊加仍等於一個線性模型,學不到非線性關係。

Q4. MLP 怎麼學習權重?

前向傳播算損失 → 反向傳播算梯度 → 梯度下降更新,反覆迭代。

Q5. 影像為什麼不用全連接 MLP?

參數爆炸又沒利用空間結構;改用 CNN(局部連接、權重共享)。

✅ 十、30 秒重點整理

MLP輸入/隱藏/輸出層、全連接前饋。
神經元y=σ(Σwx+b),權重+偏差+激活。
激活函數提供非線性,缺它=線性模型。
通用近似夠多神經元可逼近任何連續函數。
訓練前向→損失→反向傳播→梯度下降。
選型表格 MLP、影像 CNN、序列 RNN/Transformer。

📝 iPAS 考點提醒

人工神經網路(ANN/MLP)是深度學習的基礎,iPAS 必考(初級科目一、中級科目三)。重點:由輸入、隱藏、輸出層的神經元組成,靠激活函數帶非線性、用反向傳播與梯度下降學參數。易混點:全連接 MLP 對影像沒有 CNN 的空間結構優勢(參數爆炸);層多不一定好(會過擬合、梯度消失)。情境:理解神經網路基本單元;表格資料可用、影像或序列改用 CNN 或 Transformer。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

多層感知器(MLP)是什麼?

最基本的前饋神經網路,由輸入層、一或多個隱藏層與輸出層組成,層間全連接,透過非線性激活學習複雜的輸入到輸出映射。

為什麼一定要有激活函數?

若沒有非線性激活,多層線性疊加仍等於一個線性模型、學不到非線性關係;ReLU、sigmoid、tanh 等提供非線性,網路才有表達力。

MLP 怎麼學習(訓練)?

前向傳播算出預測與損失,再用反向傳播(backpropagation)沿鏈式法則算各權重梯度,並以梯度下降更新權重,反覆迭代。

MLP 和 CNN、RNN 怎麼選?

MLP 適合一般表格或向量資料;影像有空間結構用 CNN(局部連接、權重共享);序列或時間相依用 RNN/LSTM 或 Transformer,效率與效果更好。

MLP 常見的訓練問題?

過擬合(用 Dropout、正則化、早停)、梯度消失(用 ReLU、BatchNorm、合適初始化)、對特徵尺度敏感(先標準化)。

🧭 相關主題

← 返回 AI 學習與考證地圖