前向把輸入逐層加權轉換算出預測;反向用鏈式法則把誤差逐層回傳、算出每個權重的梯度並更新。一來一回構成一次訓練迭代。
小卷積核在影像上滑動做加權求和,抓取局部特徵;權重共享讓參數量大減,越深層特徵越抽象(邊緣→形狀→物件)。
RNN 只有一條隱藏狀態,序列一長梯度消失、記不住早期資訊;LSTM 加入細胞狀態與遺忘/輸入/輸出三道門,長期資訊保得住。
Query 和每個 Key 算相似度、softmax 成權重後對 Value 加權求和——每個位置都能直接看到全句,不受距離限制。
深網路的退化與梯度消失:輸出=F(x)+x,梯度可經跳接直達淺層,ResNet 因此能疊上百層,Transformer 每層也都靠它。