RNN 與 LSTM 的記憶機制是 iPAS 中級科目一考點。重點:RNN 把隱藏狀態一步步傳遞但易遺忘遠處資訊(梯度消失);LSTM 用輸入、遺忘、輸出三個閘門選擇性記住或遺忘,保留長距離依賴。易混點:GRU 是 LSTM 簡化版(兩閘門、更快);RNN 系列循序難平行,長依賴強的場景現多用 Transformer。情境:理解序列模型如何記憶、為何被 Transformer 取代。
想練情境題與詳解 → AI 學習與考證地圖
處理序列資料的網路;它有記憶,把前一步的隱藏狀態傳到下一步,適合文字、語音、時間序列。
反向傳播時易梯度消失或爆炸、難學長距離依賴;序列一長早期資訊就被遺忘,故有 LSTM 與 Transformer 改善。
引入記憶單元與三個閘門(輸入、遺忘、輸出),選擇性記住或遺忘資訊,能保留長距離依賴。
GRU 是簡化版,只有兩個閘門、參數更少、訓練更快;效果常與 LSTM 相近,小資料時可能更好。
RNN 循序處理、難平行、長依賴弱;Transformer 用注意力可平行、長依賴強,已在多數 NLP 任務取代 RNN。