深度學習 · 自然語言處理

RNN / LSTM 序列模型

第一批「有記憶」的網路:一個字接一個字讀、把前面的資訊往後傳。RNN 會健忘,LSTM 用閘門與一條記憶高速公路把長期記憶救回來。

記憶/隱藏狀態梯度消失三個閘門細胞狀態vs Transformer

💡一句話定義

RNN(循環神經網路)= 有「記憶」的網路:每一步都把前面步驟的隱藏狀態帶到下一步,適合處理有順序、時間相依的資料(文字、語音、時間序列)。LSTM 則用閘門與細胞狀態解決 RNN「健忘」的問題。

🎮互動:RNN 健忘 vs LSTM 記得住

句子是「I grew up in France …」。切換 RNN / LSTM,拉動時間步:看上方「來自開頭 I 的記憶保留強度」——RNN 快速衰退(橘),LSTM 靠藍色的細胞狀態高速公路維持高檔。

RNN / LSTM 序列模型互動演示
來自開頭 ("I") 的記憶保留強度: 100%

📞RNN 的致命傷:傳話遊戲

RNN 靠隱藏狀態一步步往後傳,就像傳話遊戲:話傳到第 10 個人時,第 1 個人的訊息通常已經變質或消失。這使 RNN 很難學會長距離依賴(主詞在句首、動詞在句尾)。原因是反向傳播沿時間連乘多步梯度:連乘因子小於 1 會指數縮小(梯度消失)、大於 1 會指數放大(梯度爆炸)。
ht = tanh( W·xt + U·ht−1 + b ) ← RNN 的一步

🚗LSTM 的解法:閘門 + 細胞狀態

LSTM 加了一條「記憶高速公路」和三道閘門,資訊可以幾乎無阻礙地長距傳遞:

🛣️細胞狀態 C_t
一條資訊高速公路,用加法式更新、梯度不易消失。
🗑️遺忘閘
決定丟掉多少舊記憶。
✍️輸入閘
決定寫入多少新資訊。
📤輸出閘
決定當下要輸出什麼。
Ct = ft·Ct−1 + it·C̃t ← 舊記憶×遺忘 + 新資訊×輸入

🔀RNN vs LSTM vs GRU

面向RNNLSTMGRU
記憶只有隱藏狀態細胞狀態+隱藏狀態只有隱藏狀態
閘門遺忘/輸入/輸出(3)更新/重置(2)
長期依賴差(梯度消失)
參數/速度最少多、較慢較少、較快

⚠️既然有 LSTM,為何還要 Transformer?

RNN/LSTM 必須按順序逐步計算、無法平行化,長序列訓練仍吃力,超長依賴也有極限。Transformer 用注意力可平行處理整個序列、並直接連結遠距位置,因此在 NLP 大幅取代了 RNN/LSTM。不過 RNN/LSTM 仍是理解序列建模與時間序列任務的重要基礎。

自我檢測

Q1. RNN 為什麼適合序列資料?
它有「記憶」——每一步都帶著前面步驟的隱藏狀態,能處理有順序、時間相依的資料,如文字、語音、時間序列。
Q2. 梯度消失/爆炸是怎麼發生的?
反向傳播沿時間連乘多步梯度:連乘因子小於 1 會指數縮小(消失、學不到長期依賴)、大於 1 會指數放大(爆炸),使樸素 RNN 難學長序列。
Q3. LSTM 如何解決長期記憶問題?
引入細胞狀態與遺忘/輸入/輸出三個閘門,用加法式更新讓資訊長距傳遞、選擇性記住或遺忘,大幅緩解梯度消失。
Q4. GRU 和 LSTM 差在哪?為何後來用 Transformer?
GRU 是簡化版(更新/重置兩閘、無獨立 cell state,較快)。RNN/LSTM 都得循序計算、無法平行、長序列吃力;Transformer 可平行且直連遠距,成為 NLP 主流。

🎯重點整理

📝 iPAS 考點提醒

RNN 與 LSTM 是處理序列的經典網路,iPAS 中級科目一考點。重點:RNN 有記憶把前一步狀態傳到下一步,適合文字、語音、時間序列;LSTM 用閘門記住長期資訊。易混點:RNN 有長期依賴與梯度消失問題,LSTM 與 GRU 改善之;但循序處理難平行,長序列現多被 Transformer 取代。情境:時間序列預測、序列建模的演進脈絡。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

RNN 為什麼適合序列資料?

它具「記憶」:每一步輸出會帶著前面步驟的隱藏狀態,能處理順序與時間相依的資料,如文字、語音、時間序列。

什麼是梯度消失與爆炸?

反向傳播沿時間連乘多步梯度;連乘因子小於 1 會指數縮小(消失,學不到長期相依)、大於 1 會指數放大(爆炸),使樸素 RNN 難學長序列。

LSTM 如何解決長期記憶問題?

引入細胞狀態(cell state)與遺忘、輸入、輸出三個閘門,用加法式更新讓資訊長距傳遞、選擇性記住或遺忘,大幅緩解梯度消失。

GRU 和 LSTM 差在哪?

GRU 是簡化版,只有更新與重置兩個閘門、沒有獨立 cell state,參數較少、訓練較快,效果常與 LSTM 相近。

既然有 LSTM,為何還要 Transformer?

RNN/LSTM 必須按順序逐步計算、無法平行化、長序列仍吃力;Transformer 用注意力可平行處理並直接連結遠距位置,已成 NLP 主流。

🧭 相關主題

← 返回 AI 學習與考證地圖