💡一句話定義
這頁用一句話「The AI cat sat on the mat」,帶你看懂 RNN、BERT、GPT 三種架構在「資訊怎麼流動」上的根本差別。
🧬NLP 的演進脈絡
- 詞袋 / TF-IDF:把文字當一堆詞的統計,不管語序。
- 詞向量(Word2Vec):用向量表示詞義,語意相近的詞靠得近。
- RNN / LSTM:循序讀字、帶記憶,但長句會「忘記開頭」。
- Transformer:自注意力一次看全句、可平行、長依賴強。
- BERT / GPT(LLM):都是大的 Transformer,能力與規模一路躍升。
🎮互動:RNN / BERT / GPT 資訊怎麼流
切換三種模式,把滑鼠移到中間那排方塊上:RNN 紅線從開頭一路傳來、越來越淡(記憶衰退);BERT 藍線雙向連到所有字;GPT 綠線只連到前面的字(看不到未來)。
🔀三種架構對照
| 架構 | 怎麼讀 | 方向 | 擅長 |
|---|---|---|---|
| RNN / LSTM | 一個字一個字循序讀、帶記憶 | 單向(有記憶但會衰退) | 早期序列任務;長句會遺忘 |
| BERT(Encoder) | 一口氣看完整句、自注意力 | 雙向(左右都看) | 理解:分類、問答、NER |
| GPT(Decoder) | 只能看前面、預測下一個字 | 單向(Masked,不看未來) | 生成:對話、續寫、寫程式 |
⚡為什麼 Transformer 取代了 RNN
🛠️用一個 LLM 的三種方式
| 方式 | 做什麼 | 成本 / 特點 |
|---|---|---|
| 預訓練 | 從零在大語料學通用能力 | 最貴,一般由大公司做 |
| 微調 Fine-tune | 用特定資料再訓練、調權重 | 讓模型專精某任務或風格 |
| 提示工程 Prompt | 不改權重,只設計輸入引導 | 最輕量、最快,人人可做 |
⚠️幻覺與 token
token:模型處理的最小單位(常是子詞)。輸入輸出長度、計費、上下文視窗都以 token 計;中文一字常等於或多於一個 token,要注意上下文長度限制。
✅自我檢測
Q1. BERT 和 GPT 用 Transformer 的哪個部分?差在哪?
Q2. 為什麼 Transformer 取代了 RNN?
Q3. 預訓練、微調、提示工程差在哪?
Q4. LLM 為什麼會「幻覺」?怎麼降低?
🎯重點整理
- 演進:詞袋 → 詞向量 → RNN/LSTM → Transformer → BERT/GPT。
- RNN:循序、有記憶但長句會忘、不能平行。
- BERT:Encoder、雙向、擅理解。
- GPT:Decoder、單向、擅生成(預測下一個 token)。
- 用法:預訓練/微調/提示;注意幻覺與 token 限制。