深度學習 · 自然語言處理

Transformer(Attention Is All You Need)

丟掉一步步的循環,用自注意力「一次看完整句」、還能平行運算——它是現代所有大型語言模型的共同祖先。

自注意力一次看全句可平行位置編碼Encoder · DecoderLLM 祖先

💡一句話定義

Transformer 的核心是自注意力(Self-Attention):讓每個詞直接關注序列中所有其他詞,因此能捕捉長距離關係、又能高度平行運算。每個詞算 Q、K、V,用 Q 與各 K 的相似度當權重加權彙整 V,得到融入上下文的表示。

🚀為什麼這麼重要?

在它之前,RNN 翻譯一句話要等上一個字處理完(循序、慢、長句易忘)。Transformer 用自注意力讓電腦一次看完整句、直接連結遠距的關聯,還能平行運算。它是 BERT、GPT、ViT、乃至多模態模型的共同祖先——現代 LLM 幾乎都是它的延伸。

🎮互動:資料如何在架構裡流

按「發送訊號」看資料從 Encoder 上升、經 Cross-Attention 把 Key/Value 交給 Decoder,最後 Softmax 出下一個字的機率。也可切「只看 Encoder(BERT)」或「只看 Decoder(GPT)」。

Transformer (Attention Is All You Need) 架構互動演示
Inputs (e.g., "I love AI") Input Embedding + Pos Encoding Nx Layers Multi-Head Attn Add & Norm Feed Forward Outputs (Shifted) Output Embedding + Nx Layers Masked Attn Add & Norm Cross Attention Add & Norm Feed Forward Linear Softmax Output Probabilities Keys & Values
點擊按鈕以查看資料流向與架構區別

🔀Encoder vs Decoder(BERT vs GPT 的分家)

面向Encoder(BERT)Decoder(GPT)
負責輸入與理解輸出與生成
看的方向雙向(看得到整句上下文)單向(Masked,只看前面)
擅長分類、問答、語意理解對話、續寫、寫程式
兩者都用機器翻譯用完整 Encoder-Decoder:左讀原文、右生成譯文,靠 Cross-Attention 溝通

🧩核心組件

👁️多頭自注意力
每個詞關注全句、多個頭學不同關係。
📍位置編碼
補上詞序,因為注意力本身沒有順序。
🛣️殘差 + LayerNorm
Add & Norm 讓深層也訓練得動。
🔗Cross-Attention
Decoder 拿翻譯進度(Q)查 Encoder 原文(K/V)。

📐為什麼需要位置編碼?

自注意力只算「誰跟誰相關」,不含順序——「貓追狗」和「狗追貓」在它眼裡會被當成一樣。所以要在輸入裡加上每個詞的位置座標(Positional Encoding),模型才知道 "I" 在 "love" 前面。核心公式:
Attention(Q, K, V) = softmax( QKᵀ / √d_k ) · V

自我檢測

Q1. Transformer 的核心是什麼?為何取代 RNN?
核心是自注意力,讓每個詞直接關注所有詞、捕捉長距離關係且可平行。RNN 得循序處理、慢又長句易忘,因此被取代。
Q2. Encoder 和 Decoder 差在哪?
Encoder 雙向、負責理解(BERT);Decoder 用 Masked Attention 單向、負責生成(GPT)。完整 Encoder-Decoder 用於翻譯,靠 Cross-Attention 溝通。
Q3. 為什麼需要位置編碼?
自注意力不含順序,「貓追狗」與「狗追貓」會被當一樣。位置編碼把每個詞的位置加進輸入,讓模型知道詞序。
Q4. Cross-Attention 在翻譯裡做什麼?
Decoder 拿目前的翻譯進度當 Query,去查 Encoder(原文)的 Key/Value,決定現在該對齊、翻譯原文的哪個詞。

🎯重點整理

📝 iPAS 考點提醒

Transformer 是現代 LLM 與多模態 AI 的共同骨幹,iPAS 中級科目一必考。重點:自注意力讓每個詞直接關注序列所有詞、捕捉長距離關係且可高度平行,取代了循序的 RNN;靠 Query、Key、Value 加權彙整上下文。易混點:注意力不含順序、需位置編碼;編碼器(BERT,理解)與解碼器(GPT,生成)用途不同。情境:理解 ChatGPT 等運作;長文本因注意力隨長度平方成長而成本高。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

Transformer 的核心是什麼?

自注意力(self-attention);讓每個詞直接關注序列中所有其他詞,捕捉長距離關係、且可高度平行運算。

自注意力怎麼運作?

每個詞算 Query、Key、Value;用 Query 與各 Key 相似度當權重加權彙整 Value,得到融入上下文的表示。

為什麼需要位置編碼?

自注意力不含順序,貓追狗與狗追貓會被當一樣;位置編碼把每個詞的位置加進輸入,讓模型知道詞序。

為什麼 Transformer 取代了 RNN?

可平行運算、長距離依賴強、易擴展到大模型;RNN 須一步步循序處理、慢且長序列易遺忘,故被取代。

Transformer 衍生了哪些重要模型?

編碼器系的 BERT(理解)、解碼器系的 GPT(生成),以及視覺的 ViT、多模態模型,都是它的延伸。

🧭 相關主題

← 返回 AI 學習與考證地圖