貓吃魚:Transformer 運作原理

準備好了嗎?我們要開始囉!請按「下一步」。

📝 iPAS 考點提醒

Transformer 是現代大型語言模型的核心架構,iPAS 中級科目一必考。重點:用自注意力一次看全句、抓長距離關係、可平行運算,是 BERT、GPT 的基礎。易混點:與 RNN(循序、難平行、長依賴弱)不同;注意力不含順序需位置編碼;多頭注意力同時關注多種詞間關係。情境:理解生成式 AI 背後的技術、回答架構演進題。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

Transformer 的核心是什麼?

自注意力機制(self-attention);讓每個詞直接關注序列中所有其他詞,捕捉長距離關係、且可高度平行運算。

自注意力怎麼運作?

每個詞算出 Query、Key、Value;用 Query 與各 Key 的相似度當權重,加權彙整 Value,得到融入上下文的表示。

為什麼需要位置編碼?

自注意力不含順序資訊,我打你與你打我會被當一樣;位置編碼把每個詞的位置加進輸入,讓模型知道詞序。

多頭注意力的好處?

多組注意力平行關注不同面向(語法、語意、指代等)再合併,表達力比單頭強,能同時抓多種詞間關係。

Transformer 為何主宰現代 AI?

可平行、擴展性佳、長依賴強;是 BERT、GPT 等大型語言模型與多模態模型的共同骨幹。

🧭 相關主題

← 返回 AI 學習與考證地圖