Transformer 是現代大型語言模型的核心架構,iPAS 中級科目一必考。重點:用自注意力一次看全句、抓長距離關係、可平行運算,是 BERT、GPT 的基礎。易混點:與 RNN(循序、難平行、長依賴弱)不同;注意力不含順序需位置編碼;多頭注意力同時關注多種詞間關係。情境:理解生成式 AI 背後的技術、回答架構演進題。
想練情境題與詳解 → AI 學習與考證地圖
自注意力機制(self-attention);讓每個詞直接關注序列中所有其他詞,捕捉長距離關係、且可高度平行運算。
每個詞算出 Query、Key、Value;用 Query 與各 Key 的相似度當權重,加權彙整 Value,得到融入上下文的表示。
自注意力不含順序資訊,我打你與你打我會被當一樣;位置編碼把每個詞的位置加進輸入,讓模型知道詞序。
多組注意力平行關注不同面向(語法、語意、指代等)再合併,表達力比單頭強,能同時抓多種詞間關係。
可平行、擴展性佳、長依賴強;是 BERT、GPT 等大型語言模型與多模態模型的共同骨幹。