深度學習 · 自然語言處理

NLP 與 LLM 架構演進

從一個字一個字讀的 RNN,到「一口氣看完整句」的 Transformer——理解型的 BERT 與生成型的 GPT,都從這裡分家。

RNN → TransformerBERT 編碼器GPT 解碼器自注意力預訓練·微調·提示

💡一句話定義

大型語言模型(LLM)= 以 Transformer 為基礎,在海量文本上預訓練、學習預測下一個 token;過程中順便學到語法、知識與推理樣式,再拿來做問答、摘要、生成等任務。

這頁用一句話「The AI cat sat on the mat」,帶你看懂 RNN、BERT、GPT 三種架構在「資訊怎麼流動」上的根本差別。

🧬NLP 的演進脈絡

🎮互動:RNN / BERT / GPT 資訊怎麼流

切換三種模式,把滑鼠移到中間那排方塊上:RNN 紅線從開頭一路傳來、越來越淡(記憶衰退);BERT 藍線雙向連到所有字;GPT 綠線只連到前面的字(看不到未來)。

NLP 與 LLM 架構演進互動演示
請選擇上方模式,並將滑鼠移到文字方塊上,觀察資料流動的方向。

🔀三種架構對照

架構怎麼讀方向擅長
RNN / LSTM一個字一個字循序讀、帶記憶單向(有記憶但會衰退)早期序列任務;長句會遺忘
BERT(Encoder)一口氣看完整句、自注意力雙向(左右都看)理解:分類、問答、NER
GPT(Decoder)只能看前面、預測下一個字單向(Masked,不看未來)生成:對話、續寫、寫程式
一句記憶:BERT「看左右來理解」;GPT「只看左邊來生成」——為了不偷看答案。

為什麼 Transformer 取代了 RNN

RNN 必須循序處理(算完第 1 個字才能算第 2 個),無法平行、長句又容易梯度消失、忘記開頭。Transformer 用自注意力讓每個字第一層就能看到全句,可平行運算、長依賴強,因此成為現代主流。注意力核心公式:
Attention(Q,K,V) = softmax( QKᵀ / √d_k ) · V

🛠️用一個 LLM 的三種方式

方式做什麼成本 / 特點
預訓練從零在大語料學通用能力最貴,一般由大公司做
微調 Fine-tune用特定資料再訓練、調權重讓模型專精某任務或風格
提示工程 Prompt不改權重,只設計輸入引導最輕量、最快,人人可做

⚠️幻覺與 token

幻覺:LLM 本質是「依機率生成最可能的文字」,不是查證事實;缺乏對應知識時仍會自信地編造。用 RAG(接外部知識、要求引用來源)可降低。
token:模型處理的最小單位(常是子詞)。輸入輸出長度、計費、上下文視窗都以 token 計;中文一字常等於或多於一個 token,要注意上下文長度限制。

自我檢測

Q1. BERT 和 GPT 用 Transformer 的哪個部分?差在哪?
BERT 用 Encoder、雙向看左右,擅長「理解」(分類、問答、NER);GPT 用 Decoder、單向只看前文(Masked Attention),擅長「生成」(對話、續寫)。
Q2. 為什麼 Transformer 取代了 RNN?
RNN 必須循序、無法平行,長句還會梯度消失忘記開頭。Transformer 用自注意力一次看全句、可平行、長依賴強,因此成為主流。
Q3. 預訓練、微調、提示工程差在哪?
預訓練從零在大語料學通用能力(最貴);微調用特定資料再訓練、調權重讓模型專精;提示工程不改權重、只靠設計輸入引導既有模型(最輕量)。
Q4. LLM 為什麼會「幻覺」?怎麼降低?
它是依機率生成最可能的文字、不查證事實,缺知識時會自信編造。用 RAG 接外部知識、要求引用來源,或針對性微調,可以降低。

🎯重點整理

📝 iPAS 考點提醒

NLP 與 LLM 架構演進是 iPAS 中級科目一的脈絡考點。重點:從詞袋與 TF-IDF、詞向量(Word2Vec)、RNN 與 LSTM,到 Transformer 與大型語言模型(BERT、GPT),能力與規模一路躍升。易混點:RNN 循序、長依賴弱;Transformer 用自注意力可平行、長依賴強,是現代主流;LLM 是大的 Transformer。情境:理解技術演進、為何 Transformer 取代 RNN。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

大型語言模型(LLM)怎麼運作?

以 Transformer 為基礎,在海量文本上預訓練學習預測下一個 token,藉此習得語法、知識與推理樣式,再用於問答、摘要、生成等任務。

預訓練、微調、提示工程差在哪?

預訓練從零在大語料學通用能力(最貴);微調用特定資料再訓練調權重、讓模型專精某任務或風格;提示工程不改權重、只靠設計輸入引導既有模型。

為什麼 LLM 會幻覺?

它本質是依機率生成最可能的文字、不是查證事實;缺乏對應知識時仍會自信地編造。可用 RAG 接外部知識、要求引用來源來降低。

token 是什麼、為什麼重要?

模型處理的最小單位(常是子詞);輸入輸出長度、計費與上下文視窗都以 token 計。中文一字常等於或多於一個 token,要注意上下文長度限制。

怎麼讓 LLM 用到最新或私有知識?

不必重訓:用 RAG 把外部或私有文件檢索後放進提示,或做微調。RAG 適合常更新的知識且可附來源。

🧭 相關主題

← 返回 AI 學習與考證地圖