從「電腦看不懂人話」,到 ChatGPT 陪你聊天寫程式。
這是深度學習裡最波瀾壯闊的一場封神演義。
自然語言處理(NLP)的終極難題只有一個:人話太滑了。同一個字換個位置意思就變,一句反話能笑死人,「意思意思」到底是什麼意思?要讓機器搞懂這團混沌,人類走了幾十年。
而這一切在近幾年徹底爆發,靠的是一條清晰的演進鏈:先讓機器把字變成數字(詞嵌入),再讓它記住上下文(RNN),接著發明注意力機制,催生出改變世界的 Transformer,最後長成 BERT 與 GPT 兩大巨頭,一路狂奔到今天的 ChatGPT。
這集是整個系列最龐大的一章,我們分三段走:① 演進主線(技術怎麼一步步進化)、② 落地與工程(RAG、Agent 怎麼把它變好用)、③ 進階心法(Scaling、MoE、對齊、提示工程那些「內功」)。深呼吸,我們出發。
一條從「查字典」到「會聊天」的技術演進鏈。每一步,都是為了解決前一步的痛。
機器不懂文字,只懂數字。詞嵌入(Word2Vec、GloVe)的突破是:把每個字變成一個高維向量,而且讓「意思」有了幾何意義——「國王」和「皇后」離得近,甚至能玩「國王 − 男人 + 女人 ≈ 皇后」的數學魔術。
從此文字進入了「向量空間」,機器第一次擁有了對語意的粗淺直覺。這是整條演進鏈的地基。
語言是有順序的,「狗咬人」和「人咬狗」天差地遠。RNN 讓網路帶著記憶逐字閱讀,把前文的資訊傳給後文。但它記性差,句子一長就忘了開頭(梯度消失)。
LSTM 加裝了「閘門」機制,學會了選擇性記憶與遺忘,撐住了較長的句子。它曾是 NLP 的主力,但有個死穴:只能一個字一個字排隊處理,慢,也難平行運算。
RNN 硬要把整句壓成一個記憶,太吃力。注意力機制說:不用死記——當前這個字該參考誰,就直接去「看」它。翻譯「它」的時候,模型會自動把注意力放回前文那個名詞上。
這個「動態聚焦」的想法,徹底解放了「記憶瓶頸」,也讓模型能一眼看遍全句。它是接下來那場革命的核心火種。
2017 年那篇《Attention Is All You Need》是現代 AI 的分水嶺。它大膽拋棄了逐字排隊的 RNN,純靠自注意力(Self-Attention),讓句子裡每個字同時、平行地互相「觀察」關係。
兩大威力:一是可大規模平行運算(終於能餵超大資料、堆超大模型);二是長距離依賴一步到位。今天你聽過的所有大模型——GPT、BERT、Claude、Gemini——內核全是它。
BERT 用的是 Transformer 的編碼器,強項是理解。它訓練時玩「克漏字」:把句子中間幾個字挖掉,讓模型同時看左右兩邊來猜答案(雙向)。這讓它對語意的掌握極深。
它擅長「讀懂再判斷」的任務——搜尋、分類、問答、情感分析。是理解派的一代宗師,也是 Google 搜尋背後的功臣。
GPT 用的是 Transformer 的解碼器,強項是生成。它的訓練目標蠢到極致:看前文,預測下一個字。但當模型夠大、資料夠多,這個簡單目標竟「湧現」出對話、推理、寫程式等能力。
從 GPT-3 到 ChatGPT,它把 AI 從實驗室推進了每個人的手機。它是當今生成式 LLM 的絕對主流,也是這整章的高潮。
模型本體只是引擎,真正讓它在企業裡跑起來、不亂講話、能動手做事的,是這一整套工程。
大模型會一本正經地胡說(幻覺),也不知道你公司的內部文件。RAG 的解法很聰明:回答前先去外部知識庫檢索相關資料,把找到的內容塞進提示裡,讓模型「照著書答」。
好處是答案有依據、可更新、可溯源,還不用重訓模型。這是企業導入 LLM 最主流、最務實的做法。
RAG 要能「找到相關的書」,靠的就是它。向量資料庫(Pinecone、Milvus、FAISS 等)把每份文件轉成向量存起來,查詢時用『意思接近』來檢索——你問「怎麼退款」,它能找到寫著「退貨流程」的段落,哪怕一個字都沒重疊。
它是 RAG、語意搜尋、推薦系統的記憶中樞,也是 LLM 時代新崛起的基礎設施。
把 LLM 從 Demo 變成能扛流量的產品,中間全是工程:推論加速、量化壓縮、快取、成本控制、監控、安全防護。這門新學問常被叫做 LLMOps。
它決定了一個 AI 應用跑得快不快、貴不貴、穩不穩、安不安全——是把玩具變成生產力的關鍵最後一哩。
光會聊天不夠,我們想要它能拆解任務、呼叫工具、自己一步步完成目標。Agent 框架(LangChain、LlamaIndex、AutoGen 等)就是那副骨架:把 LLM 當大腦,接上搜尋、計算、資料庫、API 當手腳。
它讓模型從「回答問題」升級成「執行任務」——這正是 AI Agent 浪潮的技術底座。
從「怎麼把模型變更強」到「怎麼讓它聽人話」,這一段是 LLM 的內功與哲學。
Scaling Laws 是 LLM 時代最重要的發現之一:模型能力會隨著參數量、資料量、算力的增加而可預測地變強。這條規律給了各大公司「無腦堆大」的信心與依據。
它也解釋了「湧現能力」——某些本事,模型小的時候完全沒有,大到某個門檻突然就會了。這是 GPT 越做越大的理論支柱。
模型越大越貴。MoE 的巧思是:把網路拆成很多個「專家」子網路,每次輸入只動態啟用其中一小部分(例如 8 選 2)。這樣總參數量超大(很聰明),但每次實際運算量卻很小(很省)。
它讓模型能在「又大又便宜」之間取得平衡,是近年頂尖大模型(如 Mixtral、傳聞中的 GPT-4)的關鍵架構。
純預訓練的模型很聰明,但可能沒禮貌、答非所問、甚至講出危險內容。RLHF 就是那道「調教」工序:讓人類對模型的回答排序打分,再用強化學習(還記得上一集的 PPO 嗎?)把模型往人類偏好的方向微調。
這叫「對齊」——讓模型的行為對齊人類的價值與意圖。ChatGPT 之所以好用又安全,這步是關鍵。
大模型的表現,很大一部分取決於你怎麼問。提示工程就是「跟 AI 溝通的技術」:給清楚的角色、脈絡、範例、步驟指引(像 Few-shot、Chain-of-Thought 讓它「一步步想」),就能大幅拉高輸出品質。
它是門檻最低、CP 值最高的一項技能——不用改模型,只改問法,效果立刻天差地別。
AI Agent 是 LLM 的進階形態:把模型當「大腦」,讓它自己拆解目標 → 規劃步驟 → 呼叫工具 → 看結果 → 修正,循環直到完成任務。你說「幫我訂下週去東京的行程」,它會自己查機票、比飯店、排景點。
它代表 AI 從「會回答」邁向「會做事」,是當前最熱、也最具想像空間的方向。
LLM 會生成聽起來超合理、其實是編的內容,這叫「幻覺」。因為它本質是「猜下一個字」的機率模型,追求的是通順,不是真實。這是它先天、難以根治的毛病。
所以「怎麼評測模型」變成一門大學問:從標準化考試(MMLU)、到人類偏好對戰(Chatbot Arena)、到用另一個強模型當裁判(LLM-as-Judge)。沒有好的評測,就管不住幻覺。
圖裡 RNN、BERT、GPT 底下都掛著評估指標——因為語言模型「好不好」,比看圖辨貓難評太多了。
衡量模型對語言的「意外程度」——越低代表它越不會被下一個字嚇到,語言掌握越好。
BERT 這種理解型看 GLUE、SQuAD;現代大模型則看 MMLU 等綜合學科考試。
翻譯用 BLEU、摘要用 ROUGE,但生成品質最終還是常靠人類偏好排序來定高下。
通順不等於正確。幻覺、事實性是目前最棘手、也最需要 RAG 與人工把關的一環。