NLP & Large Language Models

NLP 與 LLM

從「電腦看不懂人話」,到 ChatGPT 陪你聊天寫程式。
這是深度學習裡最波瀾壯闊的一場封神演義。

—— 犬蔥評論 · 演算法通天特輯

自然語言處理(NLP)的終極難題只有一個:人話太滑了。同一個字換個位置意思就變,一句反話能笑死人,「意思意思」到底是什麼意思?要讓機器搞懂這團混沌,人類走了幾十年。

而這一切在近幾年徹底爆發,靠的是一條清晰的演進鏈:先讓機器把字變成數字(詞嵌入),再讓它記住上下文(RNN),接著發明注意力機制,催生出改變世界的 Transformer,最後長成 BERT 與 GPT 兩大巨頭,一路狂奔到今天的 ChatGPT。

這集是整個系列最龐大的一章,我們分三段走:① 演進主線(技術怎麼一步步進化)、② 落地與工程(RAG、Agent 怎麼把它變好用)、③ 進階心法(Scaling、MoE、對齊、提示工程那些「內功」)。深呼吸,我們出發。

Part 01 · The Backbone

演進主線:機器如何學會人話

一條從「查字典」到「會聊天」的技術演進鏈。每一步,都是為了解決前一步的痛。

01

詞嵌入

Word Embedding
「把每個字變成一串座標——意思相近的字,住得也近。」

機器不懂文字,只懂數字。詞嵌入(Word2Vec、GloVe)的突破是:把每個字變成一個高維向量,而且讓「意思」有了幾何意義——「國王」和「皇后」離得近,甚至能玩「國王 − 男人 + 女人 ≈ 皇后」的數學魔術。

從此文字進入了「向量空間」,機器第一次擁有了對語意的粗淺直覺。這是整條演進鏈的地基。

02

RNN / LSTM

循環神經網路
「讀句子像讀書——一個字一個字看,還努力記住前面講過啥。」

語言是有順序的,「狗咬人」和「人咬狗」天差地遠。RNN 讓網路帶著記憶逐字閱讀,把前文的資訊傳給後文。但它記性差,句子一長就忘了開頭(梯度消失)

LSTM 加裝了「閘門」機制,學會了選擇性記憶與遺忘,撐住了較長的句子。它曾是 NLP 的主力,但有個死穴:只能一個字一個字排隊處理,慢,也難平行運算

評估指標 困惑度 Perplexity、BLEU(翻譯)、準確率
03

注意力機制

Attention
「讀到一個字時,自動把目光聚焦到句子裡真正相關的那幾個字。」

RNN 硬要把整句壓成一個記憶,太吃力。注意力機制說:不用死記——當前這個字該參考誰,就直接去「看」它。翻譯「它」的時候,模型會自動把注意力放回前文那個名詞上。

這個「動態聚焦」的想法,徹底解放了「記憶瓶頸」,也讓模型能一眼看遍全句。它是接下來那場革命的核心火種

04

Transformer

2017 · Attention Is All You Need
「乾脆把 RNN 整個丟掉,全部只用注意力——結果改變了整個 AI 世界。」

2017 年那篇《Attention Is All You Need》是現代 AI 的分水嶺。它大膽拋棄了逐字排隊的 RNN,純靠自注意力(Self-Attention),讓句子裡每個字同時、平行地互相「觀察」關係。

兩大威力:一是可大規模平行運算(終於能餵超大資料、堆超大模型);二是長距離依賴一步到位。今天你聽過的所有大模型——GPT、BERT、Claude、Gemini——內核全是它。

它是誰的祖宗 BERT、GPT 全長在 Transformer 上,只是一個用「編碼器」、一個用「解碼器」
05

BERT

Google · 雙向編碼器
「像做克漏字——遮住句中幾個字,逼模型看『前後文』一起猜。」

BERT 用的是 Transformer 的編碼器,強項是理解。它訓練時玩「克漏字」:把句子中間幾個字挖掉,讓模型同時看左右兩邊來猜答案(雙向)。這讓它對語意的掌握極深。

它擅長「讀懂再判斷」的任務——搜尋、分類、問答、情感分析。是理解派的一代宗師,也是 Google 搜尋背後的功臣。

評估指標 GLUE / SQuAD 分數、F1、準確率
06

GPT

OpenAI · 生成式預訓練
「只做一件事:猜下一個字——結果猜著猜著,就會聊天、寫程式、寫詩了。」

GPT 用的是 Transformer 的解碼器,強項是生成。它的訓練目標蠢到極致:看前文,預測下一個字。但當模型夠大、資料夠多,這個簡單目標竟「湧現」出對話、推理、寫程式等能力。

從 GPT-3 到 ChatGPT,它把 AI 從實驗室推進了每個人的手機。它是當今生成式 LLM 的絕對主流,也是這整章的高潮。

評估指標 困惑度、MMLU / 各類 Benchmark、人類偏好評測
模型煉成了,但它有兩個天生的病:
① 只知道「訓練時看過的東西」,會過時、會亂編(幻覺)。
② 你得會「跟它說話」,它才發揮得好。
於是,第二場戰役——「把它變好用」——開打了。
Part 02 · Making It Useful

落地與工程:把大模型變好用

模型本體只是引擎,真正讓它在企業裡跑起來、不亂講話、能動手做事的,是這一整套工程。

07

RAG

檢索增強生成
「開卷考試:回答前先去資料庫翻書,翻到再答,就不容易亂編。」

大模型會一本正經地胡說(幻覺),也不知道你公司的內部文件。RAG 的解法很聰明:回答前先去外部知識庫檢索相關資料,把找到的內容塞進提示裡,讓模型「照著書答」。

好處是答案有依據、可更新、可溯源,還不用重訓模型。這是企業導入 LLM 最主流、最務實的做法。

搭配零件 需要把文件轉成向量並存起來檢索 —— 這就要靠下面的向量資料庫
08

向量資料庫

Vector Database
「不靠關鍵字,而是靠『語意相似度』來找資料的新型倉庫。」

RAG 要能「找到相關的書」,靠的就是它。向量資料庫(Pinecone、Milvus、FAISS 等)把每份文件轉成向量存起來,查詢時用『意思接近』來檢索——你問「怎麼退款」,它能找到寫著「退貨流程」的段落,哪怕一個字都沒重疊。

它是 RAG、語意搜尋、推薦系統的記憶中樞,也是 LLM 時代新崛起的基礎設施。

09

工程演進

LLMOps / 系統工程
「模型只是零件,把它變成穩定產品,才是真正的硬仗。」

把 LLM 從 Demo 變成能扛流量的產品,中間全是工程:推論加速、量化壓縮、快取、成本控制、監控、安全防護。這門新學問常被叫做 LLMOps。

它決定了一個 AI 應用跑得快不快、貴不貴、穩不穩、安不安全——是把玩具變成生產力的關鍵最後一哩。

10

Agent 框架

LangChain / AutoGPT 之類
「給大模型裝上手腳和工具箱,讓它不只會說,還會自己動手做。」

光會聊天不夠,我們想要它能拆解任務、呼叫工具、自己一步步完成目標。Agent 框架(LangChain、LlamaIndex、AutoGen 等)就是那副骨架:把 LLM 當大腦,接上搜尋、計算、資料庫、API 當手腳。

它讓模型從「回答問題」升級成「執行任務」——這正是 AI Agent 浪潮的技術底座。

會用了,還想用得更好、更省、更聽話。
這就進入了大模型的「內功心法」——
怎麼把它練大、練省、練得對齊人心,又怎麼問對問題。
Part 03 · The Inner Arts

進階心法:把大模型練到極致

從「怎麼把模型變更強」到「怎麼讓它聽人話」,這一段是 LLM 的內功與哲學。

11

Scaling Laws

規模法則
「大力真的能出奇蹟——參數、資料、算力越大,模型越強,還能預測。」

Scaling Laws 是 LLM 時代最重要的發現之一:模型能力會隨著參數量、資料量、算力的增加而可預測地變強。這條規律給了各大公司「無腦堆大」的信心與依據。

它也解釋了「湧現能力」——某些本事,模型小的時候完全沒有,大到某個門檻突然就會了。這是 GPT 越做越大的理論支柱。

12

MoE 混合專家

Mixture of Experts
「養一整個專家團,但每個問題只請最對口的幾位出馬——省力又聰明。」

模型越大越貴。MoE 的巧思是:把網路拆成很多個「專家」子網路,每次輸入只動態啟用其中一小部分(例如 8 選 2)。這樣總參數量超大(很聰明),但每次實際運算量卻很小(很省)。

它讓模型能在「又大又便宜」之間取得平衡,是近年頂尖大模型(如 Mixtral、傳聞中的 GPT-4)的關鍵架構。

13

RLHF 對齊

人類回饋強化學習
「模型會說話,但不一定會『好好說話』——用人類的評分把它教乖。」

純預訓練的模型很聰明,但可能沒禮貌、答非所問、甚至講出危險內容。RLHF 就是那道「調教」工序:讓人類對模型的回答排序打分,再用強化學習(還記得上一集的 PPO 嗎?)把模型往人類偏好的方向微調

這叫「對齊」——讓模型的行為對齊人類的價值與意圖。ChatGPT 之所以好用又安全,這步是關鍵。

14

提示工程

Prompt Engineering
「同一個模型,會問的人拿到黃金,不會問的人拿到垃圾。」

大模型的表現,很大一部分取決於你怎麼問。提示工程就是「跟 AI 溝通的技術」:給清楚的角色、脈絡、範例、步驟指引(像 Few-shot、Chain-of-Thought 讓它「一步步想」),就能大幅拉高輸出品質。

它是門檻最低、CP 值最高的一項技能——不用改模型,只改問法,效果立刻天差地別

15

AI Agent

自主智慧代理
「不再是你問一句它答一句,而是給個目標,它自己規劃、執行、修正。」

AI Agent 是 LLM 的進階形態:把模型當「大腦」,讓它自己拆解目標 → 規劃步驟 → 呼叫工具 → 看結果 → 修正,循環直到完成任務。你說「幫我訂下週去東京的行程」,它會自己查機票、比飯店、排景點。

它代表 AI 從「會回答」邁向「會做事」,是當前最熱、也最具想像空間的方向。

16

AI 幻覺與評測

Hallucination & Evaluation
「它最危險的地方不是不會,而是——它會很有自信地『唬爛』。」

LLM 會生成聽起來超合理、其實是編的內容,這叫「幻覺」。因為它本質是「猜下一個字」的機率模型,追求的是通順,不是真實。這是它先天、難以根治的毛病。

所以「怎麼評測模型」變成一門大學問:從標準化考試(MMLU)、到人類偏好對戰(Chatbot Arena)、到用另一個強模型當裁判(LLM-as-Judge)。沒有好的評測,就管不住幻覺

呼應 這正是本系列開頭那集「為何 LLM 的幻覺永遠無法解決」的技術根源
Reality Check

那幾顆紅色的「評估指標」

圖裡 RNN、BERT、GPT 底下都掛著評估指標——因為語言模型「好不好」,比看圖辨貓難評太多了。

困惑度 Perplexity

衡量模型對語言的「意外程度」——越低代表它越不會被下一個字嚇到,語言掌握越好。

理解類 Benchmark

BERT 這種理解型看 GLUE、SQuAD;現代大模型則看 MMLU 等綜合學科考試。

生成類評測

翻譯用 BLEU、摘要用 ROUGE,但生成品質最終還是常靠人類偏好排序來定高下。

真實性最難測

通順不等於正確。幻覺、事實性是目前最棘手、也最需要 RAG 與人工把關的一環。