💡一句話定義
Word2Vec 與 GloVe 是兩種學習靜態詞向量的經典方法。Word2Vec(預測型)用神經網路在滑動視窗裡預測相鄰詞;GloVe(統計型)先掃全語料建共現矩陣再降維。兩者都讓語意相近的詞,向量也相近。
🎮互動:兩種學法逐步看
切換分頁,按「下一步」:Word2Vec 用中心詞(紅)去預測周圍上下文(橘);GloVe 逐步統計相鄰詞的共同出現次數,把「共現矩陣」填起來。
詞嵌入模型視覺化
請點擊「下一步」開始觀察
⚖️預測型 vs 統計型對照
| 面向 | Word2Vec(預測型) | GloVe(統計型) |
|---|---|---|
| 核心哲學 | 見微知著:局部滑動視窗預測相鄰詞 | 統攬全局:先建共現矩陣再降維 |
| 怎麼學 | 神經網路(Skip-gram/CBOW) | 對全局共現矩陣做矩陣分解 |
| 優點 | 訓練快、擅長類比(國王−男+女≈女王) | 結合局部與全局統計,整體關係更穩 |
| 缺點 | 只看局部、沒用到全局統計 | 詞彙量大時共現矩陣吃記憶體 |
📚用「讀書法」來想
🔗共通點與現代做法
兩者都產生靜態詞向量(一詞一向量)、都靠上下文學語意、相似度都常用餘弦。但它們無法區分多義詞(「蘋果」水果 vs 公司同一個向量)。現代 LLM 改用情境式嵌入(BERT、GPT)——同一個詞在不同句子有不同向量,已大幅取代靜態詞向量在下游任務的角色。
✅自我檢測
Q1. Word2Vec 和 GloVe 最根本的差別?
Word2Vec 是「預測型」——用神經網路在局部滑動視窗預測相鄰詞;GloVe 是「統計型」——先建全局共現矩陣再降維。前者重局部即時預測,後者重全局統計。
Q2. 各自的優缺點?
Word2Vec 訓練快、擅長類比,但沒用到全局統計;GloVe 結合局部與全局、整體關係更穩,但詞彙量大時共現矩陣吃記憶體。
Q3. 它們和現代 LLM 的嵌入差在哪?
Word2Vec/GloVe 是靜態詞向量(一詞一向量),無法區分多義;現代 LLM 用情境式嵌入,同一詞在不同句子有不同向量,能依上下文表達不同意思。
Q4. 比較兩個詞向量像不像,用什麼?
最常用餘弦相似度(看方向夾角、不受向量長度影響),也可用內積或歐氏距離。
🎯重點整理
- Word2Vec:預測型,滑動視窗預測相鄰詞,快、擅類比。
- GloVe:統計型,共現矩陣+降維,全局關係穩。
- 比喻:邊看邊猜 vs 翻完全書再統計。
- 共通:靜態詞向量、靠上下文、相似度用餘弦。
- 現代:情境式嵌入(BERT/GPT)已大幅取代靜態詞向量。