深度學習 · 自然語言處理

Word2Vec vs GloVe

兩種學「詞向量」的經典方法:一個邊看書邊猜下一個詞(預測型),一個先翻完全書再統計(統計型)。

預測型統計型滑動視窗共現矩陣詞向量

💡一句話定義

Word2VecGloVe 是兩種學習靜態詞向量的經典方法。Word2Vec(預測型)用神經網路在滑動視窗裡預測相鄰詞GloVe(統計型)先掃全語料建共現矩陣再降維。兩者都讓語意相近的詞,向量也相近。

🎮互動:兩種學法逐步看

切換分頁,按「下一步」:Word2Vec 用中心詞(紅)去預測周圍上下文(橘);GloVe 逐步統計相鄰詞的共同出現次數,把「共現矩陣」填起來。

詞嵌入模型視覺化
請點擊「下一步」開始觀察

⚖️預測型 vs 統計型對照

面向Word2Vec(預測型)GloVe(統計型)
核心哲學見微知著:局部滑動視窗預測相鄰詞統攬全局:先建共現矩陣再降維
怎麼學神經網路(Skip-gram/CBOW)對全局共現矩陣做矩陣分解
優點訓練快、擅長類比(國王−男+女≈女王)結合局部與全局統計,整體關係更穩
缺點只看局部、沒用到全局統計詞彙量大時共現矩陣吃記憶體

📚用「讀書法」來想

Word2Vec 像是邊看書邊猜下一個詞來學習——一路滑過句子,用中心詞猜周圍的字。GloVe 則是先把整本書翻完,統計好每個詞跟哪些詞一起出現幾次,再根據這張大表分析出詞向量。一個重「即時預測」,一個重「全局統計」。

🔗共通點與現代做法

兩者都產生靜態詞向量(一詞一向量)、都靠上下文學語意、相似度都常用餘弦。但它們無法區分多義詞(「蘋果」水果 vs 公司同一個向量)。現代 LLM 改用情境式嵌入(BERT、GPT)——同一個詞在不同句子有不同向量,已大幅取代靜態詞向量在下游任務的角色。

自我檢測

Q1. Word2Vec 和 GloVe 最根本的差別?
Word2Vec 是「預測型」——用神經網路在局部滑動視窗預測相鄰詞;GloVe 是「統計型」——先建全局共現矩陣再降維。前者重局部即時預測,後者重全局統計。
Q2. 各自的優缺點?
Word2Vec 訓練快、擅長類比,但沒用到全局統計;GloVe 結合局部與全局、整體關係更穩,但詞彙量大時共現矩陣吃記憶體。
Q3. 它們和現代 LLM 的嵌入差在哪?
Word2Vec/GloVe 是靜態詞向量(一詞一向量),無法區分多義;現代 LLM 用情境式嵌入,同一詞在不同句子有不同向量,能依上下文表達不同意思。
Q4. 比較兩個詞向量像不像,用什麼?
最常用餘弦相似度(看方向夾角、不受向量長度影響),也可用內積或歐氏距離。

🎯重點整理

📝 iPAS 考點提醒

詞嵌入(Embedding)把文字或資料映射成稠密向量,讓語意相近者在向量空間也相近,iPAS 生成式 AI 與檢索考點(初級科目二、中級科目一)。重點:比 one-hot 省維度又能表達語意關係(國王減男人加女人約等於女王),是語意搜尋與 RAG 的基礎。易混點:嵌入是表示法、不是模型本身;相似度多用餘弦(看方向、不受長度影響)。情境:語意搜尋、推薦、分群、RAG 檢索。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

嵌入(Embedding)是什麼?

把文字、影像等離散或高維資料映射成稠密的低維向量,讓語意相近的東西在向量空間中也相近。

為什麼需要嵌入?

機器學習要數值輸入;嵌入比 one-hot 更省維度、能表達語意關係(如國王減男人加女人約等於女王),利於下游任務。

嵌入怎麼學出來?

透過任務訓練得到,如 Word2Vec、GloVe 學詞向量,或用神經網路(含 Transformer)從上下文學;相似上下文產生相似向量。

怎麼衡量兩個向量相似?

最常用餘弦相似度(看方向夾角),也用內積或歐氏距離;餘弦對長度不敏感、適合語意比較。

嵌入有哪些應用?

語意搜尋、推薦、分群、相似度比對,以及 RAG 檢索;向量資料庫就是用來高效查詢嵌入的最近鄰。

🧭 相關主題

← 返回 AI 學習與考證地圖