深度學習 · 自然語言處理

詞嵌入 Word Embedding

把每個詞變成一串數字(向量),讓「意思相近的詞」在空間裡靠在一起——電腦這才第一次「懂」了語意。

稠密向量語意相近→距離近one-hot 對比餘弦相似度King−Man+Woman

💡一句話定義

詞嵌入(Word Embedding)= 把詞(或物件)表示成低維稠密向量,讓語意相近的詞,在向量空間的距離也相近。這樣模型就能用「數值」的方式處理語意。

嵌入是現代 NLP、語意搜尋、推薦系統與 RAG 的共同底層——先把文字變向量,後面所有事情才做得下去。

🆚one-hot vs 詞嵌入

面向One-Hot 編碼詞嵌入 Embedding
維度高維(=詞彙量),稀疏低維(如 300 維),稠密
語意任兩詞正交、距離都相同,看不出關係語意相近者靠近,能表達相似度
類比不行能做「國王−男+女≈皇后」
怎麼來直接指定(第 i 個為 1)從資料出來
直覺:one-hot 像「每個詞發一個獨立編號」,彼此毫無關聯;嵌入像「把詞擺進一張語意地圖」,位置就帶著意義。

🎮互動:語意地圖

左圖是把詞向量投影到 2D 的語意空間(皇室、一般人、水果、硬體各成一群)。點兩個詞看相似度;按「King − Man + Woman ≈ ?」看兩條平行向量——性別關係對應到一致的向量位移

詞嵌入 (Word Embedding) 互動演示
選取狀態 (Selected):
請點擊左側圓點選取 2 個詞
當前詞彙向量 (Vector):
[?, ?]
展示向量算術特性:男人之於國王,如同女人之於皇后。

🏗️嵌入是怎麼學來的?

🪟Word2Vec
用「上下文」學:常出現在相似句子裡的詞(Skip-gram/CBOW),向量就會變像。
🌐GloVe
分解全局的「共現矩陣」,同時考慮局部上下文與整體統計。
🧠上下文決定語意
「你交的朋友決定你是誰」——詞的意義由它常見的鄰居定義。

📐餘弦相似度

比較兩個向量像不像,通常不看絕對距離,而看夾角——夾角越小越相似:

similarity = cos θ = (A · B) / ( |A| · |B| )

1=完全相同(重疊)、0=毫無關係(垂直)、−1=完全相反(背對背)。這也是語意搜尋、RAG 找「最相關片段」時用的度量。

🧮類比:向量會做算術

訓練後,某些語意屬性(性別、時態、單複數)會對應到一致的向量位移。所以 King − Man + Woman ≈ Queen:從 Man 到 King 的向量,跟從 Woman 到 Queen 的向量幾乎一樣長、一樣方向。這是詞嵌入最驚豔的性質。

⚠️靜態 vs 情境式嵌入

靜態(Word2Vec、GloVe):一個詞只有一個向量——「蘋果」不管指水果還是公司都同一個向量。情境式(BERT、GPT 等):同一個詞在不同句子有不同向量,能區分「吃蘋果」與「買蘋果股票」。現代 LLM 用的是情境式嵌入。

🚀應用與 RAG 的關係

應用:推薦系統(找向量最近的商品)、機器翻譯、情感分析、語意搜尋、分群。
RAG 基礎:把文件切塊轉成嵌入、存進向量資料庫;查詢時把問題也轉成嵌入,用相似度找最相關片段——這正是 RAG 檢索的核心。

自我檢測

Q1. 詞嵌入和 one-hot 最大的差別?
one-hot 高維稀疏、任兩詞正交(距離都相同、看不出關係);嵌入低維稠密,語意相近者向量也相近,能表達相似度與類比,且是從資料學出來的。
Q2. 為什麼能做「國王−男+女≈皇后」?
訓練讓語意屬性(如性別)對應到一致的向量位移,所以能用向量加減做類比:Man→King 的位移 ≈ Woman→Queen 的位移。
Q3. 比較兩個嵌入向量像不像,用什麼?
常用餘弦相似度,看兩向量的夾角:cos θ = A·B / (|A||B|)。1 完全相同、0 無關、−1 相反。
Q4. 靜態嵌入和情境式嵌入差在哪?
靜態(Word2Vec)一詞一向量,無法區分多義;情境式(BERT)同一詞在不同句子有不同向量,能依上下文表達不同意思。

🎯重點整理

📝 iPAS 考點提醒

詞嵌入(Embedding)把文字映射成稠密向量,讓語意相近者向量也相近,iPAS 生成式 AI 與檢索考點(初級科目二、中級科目一)。重點:比 one-hot 省維度又能表達語意關係,是語意搜尋與 RAG 的基礎。易混點:嵌入是表示法、不是模型;靜態詞向量(Word2Vec,一詞一向量)與上下文相依嵌入(BERT)不同;相似度多用餘弦。情境:語意搜尋、推薦、分群、RAG。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

詞嵌入(Embedding)是什麼?

把詞或物件表示成稠密向量,使語意相近者在向量空間距離也相近,讓模型能用數值方式處理語意。

和 one-hot 編碼差在哪?

one-hot 高維稀疏、彼此正交(任兩詞距離都相同、無語意);嵌入低維稠密、能表達相似度與類比關係且可學習。

為什麼能做「國王 - 男 + 女 ≈ 皇后」?

訓練讓語意關係對應到向量方向,某些屬性(性別、時態)呈現為一致的向量位移,因此可用向量加減做類比。

詞嵌入怎麼來的?

經典如 Word2Vec、GloVe 用上下文預測學靜態向量;現代 LLM 用情境式嵌入(同一詞在不同句子向量不同),於模型訓練時一起學。

嵌入和向量資料庫、RAG 的關係?

把文件切塊轉成嵌入存入向量資料庫,查詢時把問題也轉成嵌入、用相似度找最相關片段,這正是 RAG 檢索的核心。

🧭 相關主題

← 返回 AI 學習與考證地圖