💡一句話定義
嵌入是現代 NLP、語意搜尋、推薦系統與 RAG 的共同底層——先把文字變向量,後面所有事情才做得下去。
🆚one-hot vs 詞嵌入
| 面向 | One-Hot 編碼 | 詞嵌入 Embedding |
|---|---|---|
| 維度 | 高維(=詞彙量),稀疏 | 低維(如 300 維),稠密 |
| 語意 | 任兩詞正交、距離都相同,看不出關係 | 語意相近者靠近,能表達相似度 |
| 類比 | 不行 | 能做「國王−男+女≈皇后」 |
| 怎麼來 | 直接指定(第 i 個為 1) | 從資料學出來 |
🎮互動:語意地圖
左圖是把詞向量投影到 2D 的語意空間(皇室、一般人、水果、硬體各成一群)。點兩個詞看相似度;按「King − Man + Woman ≈ ?」看兩條平行向量——性別關係對應到一致的向量位移。
🏗️嵌入是怎麼學來的?
用「上下文」學:常出現在相似句子裡的詞(Skip-gram/CBOW),向量就會變像。
分解全局的「共現矩陣」,同時考慮局部上下文與整體統計。
「你交的朋友決定你是誰」——詞的意義由它常見的鄰居定義。
📐餘弦相似度
比較兩個向量像不像,通常不看絕對距離,而看夾角——夾角越小越相似:
1=完全相同(重疊)、0=毫無關係(垂直)、−1=完全相反(背對背)。這也是語意搜尋、RAG 找「最相關片段」時用的度量。
🧮類比:向量會做算術
⚠️靜態 vs 情境式嵌入
🚀應用與 RAG 的關係
RAG 基礎:把文件切塊轉成嵌入、存進向量資料庫;查詢時把問題也轉成嵌入,用相似度找最相關片段——這正是 RAG 檢索的核心。
✅自我檢測
Q1. 詞嵌入和 one-hot 最大的差別?
Q2. 為什麼能做「國王−男+女≈皇后」?
Q3. 比較兩個嵌入向量像不像,用什麼?
Q4. 靜態嵌入和情境式嵌入差在哪?
🎯重點整理
- 是什麼:把詞變低維稠密向量,語意近者距離近。
- vs one-hot:稠密、有語意、可類比、可學習。
- 怎麼學:Word2Vec(上下文)、GloVe(共現矩陣)。
- 相似度:餘弦相似度(看夾角)。
- 靜態 vs 情境:Word2Vec 一詞一向量;BERT 依上下文變。
- 應用:推薦、翻譯、語意搜尋;向量資料庫+RAG 基礎。