深度學習 · 自然語言處理

Word2Vec:CBOW vs Skip-gram

同樣是滑動視窗學詞向量,CBOW 用上下文猜中心詞、Skip-gram 用中心詞猜上下文——關鍵在「罕見詞能拿到多少訓練訊號」。

上下文預測CBOW 多對一Skip-gram 一對多罕見詞子詞 FastText

💡一句話定義

Word2Vec 用「上下文預測」學詞向量,有兩種架構:CBOW上下文預測中心詞(多對一,快、對常見詞好);Skip-gram中心詞預測上下文(一對多,慢、對罕見詞與小語料較好)。

🎮互動:罕見詞「貔貅」拿到幾次更新

切換 CBOW / Skip-gram,按「下一步」滑動視窗。留意當中心詞是罕見詞「貔貅」時:CBOW 只累加 1 次更新;Skip-gram 對每個上下文詞各產生一次更新(+N)——罕見詞因此拿到更多訓練訊號。

罕見詞的魔鬼訓練:CBOW vs Skip-gram
中心詞 (Target) 上下文詞 (Context)
目前設定:視窗大小 (Window Size) = 2

💎 罕見詞「貔貅」累積更新次數

0

點擊下一步開始觀察

⚖️CBOW vs Skip-gram 對照

面向CBOW(多對一)Skip-gram(一對多)
預測方向上下文 → 中心詞中心詞 → 每個上下文詞
速度較快(上下文平均後一次預測)較慢(每個上下文各一次)
常見詞表現好也不錯
罕見詞 / 小語料易被強勢詞淹沒較好(罕見詞拿到更多更新)

💪為什麼 Skip-gram 對罕見詞好?

CBOW:上下文特徵被平均後才預測中心詞,罕見詞的微弱訊號容易被旁邊的強勢常見詞淹沒,罕見詞當中心詞時只獲得「1 次整體更新」。Skip-gram:罕見詞當中心詞時,要獨自預測周圍每一個詞,有幾個上下文詞就產生幾次獨立的誤差回傳——罕見詞因此得到成倍的訓練訊號,向量學得更好。

🩹罕見詞問題與解法

📉問題
罕見詞出現太少、缺上下文,向量品質差、不穩定。
🧩子詞嵌入
FastText 用字元 n-gram 組成詞向量,連沒見過的詞也能推。
📚更多語料
擴充資料量,讓罕見詞多出現幾次。
🧠情境式嵌入
改用現代 LLM 的上下文嵌入,罕見詞也能靠上下文推。

⚠️靜態 vs 情境式

Word2Vec 是靜態詞向量——一個詞只有一個固定向量,無法區分多義(「蘋果」水果與公司同一個向量)。現代 LLM 用情境式嵌入:同一個詞在不同句子有不同向量,更能處理一詞多義。Word2Vec 仍是理解嵌入原理的經典起點。

自我檢測

Q1. CBOW 和 Skip-gram 的預測方向差在哪?
CBOW 用「上下文預測中心詞」(多對一);Skip-gram 用「中心詞預測每個上下文詞」(一對多)。前者快、後者慢但對罕見詞好。
Q2. 為什麼 Skip-gram 對罕見詞比較有利?
罕見詞當中心詞時,Skip-gram 要獨自預測周圍每一個詞,有幾個上下文就有幾次獨立更新;CBOW 只累加 1 次整體更新,罕見詞訊號還會被平均淹沒。
Q3. 罕見詞嵌入差怎麼改善?
用子詞嵌入(如 FastText 以字元 n-gram 組成、能推未見詞)、擴充語料,或改用現代 LLM 的情境式嵌入。
Q4. Word2Vec 和現代情境嵌入最大差別?
Word2Vec 是靜態嵌入(一詞一固定向量、無法區分多義);現代 LLM 是情境式(同詞在不同句子向量不同),更能處理一詞多義。

🎯重點整理

📝 iPAS 考點提醒

Word2Vec 是經典詞向量方法,iPAS 嵌入概念考點(中級科目一)。重點:用上下文預測詞(CBOW)或用詞預測上下文(Skip-gram)學出詞向量,使語意相近的詞向量相近。易混點:Word2Vec 是靜態詞向量(一詞一向量、無法分辨多義),與 BERT 的上下文相依嵌入不同;罕見詞樣本少、向量品質差,子詞法(如 FastText)可改善。情境:理解嵌入演進與多義詞問題。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

Word2Vec 是什麼?

經典的詞嵌入方法,用上下文預測學每個詞的稠密向量,讓語意相近的詞向量也相近;有 CBOW 與 Skip-gram 兩種架構。

CBOW 和 Skip-gram 差在哪?

CBOW 用上下文預測中心詞(快、對常見詞好);Skip-gram 用中心詞預測上下文(慢、對罕見詞與小語料較好)。

為什麼罕見詞的嵌入較差?

罕見詞在語料中出現太少、缺乏足夠上下文來學好向量,品質與穩定性都較差,影響下游表現。

怎麼改善罕見詞問題?

用子詞嵌入(如 FastText 以字元 n-gram 組成詞向量、能推未見詞)、提高語料,或改用情境式嵌入(現代 LLM)。

Word2Vec 和現代情境嵌入差在哪?

Word2Vec 是靜態嵌入(一詞一固定向量、無法區分多義);現代 LLM 是情境式(同詞在不同句子向量不同),更能處理一詞多義。

🧭 相關主題

← 返回 AI 學習與考證地圖