✂️ Tokenization / BPE 斷詞視覺化

輸入文字,即時看不同斷詞方法如何切割

💡 白話說明

LLM(如 ChatGPT)不是直接讀「字」,而是先把文字切成一塊一塊的 Token,就像把積木拆開再處理:

📌 考試重點:Token 是 LLM 的最小處理單位。一個中文字 ≈ 1~2 token,一個英文字 ≈ 1~4 token。Context Window 就是一次能處理的 token 上限。
字元級 Character
詞級 Word
BPE (GPT 風格)
WordPiece (BERT 風格)
Token 數量
-
原始字元數
-
壓縮率
-
斷詞方法
-

🔤 斷詞結果

📊 四種方法比較

🧠 BPE 合併過程圖解

BPE 的核心思想:從最小單位(字元)開始,反覆合併最常出現的相鄰配對。

第 0 步:l o w e r → 5 個 token
第 1 步:l o w er → 4 個 token(e+r 最常出現,合併!)
第 2 步:l ow er → 3 個 token(o+w 次常出現,合併!)
第 3 步:low er → 2 個 token(l+ow 合併!)
第 4 步:lower → 1 個 token(low+er 合併!)

⚖️ 方法比較

方法 詞彙表大小 序列長度 OOV 問題 代表模型
字元級很小(~幾百)很長早期 NLP
詞級很大(~幾十萬)嚴重Word2Vec
BPE中等(~3~5萬)中等幾乎無GPT 系列
WordPiece中等(~3萬)中等幾乎無BERT

📝 iPAS 考點提醒

Tokenization 是 LLM 處理文字的第一步,iPAS 生成式 AI 考點(初級科目二、中級科目一)。重點:把文字切成 token,常用 BPE(位元組對編碼)把常見字組合併、罕見字拆小,平衡詞彙量與覆蓋率;token 數直接影響成本與上下文長度。易混點:token 不等於字或詞(一個中文字常是多個 token、一個英文詞可能拆成多個);長度限制以 token 計。情境:估算 API 成本與 context 是否塞得下。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

BPE(Byte Pair Encoding)是什麼?

一種子詞斷詞演算法:從字元開始,反覆把出現最頻繁的相鄰配對合併成新符號,逐步建出子詞詞表;常見詞成單一 token、罕見詞拆成子片段。

BPE 解決什麼問題?

平衡詞表大小與未登錄詞(OOV):詞級詞表太大且遇生詞無解,字級序列太長;BPE 折衷,讓任何詞都能由子詞組成。

BPE 怎麼運作(直覺)?

統計語料中相鄰符號對的頻率,把最常見的合併,重複到設定的詞表大小;高頻詞會被合成完整 token,低頻詞保留為較小片段。

BPE 和 WordPiece、SentencePiece 差在哪?

都是子詞法;WordPiece(BERT)用概似而非純頻率合併;SentencePiece 直接在含空白的原始文字上學、語言無關,適合中文等無空格語言。

為什麼現代 LLM 都用子詞?

子詞讓詞表可控、能處理任何輸入(新詞、拼錯、多語言),序列長度合理,是 GPT、BERT 等的標準做法。

🧭 相關主題

← 返回 AI 學習與考證地圖