輸入文字,即時看不同斷詞方法如何切割
LLM(如 ChatGPT)不是直接讀「字」,而是先把文字切成一塊一塊的 Token,就像把積木拆開再處理:
BPE 的核心思想:從最小單位(字元)開始,反覆合併最常出現的相鄰配對。
| 方法 | 詞彙表大小 | 序列長度 | OOV 問題 | 代表模型 |
|---|---|---|---|---|
| 字元級 | 很小(~幾百) | 很長 | 無 | 早期 NLP |
| 詞級 | 很大(~幾十萬) | 短 | 嚴重 | Word2Vec |
| BPE | 中等(~3~5萬) | 中等 | 幾乎無 | GPT 系列 |
| WordPiece | 中等(~3萬) | 中等 | 幾乎無 | BERT |
Tokenization 是 LLM 處理文字的第一步,iPAS 生成式 AI 考點(初級科目二、中級科目一)。重點:把文字切成 token,常用 BPE(位元組對編碼)把常見字組合併、罕見字拆小,平衡詞彙量與覆蓋率;token 數直接影響成本與上下文長度。易混點:token 不等於字或詞(一個中文字常是多個 token、一個英文詞可能拆成多個);長度限制以 token 計。情境:估算 API 成本與 context 是否塞得下。
想練情境題與詳解 → AI 學習與考證地圖
一種子詞斷詞演算法:從字元開始,反覆把出現最頻繁的相鄰配對合併成新符號,逐步建出子詞詞表;常見詞成單一 token、罕見詞拆成子片段。
平衡詞表大小與未登錄詞(OOV):詞級詞表太大且遇生詞無解,字級序列太長;BPE 折衷,讓任何詞都能由子詞組成。
統計語料中相鄰符號對的頻率,把最常見的合併,重複到設定的詞表大小;高頻詞會被合成完整 token,低頻詞保留為較小片段。
都是子詞法;WordPiece(BERT)用概似而非純頻率合併;SentencePiece 直接在含空白的原始文字上學、語言無關,適合中文等無空格語言。
子詞讓詞表可控、能處理任何輸入(新詞、拼錯、多語言),序列長度合理,是 GPT、BERT 等的標準做法。