cl100k_base 分詞規則。在 LLM 的世界裡,文字是被切成一塊塊的「Token」來處理的:
(2) 或 (3) 代表這單一個字,在底層被切成了 2 到 3 個 Token!(滑鼠移到方塊上可查看真實的 Token ID)⚠️ 這解釋了為什麼處理中文時,Token 消耗量通常是英文的 1.5 ~ 2 倍以上,會花費更多 API 成本,也會更快耗盡模型的記憶力(Context Window)。
Tokenization 是 LLM 處理文字的第一步,iPAS 生成式 AI 考點(初級科目二、中級科目一)。重點:把文字切成 token,常用 BPE 把常見字組合併、罕見字拆小;token 數直接影響 API 成本與上下文長度限制。易混點:token 不等於字或詞(一個中文字常是多個 token);長度上限以 token 計、不是字數。情境:估算成本、判斷長文是否塞得進 context。
想練情境題與詳解 → AI 學習與考證地圖
模型處理文字的最小單位,通常是子詞(subword)——介於字與詞之間的片段;模型不是逐字、也不是逐詞,而是逐 token 處理。
純字粒度太細、序列太長;純詞會有龐大詞表與未登錄詞(OOV)問題。子詞(如 BPE)折衷:常見詞當一個 token、罕見詞拆成子片段。
LLM 的上下文長度、計費、效能都以 token 計;輸入太長會超出上下文視窗。中文一個字常等於或多於一個 token,要留意。
英文常以空格與子詞切;中文無空格、常以字或子詞為單位,通常一個中文字的 token 成本比英文單字高。
會;切法影響序列長度、罕見詞處理與語意保留。不同模型用不同 tokenizer,跨模型比較 token 數要注意。