Token 怎麼切?視覺化工具

💡 關於右上角的數字代表什麼?
這個工具使用了與 GPT-4 相同的 cl100k_base 分詞規則。在 LLM 的世界裡,文字是被切成一塊塊的「Token」來處理的:

⚠️ 這解釋了為什麼處理中文時,Token 消耗量通常是英文的 1.5 ~ 2 倍以上,會花費更多 API 成本,也會更快耗盡模型的記憶力(Context Window)。

載入 Tokenizer 字典中... (請確保透過 Local Server 開啟,如 VS Code Live Server)

📝 iPAS 考點提醒

Tokenization 是 LLM 處理文字的第一步,iPAS 生成式 AI 考點(初級科目二、中級科目一)。重點:把文字切成 token,常用 BPE 把常見字組合併、罕見字拆小;token 數直接影響 API 成本與上下文長度限制。易混點:token 不等於字或詞(一個中文字常是多個 token);長度上限以 token 計、不是字數。情境:估算成本、判斷長文是否塞得進 context。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

Token 是什麼?

模型處理文字的最小單位,通常是子詞(subword)——介於字與詞之間的片段;模型不是逐字、也不是逐詞,而是逐 token 處理。

為什麼不用字或詞當單位?

純字粒度太細、序列太長;純詞會有龐大詞表與未登錄詞(OOV)問題。子詞(如 BPE)折衷:常見詞當一個 token、罕見詞拆成子片段。

Token 數為什麼重要?

LLM 的上下文長度、計費、效能都以 token 計;輸入太長會超出上下文視窗。中文一個字常等於或多於一個 token,要留意。

中文和英文的 tokenization 差在哪?

英文常以空格與子詞切;中文無空格、常以字或子詞為單位,通常一個中文字的 token 成本比英文單字高。

斷詞影響模型表現嗎?

會;切法影響序列長度、罕見詞處理與語意保留。不同模型用不同 tokenizer,跨模型比較 token 數要注意。

🧭 相關主題

← 返回 AI 學習與考證地圖