A.I. TRUTH · 中文比較吃虧這件事

為什麼同一句話,
中文切出來的 token 比英文多?

同樣的意思,中文常常要多花錢、又更快撐爆視窗。

往下捲,聽我唸給你聽
🎤

先講在前面:AI 讀字之前,會先把句子「切」成一塊塊小單位(token),按 token 數算錢、算長度。
而同一個意思,用中文講,切出來的 token 往往比英文多——這不是錯覺,是中文使用者實實在在的一個吃虧。
不信?我唸四個給你聽。

PART 01

這個吃虧,長這樣

01 吃虧是——

同一句「我今天很開心」跟它的英文版,意思一模一樣,
丟進去一切,中文那句的 token 數,常常比英文多出一截——一樣的話,中文卻切得更碎、算得更多。

02 吃虧是——

英文一個常見的單字,像 "happy",往往「一整個字就是一個 token」,
中文的「開心」兩個字,卻可能被拆成好幾塊——同樣表達一個概念,英文一口吞,中文卻要嚼好幾下。

03 吃虧是——

你按 token 計費,同一份文件翻成中英兩版,
中文那版的帳單,往往就是比英文貴——不是你講得比較多,是你講的每一個意思,被切成了更多要收費的小塊。

04 吃虧是——

視窗上限也一樣按 token 算,
同樣一份長文,中文版更快撐爆那個上限——英文還游刃有餘,中文卻已經滿了,連能塞的內容,都硬生生少了一截。

💬

看到這裡你可能會問:中文字明明比英文精簡,一個字頂人家好幾個字母,怎麼反而切得更多?
關鍵就在——「切法」這把刀,當初是照著英文的身材量身打造的,中文只是那個沒被好好照顧到的客人。
來看原理,這段有點料。

PART 02

為什麼中文切得更多?

01 原因是——

那把「切詞的刀」(tokenizer),是拿海量的文字餵出來、統計出來的——而那堆訓練文字,絕大多數是英文,
刀看英文看得最多、最熟,於是它把英文常見的字、詞根,一個個「收編成一整塊」,切起來又快又省。
中文因為在訓練資料裡份量少,
這把刀對它不夠熟、沒幫它把常用詞收編成整塊——結果同樣的意思,英文一刀切一塊,中文卻被剁成了好幾塊。

02 原因是——

更底層的原因是——中文字在電腦裡,每一個字都要用比較多的「位元組」來存,
英文字母一個大多只佔一個位元組,一個中文字卻常要三個;當刀認不得這個中文字時,只好退回去「按位元組硬切」,一個字就這樣被拆成了兩三塊碎片。
它不是故意為難中文,
是碰到不熟的字,它就退回最笨的切法——而中文字「體積」天生比較大,一退回去按位元組切,token 數就嘩啦啦地翻上去了。

03 原因是——

英文還有個天生優勢——單字之間有「空格」,天然就幫刀畫好了切線,
刀一看空格就知道「這裡是一個詞的邊界」,切得乾淨俐落;中文一長串黏在一起、沒有空格,刀要自己猜哪裡該斷,猜不準就切得零碎。
沒有現成的邊界可循,
刀只好保守地、一小塊一小塊地切——這一保守,同樣的內容,自然就被切出了更多、更零碎的 token 出來。

04 原因是——

說到底,這是一個「誰的資料多,刀就對誰好」的結構性偏心,
不是中文比較笨、比較沒效率,是這套技術從出生那天起,就是照著英文的需求去打磨的——中文、還有很多其他語言,都是這場遊戲裡先天吃虧的一方。
刀的偏心,是資料的偏心,
而資料的偏心,又是整個網路、整個世界話語權分布的縮影——中文的這個「吃虧」,底下藏的其實是一個更大的、關於公平的故事。

💬

好,原理你懂了:切詞的刀是照英文打造的,加上中文字體積大、又沒空格幫忙——三個原因湊起來,中文就吃了虧。
那很多人會問——「那身為中文使用者,我豈不是只能認命多付錢、多吃虧?」
嗯……有些地方能自救,往下看。

PART 03

那中文使用者,只能認命嗎?

01 答案是——

你可能有點不平——憑什麼講中文就要多付錢、又更快滿?
難道我只能默默接受這個吃虧,一點辦法都沒有、只能認命地被多切、多收嗎?

02 答案是——

好消息是——這件事正在慢慢變好,
越新、越重視多語言的模型,會刻意在訓練切詞的刀時,餵進更多中文和各國語言,讓那把刀對中文也越來越熟、切得越來越省。
差距沒消失,但在縮小,
所以選工具的時候,可以留意一下——那些主打多語言、對中文友善的模型,往往就能幫你把這個先天的吃虧,補回來一部分。

03 答案是——

而你自己也有能省的地方——「把話講精簡,別為了湊字數而囉嗦」,
既然是按 token 算,那些沒必要的贅字、客套、重複,砍掉就是實實在在地省錢、省空間——言簡意賅,在這個時代,不只是文采,更是划算。
該簡潔的地方就簡潔,
尤其是要一次餵一大堆資料進去時,先幫它瘦身、去掉冗餘,既省了成本,又不會太快撐爆那個寶貴的視窗。

04 答案是——

但最該記住的,是「看懂這個吃虧,你就不會被表面的數字給誤導」,
下次估算成本、規劃視窗、比較模型時,記得中文的 token 會「膨脹」——同樣一份東西,用中文算出來的量,天生就會比你憑英文直覺想的要多一截。
懂了這個眉角,
你就能更準地抓預算、更聰明地選工具——這個「中文比較吃虧」的冷知識,其實是每個中文 AI 使用者,都該放在心上的一堂實用課。

🎤

所以下次你發現同一份東西,中文算起來就是比英文貴、比英文快滿,先別覺得是自己講太多。
那不是你的錯,是這把「切詞的刀」,當初根本就是照著英文的身材打造的——中文,只是那個一直在默默買單的客人。
真正該記住的,其實只有一件事——

切詞的刀,是照著英文量身打造的;
中文字體積大、又沒空格幫忙——同樣的意思,就被切成更多塊;
這不是中文沒效率,是一場「誰資料多、刀就對誰好」的結構性偏心。

🎯