同樣的意思,中文常常要多花錢、又更快撐爆視窗。
先講在前面:AI 讀字之前,會先把句子「切」成一塊塊小單位(token),按 token 數算錢、算長度。
而同一個意思,用中文講,切出來的 token 往往比英文多——這不是錯覺,是中文使用者實實在在的一個吃虧。
不信?我唸四個給你聽。
同一句「我今天很開心」跟它的英文版,意思一模一樣,
丟進去一切,中文那句的 token 數,常常比英文多出一截——一樣的話,中文卻切得更碎、算得更多。
英文一個常見的單字,像 "happy",往往「一整個字就是一個 token」,
中文的「開心」兩個字,卻可能被拆成好幾塊——同樣表達一個概念,英文一口吞,中文卻要嚼好幾下。
你按 token 計費,同一份文件翻成中英兩版,
中文那版的帳單,往往就是比英文貴——不是你講得比較多,是你講的每一個意思,被切成了更多要收費的小塊。
視窗上限也一樣按 token 算,
同樣一份長文,中文版更快撐爆那個上限——英文還游刃有餘,中文卻已經滿了,連能塞的內容,都硬生生少了一截。
看到這裡你可能會問:中文字明明比英文精簡,一個字頂人家好幾個字母,怎麼反而切得更多?
關鍵就在——「切法」這把刀,當初是照著英文的身材量身打造的,中文只是那個沒被好好照顧到的客人。
來看原理,這段有點料。
那把「切詞的刀」(tokenizer),是拿海量的文字餵出來、統計出來的——而那堆訓練文字,絕大多數是英文,
刀看英文看得最多、最熟,於是它把英文常見的字、詞根,一個個「收編成一整塊」,切起來又快又省。
中文因為在訓練資料裡份量少,
這把刀對它不夠熟、沒幫它把常用詞收編成整塊——結果同樣的意思,英文一刀切一塊,中文卻被剁成了好幾塊。
更底層的原因是——中文字在電腦裡,每一個字都要用比較多的「位元組」來存,
英文字母一個大多只佔一個位元組,一個中文字卻常要三個;當刀認不得這個中文字時,只好退回去「按位元組硬切」,一個字就這樣被拆成了兩三塊碎片。
它不是故意為難中文,
是碰到不熟的字,它就退回最笨的切法——而中文字「體積」天生比較大,一退回去按位元組切,token 數就嘩啦啦地翻上去了。
英文還有個天生優勢——單字之間有「空格」,天然就幫刀畫好了切線,
刀一看空格就知道「這裡是一個詞的邊界」,切得乾淨俐落;中文一長串黏在一起、沒有空格,刀要自己猜哪裡該斷,猜不準就切得零碎。
沒有現成的邊界可循,
刀只好保守地、一小塊一小塊地切——這一保守,同樣的內容,自然就被切出了更多、更零碎的 token 出來。
說到底,這是一個「誰的資料多,刀就對誰好」的結構性偏心,
不是中文比較笨、比較沒效率,是這套技術從出生那天起,就是照著英文的需求去打磨的——中文、還有很多其他語言,都是這場遊戲裡先天吃虧的一方。
刀的偏心,是資料的偏心,
而資料的偏心,又是整個網路、整個世界話語權分布的縮影——中文的這個「吃虧」,底下藏的其實是一個更大的、關於公平的故事。
好,原理你懂了:切詞的刀是照英文打造的,加上中文字體積大、又沒空格幫忙——三個原因湊起來,中文就吃了虧。
那很多人會問——「那身為中文使用者,我豈不是只能認命多付錢、多吃虧?」
嗯……有些地方能自救,往下看。
你可能有點不平——憑什麼講中文就要多付錢、又更快滿?
難道我只能默默接受這個吃虧,一點辦法都沒有、只能認命地被多切、多收嗎?
好消息是——這件事正在慢慢變好,
越新、越重視多語言的模型,會刻意在訓練切詞的刀時,餵進更多中文和各國語言,讓那把刀對中文也越來越熟、切得越來越省。
差距沒消失,但在縮小,
所以選工具的時候,可以留意一下——那些主打多語言、對中文友善的模型,往往就能幫你把這個先天的吃虧,補回來一部分。
而你自己也有能省的地方——「把話講精簡,別為了湊字數而囉嗦」,
既然是按 token 算,那些沒必要的贅字、客套、重複,砍掉就是實實在在地省錢、省空間——言簡意賅,在這個時代,不只是文采,更是划算。
該簡潔的地方就簡潔,
尤其是要一次餵一大堆資料進去時,先幫它瘦身、去掉冗餘,既省了成本,又不會太快撐爆那個寶貴的視窗。
但最該記住的,是「看懂這個吃虧,你就不會被表面的數字給誤導」,
下次估算成本、規劃視窗、比較模型時,記得中文的 token 會「膨脹」——同樣一份東西,用中文算出來的量,天生就會比你憑英文直覺想的要多一截。
懂了這個眉角,
你就能更準地抓預算、更聰明地選工具——這個「中文比較吃虧」的冷知識,其實是每個中文 AI 使用者,都該放在心上的一堂實用課。
所以下次你發現同一份東西,中文算起來就是比英文貴、比英文快滿,先別覺得是自己講太多。
那不是你的錯,是這把「切詞的刀」,當初根本就是照著英文的身材打造的——中文,只是那個一直在默默買單的客人。
真正該記住的,其實只有一件事——
切詞的刀,是照著英文量身打造的;
中文字體積大、又沒空格幫忙——同樣的意思,就被切成更多塊;
這不是中文沒效率,是一場「誰資料多、刀就對誰好」的結構性偏心。