臉畫得美如天仙,手一伸出來就露餡。
先講在前面:它不是不會畫手,也不是故意惡搞。
它根本不知道「手」是五根手指——它只知道「手大概長那樣」的一團模糊印象。
不信?我唸四個給你聽。
臉蛋畫得美如天仙、細節無可挑剔,
手一伸出來,五根變六根、六根接七根,還多長了一截詭異的第八隻。
你請它畫一個人拿咖啡杯,
杯子畫得挺好,但那隻手跟杯子融成一團,分不清哪是手指、哪是杯耳、哪是背。
你要它寫一行招牌上的英文字,
遠看有模有樣,近看每個字母都在鬧脾氣,拼出一串沒人看得懂的外星文字。
你要它畫兩個人牽手站一起,
整體氛圍很溫馨,仔細一看手臂多一條、腿少一隻,還有一隻手不知道長在誰的身體。
看到這裡你可能會笑:臉都畫得出來了,一隻手是能有多難?
關鍵就在——它畫圖不是「照著結構畫」,是「從一團雜訊慢慢猜出一張圖」。
來看原理,這段有點料。
它畫圖的方式,是從一團隨機雜訊裡慢慢「猜」出畫面,
一步步把噪點磨成形狀,靠的是「這裡看起來該長什麼」的直覺去填。
它腦中沒有「手有五根」這條規則,
只有「手指的紋理大概長這樣」的模糊手感,多一根少一根它根本不會提醒自己該收斂。
手是全身「姿勢變化最狂」的部位,
握、比、交叉、彎曲、重疊,訓練資料裡的手千姿百態、亂成一堆。
臉幾乎都是固定兩眼一鼻一嘴,
手卻沒有一個穩定的樣板,它學來學去,學了個模模糊糊、抓不住的頭緒。
它畫圖時沒有一個會「數數」的部門在旁邊把關,
畫完一根手指,它不會停下來點:一、二、三、四、五、夠了該收尾。
它是一片一片區域各自生成,
局部都畫得像手指,合起來卻超標——沒人在總量上喊卡,自然就多長了幾隻。
文字也一樣——它是把字當「圖案」在畫,不是在「拼字母」,
它畫的是「這裡有一串字母的感覺」,而不是真的懂那幾個字該怎麼拼寫組織。
所以招牌遠看很唬人,
近看全是亂碼——因為它畫的從頭到尾都是「像文字的形狀」,不是文字本身的意義。
好,原理你懂了:它是在「猜出一張圖」,不是在「照結構畫一張圖」。
那很多人會問——「那現在的 AI 畫手好像正常多了,是不是已經解決了?」
嗯……進步很大,但先往下看。
你可能發現最近的圖,手好像正常多了,
是不是六根手指的時代,已經徹底成為過去式、被完全終結了?
確實好超多——餵更多手的資料、加更多修正,
大部分的手都乖了,但你叫它畫複雜的手勢、交纏的雙手,它照樣偶爾露出那熟悉的馬腳給你驚。
因為根子沒變——它還是在「猜」,不是在「懂」,
它學會了「手通常五根」的統計慣性,卻沒真的理解手的骨架和構造為何這樣生長。
常見的它畫得順,
一碰到刁鑽罕見的角度,那個猜圖的老底子,又會悄悄地漏出破綻和荒唐。
所以拿它的圖去用之前,記得放大看一眼,
手指、文字、牙齒、耳環,這些精細又重複的地方,永遠是最容易藏著小驚喜的災難現場。
它負責把美感和氛圍給你,
那些數得出來的細節,你自己再檢查一次,才不會把六根手指印上你的招牌。
所以下次它給你一張美圖,別光顧著讚嘆,先看看那雙手。
它畫的不是「正確的手」,是「看起來像手的一團印象」——多一根少一根,它自己毫無感覺。
真正該記住的,其實只有一件事——
它畫得出美感,算不清數量;
它畫的是「像手」,不是「五根手指」;
美圖它給你,細節你自己放大再看一眼。