它看得懂氛圍,卻算不清數量。
先講在前面:它不是眼睛壞掉,也不是不認真看。
它看圖比較像「瞄一眼抓個大概」,而不是「一個一個仔細點過」。
不信?我唸四個給你聽。
你丟一張擠滿貓的照片問牠有幾隻,
牠一臉篤定回你「五隻」,你數了數明明有八隻——牠看得到貓,就是數不對數字。
你給牠一張風景照,牠形容得詩情畫意,
光影氛圍樣樣到位,卻把左下角那隻明顯的狗,講成了一顆無中生有的石頭在那裡。
你要牠讀時鐘上的指針幾點幾分,
牠猜得零零落落,明明大大一個鐘面擺在那,牠偏偏看不準那兩根針的時辰。
你給牠一張密密麻麻的表格截圖,
大方向牠抓得住,細到某一格的數字,牠卻抄錯了行、看串了列還一臉沒事的樣貌。
看到這裡你可能會問:牠都能形容氛圍了,怎麼連數個數都不行?
關鍵就在——牠不是真的「一個一個看」,牠是把整張圖壓成一種印象在感應。
來看原理,這段有點料。
牠看圖不是「逐一點數」,是把整張畫面壓成一團印象,
抓的是「這看起來像一群貓」,而不是「一、二、三」慢慢地量。
整體氛圍牠很在行,
精確數量牠很吃力——這跟牠處理文字的老毛病,其實同一個方向。
圖片進到牠腦裡,會被切成一塊塊小拼片,
切得越碎、細節越容易在拼接的縫隙之間悄悄地漏了邊。
小字、指針、單一格,
這些精細的東西,常常就卡在解析度的門檻下、被牠糊成一片看不見。
牠的底子還是那台「猜下一個字」的語言機器,
看圖只是後來加裝的眼睛,骨子裡做的仍是「講出最像的描述」這件事。
所以牠會腦補圖裡「應該有」的東西,
一張公園照牠自動配上長椅,管它畫面裡到底有沒有真的存在過的那個位置。
更麻煩的是——牠看錯的時候,一樣講得超有自信,
「這張圖裡有五隻貓」牠報得斬釘截鐵,不會提醒你牠其實只是在估、在矇。
牠不會說「我沒看清楚」,
牠會直接給你一個乾脆漂亮的數字,把猜測包裝成觀察,騙過你的眼睛。
好,原理你懂了:牠是在「感應整張圖」,不是在「數清每個東西」。
那很多人會想——「那換更強、更高解析度的模型,總看得清了吧?」
嗯……會好些,但先往下看。
你以為畫質拉高、模型升級,
牠就能一格不漏、一隻不差、什麼細節都給你數得清清楚楚?
會進步,錯得沒那麼離譜,細節也抓得多一些,
但只要牠還是「先感應、再描述」,碰到要精準點數、精準讀值的場合,總還是有翻船的機率在。
真正的解法不是叫牠「用力再看一次」,
而是讓牠去呼叫工具——真的要數,就交給會數的程式去點、去圈、去算。
牠負責看懂你要什麼,
精細的計數和讀值,派專門的視覺工具上場,這樣才又快又不會看走了眼。
所以別拿「精準」去考牠的「印象」,
要形容、要理解、要抓氛圍,牠是把好手,要數量、要讀數、要一格不差,你就自己再核一次別偷懶。
看得懂,不等於看得準,
把牠當一雙很會看氣氛的眼睛,關鍵的數字,還是你親自數了才算數。
所以下次牠斬釘截鐵報「圖裡有幾隻、幾點鐘、多少錢」,先別全信。
牠給的很可能不是數出來的,是「看起來大概這麼多」的一個印象值而已。
真正該記住的,其實只有一件事——
牠看得懂氛圍,數不清數量;
牠給的數字,是「像」不是「數」;
要形容交給牠,要精準你自己再核一次。