CNN 只看得到「鄰居」,Transformer 一眼就能看到「全場」。
先講在前面:CNN 曾經是深度學習的王,影像辨識靠它一戰成名。但輪到「語言」跟「超大模型」這條路,換 Transformer 稱王了。
關鍵差別只有一句話——CNN 是「近視眼」,只看得清眼前的鄰居;Transformer 是「千里眼」,一眼掃過全場。
不信?我唸四個給你聽。
CNN 看東西,是靠一個小小的「放大鏡」在畫面上一格一格滑,
它每次只看得到一小塊、只認得出眼前的鄰居,要理解「離很遠的兩個東西有什麼關係」,它得一層一層慢慢傳、傳老半天才勉強接得上。
Transformer 一上場,就讓「每個字跟每個字」直接互看一遍,
不管隔多遠,一步就搭上線,句子開頭那個主詞,跟結尾那個動詞,它一眼就能配對起來——遠距離的關係,對它是小菜一碟。
語言這種東西,最講究的就是「遠距離的呼應」,
一句話前面埋的伏筆、後面才揭曉,CNN 那個近視的放大鏡最頭痛這個,Transformer 的千里眼卻剛好對上胃口、正中下懷。
更要命的是「訓練速度」——CNN 處理序列,常常得一個接一個排隊算,
Transformer 卻能一整排同時算、平行處理,
同樣的時間、同樣的硬體,它能吞下多得多的資料——這一快,就決定了誰能被餵成今天的巨無霸大模型。
看到這裡你可能會問:不就是「看得遠一點」嗎?怎麼就讓它一舉稱王了?
關鍵就在——「看得遠」和「算得快」這兩件事加起來,剛好踩中了大模型時代最重要的那個命門。
來看原理,這段有點料。
Transformer 的核心,是「注意力機制」——每個位置都能直接關注到全場任何一個位置,
它不像 CNN 得靠一層層堆疊、慢慢把視野擴大,它天生就是「全域視野」,任何兩點之間,永遠只隔一步之遙。
CNN 的「感受野」要慢慢長大,
Transformer 一出手就是滿場——這種「一步到位的全局關聯」,正是理解複雜語言、複雜脈絡最需要的本領。
它天生「好平行、好放大」——整段輸入可以一次性平行運算,把 GPU 的算力榨到極致,
而 CNN 或更早的 RNN,在處理序列時常常卡在「得照順序、一步步來」,吃不滿現代硬體那種大規模平行的胃口。
能平行,就能餵更多資料、堆更大模型,
這一點,剛好搭上了整個產業「大力出奇蹟、越大越強」的浪頭——好放大,就是這個時代最關鍵的勝負手。
還有一個隱藏優勢——它「偏見更少、更通用」,
CNN 天生就假設「重要的東西都在附近」(局部性),這在影像上是好事,但硬套到語言、到各種任務上,反而變成一種束縛。
Transformer 幾乎不做這種預設,
它讓資料自己告訴它「什麼跟什麼有關」——正因為它不預設立場,反而更能通吃文字、圖像、聲音,長成一個什麼都能學的通用底座。
這幾件事湊在一起,就湧現出一個關鍵特質——它「越餵越強」,而且看不到明顯的天花板,
你給它更多資料、更多參數、更多算力,它就更聰明,這種漂亮的規模效應,讓所有人都願意押注在它身上、拚命地把它養大。
CNN 在影像上很強,
但論「能不能被無限放大、通吃一切任務」,Transformer 這套架構,才是那個賭對了規模、也賭對了未來的贏家。
好,原理你懂了:全域視野、好平行、少偏見、越餵越強——它靠這幾招登上了王座。
那很多人會問——「那 CNN 是不是就徹底過氣、被掃進歷史了?」
嗯……沒那麼絕對,往下看。
你可能以為既然 Transformer 這麼強,
那 CNN 就該直接淘汰、丟進博物館,從此再也沒人用了吧?
其實沒有——CNN 在很多場合,依然又快又省又好用,
尤其是資料量不大、任務單純、或是要塞進手機、攝影機這種小裝置的時候,CNN 那份「輕巧、專注在局部」的特性,反而是優點。
Transformer 強,但也又肥又貴,
不是每個場合都養得起、都需要——很多實際的產品裡,一顆小小的 CNN,到今天還是最划算、最稱職的那個選擇。
而且「Transformer 比 CNN 好」這句話,其實不夠精確——應該說「它更適合被放大、更適合當通用大模型的底座」,
贏的是「通用、可規模化」這條路線,不代表在每一個單項任務上,它都一定把 CNN 打趴——工具沒有絕對的高下,只有適不適合。
兩者甚至常常合作,
今天很多視覺模型,是把 CNN 的優點跟 Transformer 的優點揉在一起用——不是你死我活,而是各取所長、互相成全。
所以下次有人問你「為什麼 Transformer 比 CNN 好」,你可以笑著補一句——
不是它樣樣都強,是它剛好長了一副「看得遠、又好放大」的體質,精準地踩中了大模型這個時代最看重的兩件事。
對的架構,遇上對的時代,
才成就了今天的它——這不只是一場技術的勝利,更是一次「選對了方向、押對了規模」的漂亮豪賭的勝利。
所以下次你用的那個大模型,別忘了它骨子裡那顆 Transformer 的心臟。
它贏 CNN,不是因為它在每件事上都更強,是因為它剛好「看得夠遠、又夠好放大」——在這個大力出奇蹟的時代,這兩件事,比什麼都值錢。
真正該記住的,其實只有一件事——
CNN 看得清鄰居,Transformer 看得到全場;
它不是樣樣都強,是「看得遠、又好放大」,剛好踩中了大模型的命門;
對的架構遇上對的時代——這是一場押對規模的漂亮豪賭。