前面的模型都在「判斷」,這一派在「創造」。
教機器從一片虛無裡,長出一張沒人見過的圖。
前面幾集的模型,本質都在做「判斷題」:這是貓還是狗?框在哪?字是什麼?它們是鑑賞家。而生成式 AI 完全反過來——它是創作者,任務是「無中生有」,畫出一張、寫出一段、合成一段從未存在過的東西。
它們共同想做的事很玄:學會「真實資料長什麼樣子」的那套規律(分佈),然後照著這套規律自己捏出新樣本。難點在於——真實世界的分佈太複雜,怎麼逼近它?下面三位,就是三種截然不同的攻法。
這集我們把生成式 AI 的三大天王——溫和的 VAE、火爆的 GAN、和當紅霸主 Diffusion——一個一個拆給你看。
同樣是造假,三種手法:壓縮再還原、互相對抗、從雜訊裡慢慢雕。
VAE 走的是「壓縮—還原」路線。編碼器把一張圖擠壓成一小組數字(潛在空間 latent space),解碼器再把它還原回來。妙的是,它把這個潛在空間訓練得平滑又連續——你在裡面隨便挑一點、或在兩張臉之間「滑」過去,都能生成合理的新圖。
優點是訓練穩定、潛在空間可控好操作;代價是生成的圖常常偏糊、不夠銳利。它是生成模型裡最好懂、最溫和的入門款。
GAN 是靠左右互搏練成的。生成器拚命造假圖想騙過人,鑑別器拚命抓假。兩者對抗訓練——造假的越來越像、打假的越來越毒,逼到最後生成器產出的東西連鑑別器都分不出真假。
它曾是「以假亂真」的代名詞,圖又清晰又逼真。但脾氣極差:訓練不穩、容易崩潰,還會「模式崩壞」(翻來覆去只生那幾種花樣)。是天才,但是難搞的天才。
當今生成界的霸主,Midjourney、Stable Diffusion、DALL·E 的核心。它的思路很反直覺:訓練時故意把清晰圖片一步步加噪,直到變成純雜訊;然後讓模型學會反過來,一步步去噪。生成時就從一團隨機雪花出發,慢慢「雕」出一張清晰圖。
好處是畫質頂尖、訓練穩定、多樣性強,還很好接文字條件(打字就出圖)。唯一大缺點:生成要跑很多步,比較慢(近年靠各種加速技術大幅改善)。
生成模型最麻煩的地方是——「好不好」很主觀。所以評估它,比判斷題模型難得多。
三個模型都愛用。它比較「生成圖」和「真實圖」在特徵分佈上的距離,越低代表越像真、越接近人眼判斷。
只生一張完美圖沒用(模式崩壞)。好模型要既逼真、又有變化,Inception Score 就想同時抓這兩點。
打字出圖的模型,還得看「圖有沒有照文字生」。CLIP Score 量的就是文字和圖的匹配度。
再多指標都替代不了人類主觀評測。細節合不合理、有沒有「AI 味」,最後還是人說了算。