💡一句話定義
CLIP(Contrastive Language–Image Pre-training)= 一種圖文對齊模型:用大量影像與文字配對訓練,讓相符的圖與文在共同向量空間中靠近、不符的遠離。這樣圖和文就能互相比較、互相檢索。
它有兩個編碼器:一個把圖變向量(影像編碼器)、一個把文字變向量(文字編碼器),訓練目標就是「把對的配對拉近、錯的推遠」。
🧲怎麼訓練:對比學習
🎮互動:對齊落差怎麼來的
拉動滑桿加大 prompt 的細節難度:藍色方塊是文字特徵、橘色圓點是影像特徵。要求「海邊夕陽」等宏觀概念時兩者緊密對齊;要求「精確手指姿勢/品牌色」時,影像特徵漂移、出現紅色落差線。
CLIP 跨模態語意對齊解析
簡單:常見場景與物件
困難:精確的手指姿勢、特定的品牌色彩
整體語意對齊度 (Alignment Score)
98%
高度吻合,生成結果精準
視覺瑕疵風險 (Artifact Risk)
低
畫面自然
文字編碼器特徵 (Text Embeddings)
影像編碼器特徵 (Image Embeddings)
--- 虛線代表對齊誤差 (Alignment Gap)
🎯殺手級應用:零樣本分類
因為圖文在同一空間,CLIP 能做零樣本(zero-shot)分類:不用另外訓練,把每個類別名寫成文字(「一張貓的照片」「一張狗的照片」…),看影像和哪個類別文字最相似,就預測成那類——甚至能分辨從沒見過的類別。這是它最厲害的地方,也是「靠語意對齊、而非看過該類別」。
✋為什麼 AI 的「手」常畫崩?
🚀應用與限制
🏷️零樣本分類
把類別寫成文字比相似度,不用重訓。
把類別寫成文字比相似度,不用重訓。
🔎圖文檢索
用文字找圖、用圖找文。
用文字找圖、用圖找文。
🎨文生圖對齊
為擴散等生成模型提供圖文對齊訊號。
為擴散等生成模型提供圖文對齊訊號。
⚠️限制
受資料偏誤、細粒度描述較弱、可能繼承刻板印象。
受資料偏誤、細粒度描述較弱、可能繼承刻板印象。
✅自我檢測
Q1. CLIP 在做什麼?
用大量圖文配對訓練兩個編碼器,讓相符的圖與文在共同向量空間靠近、不符的遠離,因此圖和文能互相比較與檢索。
Q2. CLIP 怎麼訓練?
用對比學習:一批內讓每張圖和它的正確描述相似度最高、與其他描述相似度最低(對比損失),把正確配對拉近、錯誤配對推遠。
Q3. 什麼是零樣本分類?為什麼 CLIP 做得到?
不另外訓練就能分類:把類別名寫成文字,看影像和哪個類別文字最相似即可預測。因為圖文在同一空間,靠語意對齊就能泛化到沒見過的類別。
Q4. CLIP 是生成模型嗎?
不是。CLIP 做的是「對齊與檢索」,不是生成圖片。但它可以為文生圖等生成模型提供圖文對齊的訊號。
🎯重點整理
- 是什麼:圖文對齊模型,相符圖文在共同空間靠近。
- 怎麼練:對比學習,正確配對拉近、錯誤推遠。
- 殺手應用:零樣本分類(類別寫成文字比相似度)。
- 不是生成:做對齊/檢索,可為文生圖提供對齊訊號。
- 限制:資料偏誤、細粒度弱、可能繼承刻板印象。