深度學習 · 多模態

CLIP 圖文對齊

用海量「圖+文字說明」配對訓練,讓相符的圖與文在同一個向量空間裡靠在一起——電腦這才能「看圖懂字、看字找圖」。

對比學習共同向量空間圖文對齊零樣本分類文生圖對齊

💡一句話定義

CLIP(Contrastive Language–Image Pre-training)= 一種圖文對齊模型:用大量影像與文字配對訓練,讓相符的圖與文在共同向量空間中靠近、不符的遠離。這樣圖和文就能互相比較、互相檢索。

它有兩個編碼器:一個把圖變向量(影像編碼器)、一個把文字變向量(文字編碼器),訓練目標就是「把對的配對拉近、錯的推遠」。

🧲怎麼訓練:對比學習

給一批(batch)N 張圖與它們的 N 句正確描述。CLIP 用對比學習(contrastive loss):讓每張圖和它的正確描述相似度最高,跟同批其他描述相似度最低。等於在一個大矩陣裡,把對角線(正確配對)拉高、其餘拉低。訓練完,圖文就落在同一個語意空間。

🎮互動:對齊落差怎麼來的

拉動滑桿加大 prompt 的細節難度:藍色方塊是文字特徵、橘色圓點是影像特徵。要求「海邊夕陽」等宏觀概念時兩者緊密對齊;要求「精確手指姿勢/品牌色」時,影像特徵漂移、出現紅色落差線。

CLIP 跨模態語意對齊解析
簡單:常見場景與物件 困難:精確的手指姿勢、特定的品牌色彩

整體語意對齊度 (Alignment Score)

98%
高度吻合,生成結果精準

視覺瑕疵風險 (Artifact Risk)

畫面自然
多模態潛在語意空間 (Latent Space)
文字編碼器特徵 (Text Embeddings)
影像編碼器特徵 (Image Embeddings)
--- 虛線代表對齊誤差 (Alignment Gap)

🎯殺手級應用:零樣本分類

因為圖文在同一空間,CLIP 能做零樣本(zero-shot)分類不用另外訓練,把每個類別名寫成文字(「一張貓的照片」「一張狗的照片」…),看影像和哪個類別文字最相似,就預測成那類——甚至能分辨從沒見過的類別。這是它最厲害的地方,也是「靠語意對齊、而非看過該類別」。

為什麼 AI 的「手」常畫崩?

文字大腦知道「五根手指拿飲料」,但影像大腦對「手在各種 3D 角度、遮擋下的幾何」認知很模糊(訓練圖片裡手的姿態變化太大)。於是代表「手指」「品牌色」的影像特徵對不齊文字要求,這段無法重合的距離,就是生成「六根手指」「Logo 變色」的技術根源。demo 右半就是在放大這個對齊落差。

🚀應用與限制

🏷️零樣本分類
把類別寫成文字比相似度,不用重訓。
🔎圖文檢索
用文字找圖、用圖找文。
🎨文生圖對齊
為擴散等生成模型提供圖文對齊訊號。
⚠️限制
受資料偏誤、細粒度描述較弱、可能繼承刻板印象。

自我檢測

Q1. CLIP 在做什麼?
用大量圖文配對訓練兩個編碼器,讓相符的圖與文在共同向量空間靠近、不符的遠離,因此圖和文能互相比較與檢索。
Q2. CLIP 怎麼訓練?
用對比學習:一批內讓每張圖和它的正確描述相似度最高、與其他描述相似度最低(對比損失),把正確配對拉近、錯誤配對推遠。
Q3. 什麼是零樣本分類?為什麼 CLIP 做得到?
不另外訓練就能分類:把類別名寫成文字,看影像和哪個類別文字最相似即可預測。因為圖文在同一空間,靠語意對齊就能泛化到沒見過的類別。
Q4. CLIP 是生成模型嗎?
不是。CLIP 做的是「對齊與檢索」,不是生成圖片。但它可以為文生圖等生成模型提供圖文對齊的訊號。

🎯重點整理

📝 iPAS 考點提醒

CLIP 是圖文對齊模型,iPAS 多模態考點(中級科目一)。重點:用大量影像與文字配對以對比學習,讓相符的圖與文在共同向量空間靠近,因而能做零樣本分類(不另訓練、把類別寫成文字比相似度)。易混點:CLIP 是對齊與檢索、不是生成;零樣本靠語意對齊、非看過該類別。情境:零樣本影像分類、圖文檢索、為文生圖提供對齊訊號、內容審核。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

CLIP 是什麼?

一種圖文對齊模型;用大量影像與文字配對訓練,讓相符的圖與文在共同向量空間中靠近、不符的遠離。

CLIP 怎麼訓練?

用對比學習:一批內讓每張圖和它的正確描述配對相似度最高、與其他描述相似度低(對比損失)。

什麼是零樣本分類?

CLIP 可不另訓練就分類:把類別名寫成文字,看影像和哪個類別文字最相似,即可預測,泛化到沒見過的類別。

CLIP 有哪些應用?

零樣本影像分類、圖文檢索、為生成模型(如文字生圖)提供圖文對齊訊號、內容審核、多模態理解等。

CLIP 的限制?

受訓練資料偏誤影響、對細粒度或抽象描述較弱、可能繼承網路資料的刻板印象;需注意公平與適用範圍。

🧭 相關主題

← 返回 AI 學習與考證地圖