---
title: "對比式語言影像預訓練（Contrastive Language-Image Pre-training）"
slug: contrastive-language-image-pre-training
language: zh-TW
source: https://aiterms.tw/terms/contrastive-language-image-pre-training
updated_at: 2026-06-22
tags: [多模態學習, 對比學習, 視覺語言模型, 零次遷移, OpenAI, CLIP]
ipas_term: false
---

# 對比式語言影像預訓練（Contrastive Language-Image Pre-training）

OpenAI 提出的多模態預訓練架構，透過對比學習同時訓練文字與影像編碼器，使兩者的語意空間對齊。

## 完整說明

Contrastive Language-Image Pre-training（CLIP）是 OpenAI 於 2021 年提出的多模態預訓練模型，使用超過 4 億對從網際網路收集的圖文配對資料，透過對比學習（Contrastive Learning）讓文字編碼器與影像編碼器共享一個高維向量空間，使得相關的圖文對在空間中距離接近、不相關的對則距離遠。CLIP 因其強大的零次遷移（Zero-shot Transfer）能力而廣受應用。

## 常見問題

### CLIP 和一般的影像分類模型有什麼根本差異？

傳統影像分類模型（如 ResNet、EfficientNet）在訓練時只知道固定的幾千個類別，要應用到新類別就必須重新收集資料並微調模型。CLIP 的根本差異在於它學習的是影像與文字語意之間的對應關係，而非固定類別的映射。因此，只要能用文字描述出一個概念，CLIP 就可以在從未見過這個類別任何訓練樣本的情況下進行辨識，這就是「零次遷移」能力的來源。這種能力使 CLIP 在開放領域的視覺理解任務上有顯著優勢。

### 對比學習（Contrastive Learning）在 CLIP 中是如何運作的？

在 CLIP 的訓練中，每個批次包含 N 對圖文配對（例如一張貓的圖片配上「一隻橘色的貓」）。模型同時將 N 張圖片與 N 段文字各自編碼成向量，計算所有 N×N 對的相似度分數。對比學習的目標是最大化 N 個正確配對（對角線）的相似度，同時最小化其餘 N²−N 個不匹配配對的相似度。這個目標迫使模型學習到有意義的跨模態語意表示，而非只記住特定視覺特徵，因此具有很強的泛化能力。

### CLIP 可以直接用來生成圖片嗎？

CLIP 本身是一個判別式模型，只負責計算圖文的相似度分數，無法直接生成圖片。但 CLIP 的文字編碼器或共享語意空間常被生成模型借用作為條件訊號。例如 OpenAI 的 DALL-E 2 使用 CLIP 的文字向量作為擴散模型的條件輸入；許多 Stable Diffusion 版本也整合了 CLIP 文字編碼器。因此，CLIP 在文生圖系統中扮演的是「語意理解與條件導引」的角色，而實際圖片生成工作由擴散模型或其他生成架構負責。

---

來源：https://aiterms.tw/terms/contrastive-language-image-pre-training
快查頁：https://aiterms.tw/terms/contrastive-language-image-pre-training
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-contrastive-language-image-pre-training