---
title: "跨模態學習（Cross-modal Learning）"
slug: cross-modal-learning
language: zh-TW
source: https://aiterms.tw/terms/cross-modal-learning
updated_at: 2026-07-30
tags: [多模態AI, 表示學習, 對比學習, 深度學習, 生成模型]
ipas_term: false
---

# 跨模態學習（Cross-modal Learning）

在不同數據模態（如文本、影像、音訊）之間建立聯繫與對齊，學習跨模態的統一表示或進行跨模態推理的機器學習方法。

## 完整說明

跨模態學習（Cross-modal Learning）是處理多模態數據的一種方法，核心目標是在文本、影像、音訊、視頻等不同形式的數據之間建立映射關係與語義對齊。跨模態學習包括跨模態檢索（用文本檢索圖像）、跨模態轉換（文本到影像生成）、跨模態融合（聯合多模態進行分類或回歸）等應用。

## 常見問題

### 跨模態學習和多模態學習有什麼區別？

多模態學習（Multimodal Learning）是廣義概念，指利用多種數據模態進行學習，包括簡單的模態融合（將多個模態的特徵拼接後分類）。跨模態學習（Cross-modal Learning）是多模態學習的一個更高級的分支，強調不同模態之間的『橋接』與『互動』：在不同模態間建立映射、對齐或轉換關係。例如，用文本檢索圖像、從圖像生成文本說明、在統一表示空間中融合，這些都是跨模態的特徵應用。簡單來說，所有跨模態學習都是多模態學習，但不是所有多模態學習都涉及跨模態。

### CLIP 的對比學習為什麼這麼有效？

CLIP（Contrastive Language-Image Pre-training）的成功基於三個因素：第一，大規模弱標注數據：互聯網上存在海量（圖片, 文字說明）配對，CLIP 在這些數據上訓練，避免了手工標注的高成本。第二，對比損失的設計：不要求模型預測一個絕對的『相似度分數』，而只要求『同一配對在表示空間中相近，不同配對相遠』，這個相對的、排序性的目標更容易優化。第三，共同表示空間的威力：一旦映射到共同空間，就能進行跨模態檢索、零樣本分類等豐富的應用，無需為每個下游任務重新訓練。CLIP 開啟了多模態基礎模型的時代，後續 GPT-4V、Gemini 等都採用類似思路。

### 文本到影像生成為什麼這麼難，需要什麼技術支撐？

文本到影像生成（Text-to-Image Generation）難度高是因為：第一，描述到視覺的映射是高度發散的：同一個文本描述可對應無數種視覺實現；第二，文本語義往往模糊（如『漂亮的風景』），需要模型進行主觀解釋；第三，生成內容要符合物理規律與常識（如手指數量、物體大小比例）。當代技術採用『擴散模型』（Diffusion Model）破局：從純雜訊開始，逐步去噪生成圖像，同時在每一步用文本 embedding 指導去噪方向。DALL-E 2、Stable Diffusion、Midjourney 等都基於擴散模型。相較GAN（生成式對抗網路），擴散模型的訓練更穩定、生成品質更好。

---

來源：https://aiterms.tw/terms/cross-modal-learning
快查頁：https://aiterms.tw/terms/cross-modal-learning
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-cross-modal-learning