---
title: "異質數據（Heterogeneous Data）"
slug: heterogeneous-data
language: zh-TW
source: https://aiterms.tw/terms/heterogeneous-data
updated_at: 2026-07-30
tags: [多模態AI, 特徵工程, 數據融合, 深度學習, 遷移學習]
ipas_term: false
---

# 異質數據（Heterogeneous Data）

由多種不同類型、來源或格式的資料組成，具有高度多樣性和複雜性的資料集合。

## 完整說明

異質數據（Heterogeneous Data）是指機器學習任務中涉及多種不同特性、數據來源、特徵類型或者格式的資料，如結構化數據（表格）與非結構化數據（文本、影像）的混合，或來自不同感測器、系統的資料組合。異質數據的處理需要特殊的特徵提取和融合技術，以充分利用多源資訊提升模型性能。

## 常見問題

### 異質數據和多源數據有什麼區別？

多源數據（Multi-source Data）強調數據來自不同的來源或系統，但這些數據可能都是結構化的（如多個資料庫的表）；異質數據（Heterogeneous Data）更強調數據的格式、類型、或特徵空間本身存在差異，不僅包括來源不同，還包括結構化與非結構化混合、特徵類型多樣等。異質數據是一個更廣義的概念，多源數據是異質數據的特例。

### 如何處理異質數據中不同模態權重差異大的情況？

當不同模態對目標任務的貢獻差異大時，簡單的特徵拼接往往效果不佳。可採用以下方法：第一，基於領域知識或業務邏輯手動加權；第二，使用機器學習方法學習權重（如學習一個標量權重因子）；第三，採用注意機制（Attention），讓模型根據輸入動態調整不同模態的權重；第四，使用集成學習，分別對各模態訓練專家模型，再以 Mixture of Experts 動態組合。在實務中，往往先用簡單加權baseline，再逐步引入複雜融合策略，邊界上的效果提升邊界思考。

### 異質數據在真實應用中最常見的挑戰是什麼？

最常見的挑戰是『特徵品質與可用性不一致』。舉例，一個用戶推薦系統同時使用用戶歷史購買記錄（完整且可靠）、用戶評論文本（稀疏且含雜訊）、商品影像（存在格式與尺寸差異）、商品評分（有人為造假），這些特徵在可用性、完整性、可信度上都不對等。簡單地拼接這些特徵會導致模型被最多的而非最可靠的特徵主導。其次是『時間不同步』：如果用戶行為數據、商品描述、評論文本的更新頻率不同，統合時容易引入時間泄漏或過時信息，需要精心設計特徵生成的時間窗口。

---

來源：https://aiterms.tw/terms/heterogeneous-data
快查頁：https://aiterms.tw/terms/heterogeneous-data
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-heterogeneous-data