---
title: "相關矩陣（Correlation Matrix）"
slug: correlation-matrix
language: zh-TW
source: https://aiterms.tw/terms/correlation-matrix
updated_at: 2026-07-30
tags: [特徵工程, 統計分析, EDA, 多重共線性, PCA, iPAS]
ipas_term: false
---

# 相關矩陣（Correlation Matrix）

量化多個變數兩兩之間線性相關程度的方陣，矩陣中每個元素為對應兩變數的皮爾森相關係數。

## 完整說明

相關矩陣（Correlation Matrix）是統計學與機器學習特徵分析的基礎工具，以矩陣形式同時呈現所有特徵對之間的線性相關性。矩陣的對角線元素恆為 1（變數與自身的相關性），非對角線元素為皮爾森相關係數，範圍介於 -1 到 1 之間。在 AI 專案的特徵工程階段，相關矩陣用於識別高度相關的特徵對（可能存在多重共線性）、篩選與目標變數相關的特徵，以及理解資料集的整體結構。

## 常見問題

### 相關矩陣中發現兩個特徵高度相關，應該如何處理？

當兩個特徵的相關係數絕對值超過 0.9，通常需要處理多重共線性問題，但具體做法取決於使用的模型。在線性迴歸、邏輯斯迴歸等線性模型中，高度相關的特徵會使係數估計不穩定（標準誤差大、係數符號可能反轉），應刪除其中一個（通常保留業務意義更清晰的那個），或用 PCA 將兩者合併為一個主成分。在決策樹、Random Forest、XGBoost 等非線性模型中，多重共線性影響較小，保留兩個相關特徵不一定有害，模型會自行選擇更有預測力的一個。另一個選項是計算 VIF（方差膨脹因子），VIF > 10 通常是需要處理的閾值。

### 相關係數高是否代表有因果關係？

相關性不等於因果性，這是統計學中最重要的原則之一。相關矩陣只能反映變數之間的線性協變程度，無法推斷方向性或機制。經典例子：冰淇淋銷售量與溺水事件高度相關，但前者不是後者的原因，而是因為兩者都受到「夏天氣溫高」這個潛在變數驅動（混淆變數問題）。在 AI 模型中，即使兩個特徵高度相關，也不代表其中一個「導致」另一個。推斷因果關係需要設計對照實驗（如 A/B 測試）或使用因果推斷方法（如 Difference-in-Differences、工具變數法），而非僅靠相關矩陣。iPAS 考試中「相關不等於因果」常作為概念判斷題的干擾選項，需要特別注意。

### 皮爾森相關係數和斯皮爾曼相關係數有什麼不同，何時選哪個？

皮爾森相關係數衡量兩個連續變數之間的線性關係，假設資料服從常態分布；斯皮爾曼等級相關係數則對資料的排名計算皮爾森係數，能捕捉單調非線性關係，且對離群值更穩健。選擇原則是：若資料符合常態分布、關係接近線性，用皮爾森；若資料有明顯離群值、分布偏態、或變數之間關係是單調非線性（如指數關係），用斯皮爾曼。例如收入與幸福感的關係通常呈對數曲線（收入從低到中提升幸福感很多，高收入後效益遞減），用斯皮爾曼比皮爾森更能反映這種單調遞增但非線性的關係。在 iPAS 考試中，常以「資料含有離群值」或「分布明顯不符常態」作為選擇斯皮爾曼的判斷依據。

---

來源：https://aiterms.tw/terms/correlation-matrix
快查頁：https://aiterms.tw/terms/correlation-matrix
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-correlation-matrix