---
title: "混淆矩陣（Confusion Matrix）"
slug: confusion-matrix
language: zh-TW
source: https://aiterms.tw/terms/confusion-matrix
updated_at: 2026-06-22
tags: [模型評估, 機器學習, 統計方法]
ipas_term: false
---

# 混淆矩陣（Confusion Matrix）

評估分類模型效能的表格，顯示預測與真實類別的對應關係，幫助理解模型在各類別上的表現。

## 完整說明

混淆矩陣是一種用於評估分類模型效能的表格工具，它以矩陣形式呈現模型預測結果與真實標籤之間的對應關係，能夠清晰地展示真陽性、真陰性、偽陽性及偽陰性的數量。它常用於計算精確度、召回率、F1分數等指標，以全面理解模型在不同類別上的表現，特別是在不平衡資料集或多類別分類任務中。

## 常見問題

### 為什麼僅憑準確度 (Accuracy) 不足以評估分類模型，混淆矩陣如何提供幫助？

在許多實際情境中，尤其是當資料集中的類別分佈不平衡時，單獨使用準確度來評估模型效能是具有誤導性的。例如，如果一個資料集中有 99% 的樣本屬於負類別，即使一個模型簡單地將所有樣本都預測為負類別，也能達到 99% 的準確度，但這顯然不是一個有用的模型，因為它完全無法識別正類別。混淆矩陣透過清晰地展示真陽性 (TP)、真陰性 (TN)、偽陽性 (FP) 和偽陰性 (FN) 的數量，能夠揭示模型在每個類別上的具體表現。它能幫助我們看到模型是否在少數類別上表現不佳，以及它犯了哪些類型的錯誤。基於混淆矩陣，我們可以計算精確度、召回率、F1 分數等更具洞察力的指標，這些指標更能反映模型在不平衡資料集中的真實效能，並指導我們針對特定業務目標進行模型優化。

### 如何解讀多類別分類問題的混淆矩陣？

對於多類別分類問題，混淆矩陣會擴展為 NxN 的形式，其中 N 是類別的數量。解讀多類別混淆矩陣的關鍵在於觀察對角線和非對角線元素。對角線上的元素（從左上到右下）表示模型正確預測的樣本數量，即真實類別與預測類別一致的數量。這些是模型的「真陽性」計數，但現在是針對每個類別而言。非對角線上的元素則表示模型錯誤預測的樣本數量。例如，位於第 i 行第 j 列的元素表示真實類別為 i 但被模型預測為類別 j 的樣本數量。透過分析這些非對角線元素，我們可以識別出模型容易將哪些類別互相混淆。例如，如果一個影像辨識模型經常將「貓」誤認為「豹」，那麼在混淆矩陣中，真實類別為「貓」而預測類別為「豹」的單元格會有較高的數值。這種視覺化的錯誤分佈有助於我們理解模型的弱點，並針對性地改進特徵工程或模型架構。

### 從混淆矩陣中可以導出哪些關鍵評估指標，以及它們各自的適用場景是什麼？

從混淆矩陣中可以導出多個關鍵評估指標，每個指標都從不同角度反映模型效能：
1.  **精確度 (Precision)**：衡量模型預測為正類別的樣本中，有多少是真正正類別的。適用於偽陽性成本較高的場景，例如垃圾郵件過濾（不希望將正常郵件誤判為垃圾）。
2.  **召回率 (Recall) / 敏感度 (Sensitivity)**：衡量所有真正正類別的樣本中，有多少被模型正確識別出來。適用於偽陰性成本較高的場景，例如疾病檢測（不希望漏診患病者）。
3.  **F1 分數 (F1-Score)**：精確度和召回率的調和平均數，在兩者之間取得平衡。適用於需要同時考慮精確度和召回率的場景，尤其是在類別不平衡時，它比單純的準確度更具參考價值。
4.  **特異度 (Specificity)**：衡量所有真正負類別的樣本中，有多少被模型正確識別出來。適用於需要確保模型能正確識別負類別的場景，例如在疾病篩查中，確保健康者不被誤診。
選擇哪個指標取決於具體的業務目標和不同錯誤類型所帶來的成本。透過混淆矩陣，我們可以根據這些指標的表現，更全面地評估和優化模型。

---

來源：https://aiterms.tw/terms/confusion-matrix
快查頁：https://aiterms.tw/terms/confusion-matrix
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-confusion-matrix