---
title: "模型評估（Model Evaluation）"
slug: model-evaluation
language: zh-TW
source: https://aiterms.tw/terms/model-evaluation
updated_at: 2026-06-27
tags: [模型評估, 機器學習, 模型訓練, MLOps, source:ipas]
ipas_term: true
---

# 模型評估（Model Evaluation）

模型評估是衡量機器學習模型在未知資料上表現的過程，透過特定指標來確保模型的泛化能力與實用性。

## 完整說明

模型評估是一種衡量機器學習模型效能的系統性方法，用於確認模型在未知數據上能否準確預測。它能夠幫助開發者找出模型過擬合或欠擬合的問題，常見應用包括分類任務的精確率計算、迴歸誤差測量，以及商業場景的風險評估與決策支援。

## iPAS 考試出題分析

屬於未分類考範圍。

## 常見問題

### 什麼是交叉驗證，為什麼我們需要它？

交叉驗證（Cross-Validation）是一種將數據集重複切分為訓練集與驗證集以多次評估模型的方法，最常見的是 K 折交叉驗證。我們需要它主要是為了避免數據劃分的隨機性導致的評估偏差。如果只切分一次，模型可能剛好在一個容易的測試集上表現很好，而在實際應用中失敗。透過多次不同的切分並計算平均效能，交叉驗證能提供更穩健、更客觀的模型泛化能力評估，尤其在數據量較少的情況下更為重要。

### 準確率很高，但模型實際上線卻沒用，為什麼？

這通常是因為遇到了「類別不平衡」問題。例如，在 1000 筆信用卡交易中只有 1 筆是盜刷。如果模型直接全部猜測正常，準確率高達 99.9%，但它永遠抓不到那一筆盜刷，失去商業價值。在這種情況下不能單獨依賴準確率，必須轉換評估視角，使用精確率（Precision）、召回率（Recall）、F1-Score 或 PR 曲線來綜合評估模型辨識少數關鍵類別的能力，確保符合真實業務需求。

### 模型評估中的「資料外洩」如何避免？

資料外洩會讓模型在評估時產生虛假的高分。要避免這種情況，最核心的原則是「先切分，後處理」。必須在進行任何資料轉換（如標準化、缺失值填補）前，先將測試集完全獨立切分出來。所有的統計量只能從訓練集中計算，再將相同規則套用到測試集。處理時間序列時，必須嚴格按照時間順序切分，絕對不能讓未來的數據混入訓練集中，這樣才能確保評估的客觀與公正。

---

來源：https://aiterms.tw/terms/model-evaluation
快查頁：https://aiterms.tw/terms/model-evaluation
最後更新：2026/06/27
深度解說：https://aiterms.tw/learning/what-is-model-evaluation