---
title: "精確率與召回率（Precision and Recall）"
slug: precision-and-recall
language: zh-TW
source: https://aiterms.tw/terms/precision-and-recall
updated_at: 2026-07-30
tags: [模型評估, 混淆矩陣, F1 Score, ROC曲線, 分類指標]
ipas_term: false
---

# 精確率與召回率（Precision and Recall）

分類模型評估的核心指標：精確率衡量預測為正的樣本有多準確，召回率衡量實際為正的樣本被找回多少。

## 完整說明

精確率（Precision）是所有被模型預測為正類的樣本中，真正屬於正類的比例；召回率（Recall，又稱靈敏度或查全率）是所有實際為正類的樣本中，被模型正確識別出來的比例。兩者之間通常存在取捨關係（Trade-off），實務中常用 F1 Score 作為兩者的調和平均數。

## 常見問題

### 如何根據業務需求在精確率和召回率之間取捨？

核心問題是：「假陽性（誤報）和假陰性（漏報）哪個代價更高？」在醫療癌症篩檢中，漏報（把有病的人診斷為無病）的代價遠高於誤報（把健康人誤判為需要進一步檢查），所以優先追求高召回率，允許較低的精確率。在內容審核（如色情內容偵測）中，誤報（誤刪正常內容）可能引發用戶投訴和法律風險，因此優先追求高精確率，允許部分違規內容漏網。在電商推薦系統中，若用戶的注意力有限，推薦結果中每個結果都要準確，精確率更重要。建議將業務目標轉化為具體的精確率 / 召回率最低要求，再調整閾值或選擇模型。

### F1 Score 是什麼？為什麼要用調和平均而不是算術平均？

F1 Score 是精確率和召回率的調和平均數（Harmonic Mean），公式為 2×P×R/(P+R)。使用調和平均而非算術平均的原因是：調和平均數對極端值的懲罰更重。假設精確率為 1.0、召回率為 0.01，算術平均為 0.505，看起來還不錯；但調和平均（F1）只有約 0.02，更真實地反映出模型在召回率上幾乎失效的事實。也就是說，只有精確率和召回率都比較高時，F1 Score 才會高；如果其中一個很低，F1 就會被拉低到接近那個低值。這正是 F1 的設計初衷：同時要求兩個指標都要好，不允許以一換一。

### ROC-AUC 和 AUPRC 有什麼差別？在不平衡資料中應該用哪個？

ROC 曲線繪製的是不同閾值下真正例率（召回率）vs. 假正例率（FPR = FP/(FP+TN)）的曲線；AUPRC（PR 曲線下面積）繪製的是精確率 vs. 召回率的曲線。在類別嚴重不平衡的情境下，ROC-AUC 可能過於樂觀：因為負類樣本數量巨大，即使 FP 很多，FPR 仍可能很低，使 ROC 曲線看起來很好，但精確率實際上極差。AUPRC 不受真負例（TN）影響，更聚焦在少數類（正類）的識別能力上，能更真實地反映模型在不平衡場景中的實際價值。因此，在詐騙偵測、罕見疾病診斷等不平衡分類任務中，建議以 AUPRC 作為主要評估指標。

---

來源：https://aiterms.tw/terms/precision-and-recall
快查頁：https://aiterms.tw/terms/precision-and-recall
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-precision-and-recall