---
title: "增強生成評估（Augmented Generation Evaluation）"
slug: augmented-generation-evaluation
language: zh-TW
source: https://aiterms.tw/terms/augmented-generation-evaluation
updated_at: 2026-06-22
tags: [RAG, 評估指標, RAGAS, LLM-as-Judge, 生成式AI品質, AI評估]
ipas_term: false
---

# 增強生成評估（Augmented Generation Evaluation）

評估 RAG 系統輸出品質的方法論，量化模型在檢索增強場景下的忠實性、相關性和答案完整性。

## 完整說明

增強生成評估（Augmented Generation Evaluation）是針對 RAG（Retrieval-Augmented Generation）系統的品質評估框架，超越了傳統 NLP 的單一指標，從多個維度衡量系統表現。核心評估維度包括：答案忠實性（Faithfulness，回答是否基於所提供的檢索內容）、上下文相關性（Context Relevance，檢索到的文件是否與問題相關）、答案相關性（Answer Relevance，最終回答是否切題），三者共同確保 RAG 系統輸出的可信度與實用性。

## 常見問題

### RAGAS 的幾個評估指標之間有什麼關係，應該優先關注哪個？

RAGAS 的四個核心指標（忠實性、上下文精準率、上下文召回率、答案相關性）衡量 RAG 管線的不同環節，低分的指標指向不同的問題根源。忠實性低表示生成環節出現幻覺，是最嚴重的品質問題，直接影響系統的可信度，應優先改善。上下文精準率和召回率反映檢索品質，前者衡量精準度（有多少噪音），後者衡量完整性（有多少遺漏）。答案相關性反映最終回答是否切題，有時即使檢索和生成都正確，回答仍可能跑題。實務上建議按忠實性 → 上下文相關性（精準率和召回率）→ 答案相關性的優先順序改善，忠實性是 RAG 系統的底線品質要求。

### LLM-as-Judge 評估方法有什麼局限性？

LLM-as-Judge 使用大型語言模型來評判另一個模型的輸出，優點是能理解語意、不需要大量人工標注、可自動化運作。但有幾個重要局限：自我偏愛（Self-preference Bias）是指評估用的 LLM 傾向給與自己風格相近的輸出更高分；位置偏差（Position Bias）指評估者傾向偏好出現在特定位置（如第一個）的選項；詳細度偏差（Verbosity Bias）指評估者傾向認為較長的回答更好。這些偏差使得評估結果不完全客觀。緩解方法包括：多評估者投票（使用多個不同的 LLM 評估者）、設計明確的評分標準（Rubric）避免主觀判斷、定期與人工評估對比校準。完全依賴 LLM-as-Judge 而不做任何人工審核是有風險的。

### 如何在有限資源下快速建立 RAG 系統的評估機制？

有限資源下建立 RAG 評估機制的務實路徑是從小但關鍵的測試集開始。第一步，整理 50-100 個代表性的問題-答案-來源三元組（Golden Dataset），這些應涵蓋系統預期處理的核心使用場景；第二步，選擇一個輕量的評估框架（如 RAGAS），它能以 API 呼叫的方式自動計算忠實性等指標，不需要自行實作複雜邏輯；第三步，優先手動評估忠實性（10-20 筆，人工逐筆確認），因為這個指標最關鍵且最直觀；第四步，每次對系統做重要改動（換檢索模型、改 chunk 大小、換生成模型）後都在測試集上跑一次評估，追蹤指標變化趨勢。這個輕量流程能在不大量增加成本的前提下，確保系統品質有基本的監控保障。

---

來源：https://aiterms.tw/terms/augmented-generation-evaluation
快查頁：https://aiterms.tw/terms/augmented-generation-evaluation
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-augmented-generation-evaluation