---
title: "模型基準測試（Bench）"
slug: bench
language: zh-TW
source: https://aiterms.tw/terms/bench
updated_at: 2026-06-27
tags: [模型評估, 大型語言模型, AI基礎, source:arxiv]
ipas_term: false
---

# 模型基準測試（Bench）

模型基準測試是一套標準化的評估任務與資料集，用來客觀衡量並比較不同 AI 模型的各項性能與實際能力。

## 完整說明

模型基準測試（Benchmark）是一種標準化的評估機制與資料集集合，用於客觀且量化地衡量人工智慧模型的各項性能。它能夠比較不同模型在特定任務上的優劣，常見應用包括評估大型語言模型的常識推理能力與程式生成正確率等。

## 常見問題

### 為何很多模型在 Benchmark 拿高分，但實際使用卻覺得很笨？

這主要是因為『過度擬合基準』以及真實場景的複雜性。許多模型在開發時，會特意針對公開基準的題型進行優化，甚至無意間將測試數據混入訓練集中（數據污染），導致分數虛高。此外，基準測試通常是結構化、有標準答案的短任務，而真實使用者的提問往往模糊不清、缺乏上下文或需要長篇幅的互動。這些真實世界的挑戰是靜態測試難以涵蓋的，導致了跑分與實際體感之間的落差，這也是目前模型評估領域極需克服的難題。

### 什麼是 LLM-as-a-Judge？它與傳統基準測試指標有何不同？

傳統基準測試多依賴精確匹配或字面重合度來評估，這在面對開放式生成任務時非常僵化。LLM-as-a-Judge 是一種新興的評估方法，它利用更強大的語言模型（如 GPT-4）擔任裁判，根據預設的準則（如邏輯性、幫助程度）去評分其他模型的輸出。這比傳統指標更接近人類判斷標準，能更好理解字面意義之外的語意關聯與細微差別，成為評估生成式 AI 的核心手段，並大幅降低了人工評估的成本與時間。

### 企業想導入 AI 進行內部知識問答，應該看哪些 Benchmark 指標？

對於企業內部知識問答場景，通用知識基準（如 MMLU）的參考價值較低。企業應重點關注與 RAG（檢索增強生成）能力相關的測試，例如評估模型從給定文本中提取資訊準確度的指標，以及測量幻覺率（Hallucination Rate）的測試，確保模型不會在找不到答案時胡編亂造。更具體來說，企業最佳的作法是利用內部的真實業務數據，建構一套專屬的私有基準測試，這樣測出的結果才最符合實際導入的商業價值與需求。

---

來源：https://aiterms.tw/terms/bench
快查頁：https://aiterms.tw/terms/bench
最後更新：2026/06/27
深度解說：https://aiterms.tw/learning/what-is-bench