---
title: "雙語評估替代指標（Bilingual Evaluation Understudy）"
slug: bilingual-evaluation-understudy
language: zh-TW
source: https://aiterms.tw/terms/bilingual-evaluation-understudy
updated_at: 2026-07-30
tags: [自然語言處理, 模型評估, 大型語言模型, AI基礎]
ipas_term: false
---

# 雙語評估替代指標（Bilingual Evaluation Understudy）

雙語評估替代指標（BLEU，Bilingual Evaluation Understudy）是機器翻譯品質評估的自動化量化指標，透過比對機器翻譯輸出與人工參考譯文中 n-gram 的重疊程度，給出 0

## 完整說明

雙語評估替代指標（BLEU，Bilingual Evaluation Understudy）由 IBM 研究員 Kishore Papineni 等人於 2002 年提出，是自然語言處理領域最廣泛使用的機器翻譯自動評估指標之一。BLEU 計算機器翻譯輸出（Candidate）與一組人工參考譯文（Reference）之間，1-gram 至 4-gram 的精確率（Precision），並乘以簡短懲罰因子（Brevity Penalty，BP）以避免系統輸出過短的翻譯。BLEU 分數介於 0 到 1 之間（通常以百分比表示，如 BLEU-40 代表 0.40），分數越高代表與參考譯文越接近。其優點

## 常見問題

### BLEU 分數的典型範圍是多少？多少分才算「好」？

BLEU 分數的合理範圍高度依賴語言對和任務類型，沒有通用的「好」的標準。在機器翻譯領域，以英語到德語（WMT 基準）為例，傳統統計翻譯系統約在 BLEU-20 到 25，早期 Transformer 模型達到 BLEU-28 左右，近年重要系統可達 BLEU-35 以上。中文翻譯因語言結構差異，同樣品質下 BLEU 分數通常低於歐洲語言對。原則上，在相同測試集和相同數量的參考譯文條件下，BLEU 分數高的系統通常翻譯品質較好；但跨測試集或跨語言對的比較無意義。在影像描述生成（Image Captioning）任務上，常見的 BLEU-4 分數在 30-40 之間。

### 現在還需要用 BLEU 嗎？有什麼更好的替代指標？

BLEU 仍是機器翻譯論文的標準報告指標，主要因為其歷史數據豐富、便於跨論文比較。但現代評估通常採用組合策略而非單一指標。語義感知型替代指標包括：BERTScore（利用 BERT 詞向量計算語義相似度，對同義詞替換不敏感）；COMET（Crosslingual Optimized Metric for Evaluation of Translation，基於多語言模型訓練，與人工評估相關性最高）；MQM（Multidimensional Quality Metrics，細粒度人工評估框架）。在生成式 AI 評估中，因任務多樣性更高，G-Eval（以 GPT 為評估者）等基於 LLM 的評估方式也逐漸流行。實務建議：BLEU 用於快速開發迭代，COMET 或人工評估用於最終發布前的品質確認。

### BLEU 在 iPAS AI 應用規劃師考試中是如何被考察的？

在 iPAS AI 應用規劃師中級考試中，BLEU 屬於自然語言處理模型評估的常見考點。典型考察方式包括：（1）BLEU 的定義與計算原理：n-gram 精確率、簡短懲罰因子、幾何平均的基本概念；（2）BLEU 的適用場景：機器翻譯品質自動評估，以及其在影像描述等其他生成任務中的應用；（3）BLEU 的侷限性：無法評估語義等效翻譯、句子層級不穩定、跨語言對不可比；（4）BLEU 與 ROUGE 的比較：BLEU 側重精確率（機器翻譯），ROUGE 側重召回率（文字摘要）。考試中最常考的是 BLEU 和 ROUGE 在適用場景上的區別，以及 BLEU 計算的核心邏輯。

---

來源：https://aiterms.tw/terms/bilingual-evaluation-understudy
快查頁：https://aiterms.tw/terms/bilingual-evaluation-understudy
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-bilingual-evaluation-understudy