---
title: "內在評估（Intrinsic Evaluation）"
slug: intrinsic-evaluation
language: zh-TW
source: https://aiterms.tw/terms/intrinsic-evaluation
updated_at: 2026-07-30
tags: [評估指標, 自然語言處理, 基準測試, 模型評估, 質量控制]
ipas_term: false
---

# 內在評估（Intrinsic Evaluation）

在特定子任務上直接評估模型或表示的質量，如詞向量的類比任務，不涉及下游應用。

## 完整說明

內在評估（Intrinsic Evaluation）是評估 NLP 模型或表示方法的一種方式，在特定的子任務或基準上直接衡量其質量，而不將其應用於真實的下游任務。例如，評估詞向量時使用詞類比任務（King - Man + Woman ≈ Queen）或詞相似度任務，評估語言模型時測試困惑度。內在評估通常快速、可重複，但不一定反映實際應用性能。

## 常見問題

### 詞向量在詞類比上準確率 80%，但下游文本分類只有 70% F1，說明什麼？

說明詞向量較好地捕捉了靜態語義（詞的相似性與關係），但文本分類還需要其他信息：序列上下文、詞序、句法結構、甚至領域特定的詞義。詞向量只是特徵的一部分。改進策略包括：第一，嘗試更強大的上下文化詞向量（ELMo、BERT），它們在詞類比上不一定最優，但捕捉序列信息更強。第二，改進下游模型架構，如用 RNN 或 Transformer 代替簡單的平均池化。第三，加入額外特徵（詞性、情感詞典）。這個例子說明內在評估不能完全預測外在表現。

### 困惑度 5 好還是 50 好？如何比較不同模型的困惑度？

困惑度越低越好，5 遠優於 50。但困惑度的絕對值難以直觀解讀，主要用於比較。比較時需要注意：第一，相同的測試集與預處理：不同詞表大小、未知詞處理方式會改變困惑度。第二，相同的訓練資料量與質量：訓練資料多的模型通常困惑度更低。第三，模型類型相同：比較兩個 LSTM 的困惑度有意義，但比較 n-gram 模型與神經模型的困惑度容易誤導（詞表大小、平滑方式差異）。最安全的做法是在固定實驗設置下（同一份測試集、預處理、詞表）比較相對改進，而非絕對值。

### BLEU 分數 25 說明翻譯質量如何？

很難直觀判斷。BLEU 是相對指標，需要參照點才有意義。業界粗略標準是：BLEU < 10 表示翻譯可讀性很低；10–20 是可讀但不夠自然；20–30 是可接受品質；30–40 是不錯；40+ 是高質量。但這些標準因語言對、域、參考數量而異。例如，中英翻譯的 BLEU 通常低於英德翻譯（語言差異）；多個參考翻譯時 BLEU 分數會升高。最好的做法是與人工評估並行，或與強基線（如商用系統）比較相對改進。許多研究者現在傾向於用更新的指標（如 BERTScore、METEOR），或直接進行人工評估，因為 BLEU 與人工評分的相關性只有 0.4–0.6。

---

來源：https://aiterms.tw/terms/intrinsic-evaluation
快查頁：https://aiterms.tw/terms/intrinsic-evaluation
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-intrinsic-evaluation