---
title: "對齊稅（Alignment Tax）"
slug: alignment-tax
language: zh-TW
source: https://aiterms.tw/terms/alignment-tax
updated_at: 2026-06-22
tags: [大型語言模型, AI倫理與治理, AI基礎]
ipas_term: false
---

# 對齊稅（Alignment Tax）

模型在對齊（使其行為符合人類價值觀）過程中可能損失的性能，特別是在某些原始能力上的下降。

## 完整說明

對齊稅（Alignment Tax）是指為了使語言模型的行為更安全、更符合人類價值觀而進行的對齊訓練（如 RLHF）可能導致模型在某些原始能力（如編程、數學、原始性能）上的性能下降現象。

## 常見問題

### 如何判斷是否存在對齊稅？

需要進行系統化的性能測試，比較同一模型的對齊版本和原始版本。測試應涵蓋多個維度：原始任務（編程、數學、常識）、拒絕率、回答長度和詳細程度。使用標準基準如 HumanEval、GSM8K 進行定量評估。同時進行定性分析，看對齊後模型是否出現過度保守的行為。如果對齊版本在無害任務上性能明顯下降，就存在對齊稅。

### 如何減小對齊過程中的對齊稅？

可以採用多種方法：選擇導致對齊稅小的對齊技術（如 Constitutional AI 相比傳統 RLHF）；使用更大的模型（更大模型的對齊稅通常更小）；精心設計訓練數據，避免過度約束；使用分層對齊，針對不同任務採用不同對齊強度；進行多目標優化，同時優化性能和安全；定期測試和監控，確保對齊過程不會過度損害性能。

### 對齊稅是否是無法跨越的障礙？

不是。對齊稅是一個實際存在但可以減小的挑戰。許多研究表明，通過更好的對齊方法、更好的訓練數據、更大的模型容量，可以顯著減小甚至消除對齊稅。Constitutional AI 等新方法已經展示了在保持或改善安全性的同時維持性能的可能性。長期來看，隨著對齊技術的進步，對齊稅會變得更小。關鍵是采用持續改進的心態，而非認為這是固定的成本。

---

來源：https://aiterms.tw/terms/alignment-tax
快查頁：https://aiterms.tw/terms/alignment-tax
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-alignment-tax