---
title: "大型語言模型對齊（LLM Alignment）"
slug: llm-alignment
language: zh-TW
source: https://aiterms.tw/terms/llm-alignment
updated_at: 2026-06-22
tags: [AI安全, RLHF, AI倫理, 模型訓練, 負責任AI]
ipas_term: false
---

# 大型語言模型對齊（LLM Alignment）

讓大型語言模型的行為與人類價值觀、意圖及社會規範一致的技術與方法體系。

## 完整說明

LLM 對齊（LLM Alignment）是 AI 安全領域的核心課題，旨在確保大型語言模型的輸出和行為符合人類的預期意圖、倫理價值與社會規範，避免模型產生有害、偏見、欺騙或不受控的行為。主要技術路徑包含以人類反饋強化學習（RLHF）為代表的偏好學習方法、可驗證獎勵強化學習（RLVR）、以及基於憲法的 AI 訓練（Constitutional AI）等，是當前 AI 安全研究最活躍的領域之一。

## 常見問題

### RLHF 和 DPO 在對齊訓練中各自的優缺點是什麼？

RLHF（人類反饋強化學習）與 DPO（直接偏好優化）都是主流的對齊訓練技術，但工程實作上有明顯差異。RLHF 需要分三個階段：訓練獎勵模型、用 PPO 做強化學習微調、以及人工收集大量偏好資料；其優點是理論上更靈活，可以持續從人類反饋中改進，但訓練不穩定（PPO 超參數敏感）、計算資源需求高（同時需要策略模型、獎勵模型、參考模型），且獎勵模型本身可能被「駭」（reward hacking，模型找到讓獎勵模型打高分但實際不好的輸出）。DPO 直接從偏好對（好回答 vs. 差回答）計算損失函數，無需顯式訓練獎勵模型，訓練更穩定、成本更低、實現更簡單；缺點是靈活性較低，無法即時利用新的人類反饋動態調整。實際開發中，許多開源模型（如 Mistral、Llama 的對齊版本）採用 DPO，商業閉源模型（如 GPT-4、Claude）通常採用 RLHF 或其改進版本。

### 對齊做得好的模型，有可能過度拒絕請求嗎？

會，這是對齊研究的重要課題，稱為「過度謹慎」（Overcaution）或「過度對齊」。當模型被訓練成對任何可能有風險的關鍵詞都保守拒絕時，它可能無法回答正當的醫學問題、歷史研究、安全教育需求，甚至無法討論普通的小說或電影劇情。這種過度拒絕同樣是對齊失敗的一種形式，因為它降低了模型的有用性（Helpfulness），違背了 3H 框架中的 H1。Anthropic 的研究明確指出「拒絕無害請求和回應有害請求一樣是問題」。改善方向包含：更精細的有害性判斷（區分真實有害意圖與合法需求）、提供更好的使用情境分類訓練資料、以及讓模型在拒絕時提供替代幫助路徑。使用者遇到不合理拒絕時，提供明確的使用情境通常有助於讓模型做出更準確的判斷。

### 普通企業在部署 LLM 時，需要自己做對齊訓練嗎？

大多數情況下不需要，也不建議。商業 LLM 服務商（Anthropic、OpenAI、Google）已經在基礎模型上做了大量對齊工作，企業直接使用 API 即可獲得已對齊的模型。企業更應聚焦的是「應用層對齊」：透過系統提示詞（System Prompt）明確定義 AI 的角色、能力邊界和禁止行為；設計輸出驗證機制（Output Filtering）攔截不適合的回應；建立人工審核流程（Human-in-the-Loop）處理高風險決策；以及建立持續監控機制，蒐集實際使用中的對齊失敗案例並反饋改進。若企業有特定領域的對齊需求（如醫療行業的特殊倫理規範），可考慮在開源模型基礎上使用 DPO 進行領域特定的對齊微調，成本遠低於從頭訓練。

---

來源：https://aiterms.tw/terms/llm-alignment
快查頁：https://aiterms.tw/terms/llm-alignment
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-llm-alignment