---
title: "人類回饋強化學習（RLHF）"
slug: rlhf
language: zh-TW
source: https://aiterms.tw/terms/rlhf
updated_at: 2026-07-29
tags: [強化學習, 大型語言模型, 模型訓練, 自然語言處理, 生成式AI, AI倫理與治理]
ipas_term: false
---

# 人類回饋強化學習（RLHF）

> **你用聊天 AI 時，有沒有覺得它越來越像人、也越來越懂你的偏好？**
>
> 你可以把 RLHF 想成先看人怎麼選答案，再用這些回饋去調整模型行為。
>
> 它重要是因為純預訓練的模型不一定懂人類想要什麼，RLHF 可以把「好用」拉近到「會講」旁邊。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **RLHF vs 獎勵建模**
>
> RLHF 是整個流程
> 獎勵建模是流程中的一個環節
> 最關鍵的區別是全流程和其中一步。
>
> **RLHF vs 監督式微調**
>
> RLHF 用人類偏好與強化學習更新模型
> 監督式微調主要是拿標準答案直接學
> 最關鍵的區別是學答案還是學偏好。
>

### 記住這句就好

> 先學人喜歡什麼，再把模型往那裡推。

### 實際案例

> **對話助理**
> 先收集人類對多個回答的偏好，再讓模型學會更有幫助、比較安全的回覆方式。
>
> **摘要系統**
> 如果使用者偏好簡短、準確、沒廢話的答案，RLHF 可以把這些偏好帶進模型。
>

### 算法與應用

> 典型流程是蒐集偏好資料、訓練 reward model、再用強化學習更新語言模型。
> 它的目標不是只讓模型更聰明，而是讓它更符合人類使用習慣。
> 成本高、資料貴、流程長，是它最常見的代價。

### 三個階段拆開看

| 階段 | 在做什麼 | 產出 |
| --- | --- | --- |
| 監督式微調（SFT） | 用人寫的示範答案做一般微調 | 一個會照格式回答的基礎模型 |
| 獎勵模型訓練（RM） | 人類對同一題的多個回答排序，訓練一個會打分的模型 | 一個能預測「人比較喜歡哪個」的評分器 |
| 強化學習微調（PPO 等） | 讓語言模型去最大化獎勵模型給的分數 | 對齊過的最終模型 |

> 三個階段缺一不可，但真正花錢的是第二階段的人工排序。獎勵模型的品質直接決定最終模型的上限，因為第三階段是拿獎勵模型當老師，老師打分不準，學生就往錯的方向跑。
>
> 第三階段一定會加一個 KL 散度懲罰項，限制新模型不要離 SFT 模型太遠。沒有這個限制，模型會找到獎勵模型的漏洞，產出分數很高但實際很怪的答案，這叫獎勵駭客（reward hacking）。

### 考題會怎麼問

> 這個詞在考題裡出現，通常是四選一的形式，題幹描述「人類針對模型輸出給回饋，模型據此調整」，選項會放預訓練、微調、RLHF、向量化。判準只有一句：**有沒有人類的偏好回饋參與訓練迴路**。
>
> **預訓練**：只有大量文字，沒有人在旁邊評價，學的是預測下一個字。
>
> **微調（fine-tuning）**：有標準答案，但沒有「比較哪個比較好」這件事。
>
> **RLHF**：有人類針對多個輸出排序或評分，而且這個回饋被拿去更新模型。
>
> **向量化**：把文字轉成數字表示，跟訓練回饋無關。
>
> 另一種常考的問法是「RLHF 的目的主要是什麼」，答案是讓模型輸出更符合人類偏好與安全期待，不是讓模型知識更多，也不是讓模型跑更快。

### 常見的替代做法

> **DPO（Direct Preference Optimization，直接偏好最佳化）**：跳過訓練獎勵模型與強化學習，直接用偏好資料對，以一個分類式的損失函數更新模型。流程短很多、比較穩定，是近年常見的替代路線。
>
> **RLAIF（人工智慧回饋強化學習）**：把「人類排序」換成「另一個模型排序」，成本大幅下降，代價是把評分模型的偏誤一起學進來。
>
> **憲法式 AI（Constitutional AI）**：先寫一組原則，讓模型依原則自我批改，再拿修正後的資料訓練。同樣是為了減少人力標註。

### 情境判斷

> **Q1（直覺題）：如果模型先看人類對回答的排序偏好，再調整自己的輸出，這是什麼？**
>
> → 這就是 RLHF。
>
> **Q2（判斷題）：只要做了 RLHF，模型就不會出現危險回答嗎？**
>
> → 不能保證。它能改善對齊，但仍要搭配安全規則、測試和監控。
>

### 常見問題

> **Q：RLHF 中如何確保人類回饋品質？**
> A：要靠清楚標準、標註訓練和一致性檢查，不是隨便打分就行。
>
> **Q：RLHF 的成本高嗎？**
> A：通常很高，因為它需要大量偏好資料和多階段訓練。
>
> **Q：RLHF 可以用在所有 AI 系統嗎？**
> A：不一定，只有在「人類偏好很重要」的任務裡，投資才比較值得。
>

### 相關術語

> - **強化學習**：讀完這個，再回來看主題會更完整。
> - **獎勵函數**：它是強化學習最直接的分數來源，兩者一定一起看。
> - **獎勵建模**：先看這個，再回頭看獎勵函數，會更懂偏好怎麼變成分數。
> - **對齊校準**：獎勵建模和 RLHF 的目標都跟它有關。
> - **人工智慧安全**：讀完這個，再回來看主題會更完整。

---

來源：https://aiterms.tw/terms/rlhf
快查頁：https://aiterms.tw/terms/rlhf
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-rlhf