---
title: "逆向強化學習（Inverse Reinforcement Learning）"
slug: inverse-reinforcement-learning
language: zh-TW
source: https://aiterms.tw/terms/inverse-reinforcement-learning
updated_at: 2026-07-30
tags: [強化學習, 專家演示, 獎勵學習, 自駕車]
ipas_term: false
---

# 逆向強化學習（Inverse Reinforcement Learning）

從專家演示的行為推斷潛在獎勵函數的強化學習方法。

## 完整說明

逆向強化學習（IRL）反轉強化學習的過程，已知智能體的最優行為軌跡（通常來自專家演示），推斷驅動該行為的獎勵函數。IRL在缺乏明確獎勵定義的複雜任務中非常有用，如自駕車、機器人學習等，透過觀察與學習人類專家的決策邏輯。

## 常見問題

### 為什麼不直接用行為克隆，非要推斷獎勵函數？

行為克隆有致命缺陷：分布移位。訓練時狀態遵循專家軌跡的分布，但部署時智能體的狀態分布會偏移（因為模型不完全正確），每個小錯誤累積下去導致大的策略偏差。舉例：學習自駕，訓練資料中大多是正常行駛，偶爾出現緊急制動。若模型在某個微妙差異上出錯，導致偏離正常軌道，它沒學過如何從異常狀態恢復（不在訓練分布中），錯誤就會不可逆轉地惡化。IRL推斷獎勵後，新策略在任何狀態都知道如何最大化獎勵，自動適應分布偏移。

### IRL推斷出來的獎勵為什麼會不唯一？

多個獎勵函數可以產生相同的最優策略。簡單例子：走到目標的任務，獎勵可以是「1/距離」、「2/距離」或任何線性放縮。只要獎勵函數保持相同的相對大小關係，最優行為就完全相同。Maximum Entropy IRL透過選擇熵最大的獎勵（對未觀測狀態做最小假設）來處理這個非唯一性，但從原則上講獎勵確實無法完全恢復，只能恢復「與專家行為一致的某個獎勵」。

### IRL能處理非理性的專家演示嗎？

標準IRL假定專家是最優決策者，如果專家有習慣性行為、策略性欺騙或決策偏差，IRL會學到錯誤的獎勵。現代研究正在探索Robust IRL，允許一定比例的次優演示，或者學習專家的不完全理性決策過程。但這增加複雜度，目前仍是開放研究方向。在實務中，應該篩選高品質的專家演示，或收集多位不同專家的演示以提高魯棒性。

---

來源：https://aiterms.tw/terms/inverse-reinforcement-learning
快查頁：https://aiterms.tw/terms/inverse-reinforcement-learning
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-inverse-reinforcement-learning