---
title: "信任域策略優化（Trust Region Policy Optimization）"
slug: trust-region-policy-optimization
language: zh-TW
source: https://aiterms.tw/terms/trust-region-policy-optimization
updated_at: 2026-07-30
tags: [策略梯度, 強化學習, 連續控制, 信任區域]
ipas_term: false
---

# 信任域策略優化（Trust Region Policy Optimization）

一種策略梯度方法，透過限制策略更新的範圍以保證單調性改進的強化學習算法。

## 完整說明

信任域策略優化（TRPO）是一種基於策略的強化學習算法，在策略梯度的基礎上引入「信任域」的概念，限制每次更新時新舊策略的差異（用KL散度衡量），以保證目標函數單調遞增且避免破壞性的大幅更新。TRPO是近代策略梯度方法（如PPO）的理論基礎。

## 常見問題

### TRPO為什麼比普通策略梯度更穩定？

普通策略梯度每次更新策略，新舊策略可能差異很大，導致目標函數變差。TRPO限制新舊策略的KL散度，使更新始終在「信任區域」內。在這個區域，替代目標與真實目標高度相關，保證更新後性能不會下降。此外，TRPO使用自適應的學習率（透過共軛梯度與直線搜索），能自動調整更新步長，進一步提高穩定性。

### 為什麼TRPO用共軛梯度而不是簡單的梯度下降？

TRPO面臨的是一個帶KL散度約束的最優化問題，屬於二次規劃。共軛梯度法是專為這類問題設計的高效求解器，能在二階海森矩陣的方向上快速收斂，遠優於一階梯度下降。但這也是TRPO計算複雜度高的原因：求解每次更新都需多次迭代。PPO的創新之一就是用簡單的損失罰項代替硬約束，避免了這種複雜計算。

### TRPO的信任域大小δ怎麼設定最好？

δ的選擇需要權衡收斂速度與穩定性。δ過大時，限制形同虛設，容易出現大幅負面更新；δ過小時，每次更新幅度太小，收斂緩慢。常見的做法是設定δ為0.01到0.05之間的固定值，或根據實驗動態調整。實務中，許多實現會用直線搜索（Line Search）找到滿足KL約束的最大步長，這樣可以自動平衡。

---

來源：https://aiterms.tw/terms/trust-region-policy-optimization
快查頁：https://aiterms.tw/terms/trust-region-policy-optimization
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-trust-region-policy-optimization