---
title: "近端策略最佳化（Proximal Policy Optimization）"
slug: proximal-policy-optimization
language: zh-TW
source: https://aiterms.tw/terms/proximal-policy-optimization
updated_at: 2026-06-22
tags: [強化學習, 深度學習, 模型訓練, AI應用]
ipas_term: false
---

# 近端策略最佳化（Proximal Policy Optimization）

改進的策略梯度演算法，透過信賴域約束防止策略過大更新，提高訓練穩定性。

## 完整說明

近端策略最佳化（PPO）是策略梯度演算法的改進版本，於2017年發表後迅速成為工業界標準。PPO通過在目標函數中加入截斷機制，限制策略更新的幅度，防止單步更新導致策略崩潰。相比複雜的信賴域策略最佳化，PPO實現簡單而效果優異，在深度強化學習應用中最為廣泛。

## 常見問題

### PPO中ε超參數應如何選擇？

ε控制策略更新的邊界，其選擇影響訓練穩定性和收斂速度。通常範圍在0.1到0.3之間。ε=0.1表示新策略的概率可達舊策略的0.9到1.1倍，更新保守；ε=0.2則為0.8到1.2倍，更激進。選擇時應考慮行為空間大小和任務複雜度。小ε(0.1)適合複雜任務和高維行為空間，確保穩定；大ε(0.3)適合簡單任務，加快收斂。實踐中推薦從0.2開始，然後根據訓練曲線調整。若loss波動大則減小ε；若收斂慢則增大ε。

### 為什麼PPO需要對批次數據進行多次更新？

PPO收集固定批次後進行多次梯度步。第一次更新後，所有參數改變，下次用相同批次更新時參數-數據分布已不匹配。不過在限定更新次數和截斷約束下，舊數據仍有價值。多次更新的優勢是提高樣本利用率，每個採集的樣本被使用多次。缺點是容易過擬合批次，導致訓練不穩定。通常更新3-10次較為適當。若超過此範圍，應檢查批次大小是否過小，或考慮採樣新數據。

### PPO與RLHF結合如何確保LLM對齐人類價值？

RLHF流程分三步：一、有監督微調基礎模型；二、訓練獎賞模型預測人工評分；三、用PPO根據獎賞模型分數優化模型輸出。PPO的優勢在於能穩定地根據獎賞信號改進，同時通過截斷防止模型為追求獎賞分數做出極端行為。此外加入KL散度約束懲罰偏離原始模型過遠的策略，維持模型能力。整體來看PPO能逐步引導模型輸出更符合人類評分標準的內容，而非完全改寫模型。

---

來源：https://aiterms.tw/terms/proximal-policy-optimization
快查頁：https://aiterms.tw/terms/proximal-policy-optimization
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-proximal-policy-optimization