---
title: "獎賞塑形（Reward Shaping）"
slug: reward-shaping
language: zh-TW
source: https://aiterms.tw/terms/reward-shaping
updated_at: 2026-06-22
tags: [強化學習, 模型訓練, AI應用, 最佳化]
ipas_term: false
---

# 獎賞塑形（Reward Shaping）

修改強化學習的獎賞函數以加快收斂和改進學習效率的技術。

## 完整說明

獎賞塑形是在強化學習中設計或修改獎賞函數的技術，目的是指導智能體更有效地探索和學習。不同於改變問題本身，獎賞塑形透過添加額外獎賞信號來塑形智能體的行為，加快學習速度。常見方法包括路徑獎賞、潛在函數獎賞等，需小心使用以避免改變問題的最優策略。

## 常見問題

### 什麼時候應該使用獎賞塑形？

當原始任務獎賞過於稀疏，導致智能體難以學習時，獎賞塑形最有用。例如從零開始學習視頻遊戲，若只在贏得遊戲時+1獎賞，其他時刻全零，智能體難以探索。添加中間獎賞（如擊敗敵人+0.1、獲得金幣+0.05）可大幅加快學習。但當獎賞已足夠密集或問題相對簡單時，獎賞塑形收益不大。判斷方法是看無塑形訓練的收斂速度，若極慢則考慮加塑形。

### 獎賞塑形如何避免改變最優策略？

使用潛在函數基礎塑形。定義狀態價值函數Φ(s)編碼領域知識，塑形獎賞為F(s,a,s') = γΦ(s') - Φ(s)。加上此塑形後，馬可夫決策過程的最優策略保持不變，只改變價值估計。例如在導航中，設Φ(s) = -distance_to_goal(s)，則塑形獎賞獎勵朝向目標移動，而不改變最優路徑（取決於障礙物）。不過實踐中許多應用為簡化使用非潛在函數塑形，接受輕微改變，透過小心調整權重控制影響。

### 獎賞塑形的權重應如何設置？

獎賞塑形權重決定了塑形獎賞相對於原始獎賞的重要性。通常設置方式為R'(s,a,s') = R(s,a,s') + w·F(s,a,s')，其中w是權重。推薦從小權重開始，如0.01或0.1，觀察學習曲線。若訓練加速且最終性能不變，說明權重合適。若性能下降，說明塑形過度，應減小權重。動態調整也有效，初期w較大幫助探索，後期逐步減小至零，讓原始獎賞主導最終優化。權重設置是經驗工程，沒有通用公式。

---

來源：https://aiterms.tw/terms/reward-shaping
快查頁：https://aiterms.tw/terms/reward-shaping
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-reward-shaping