---
title: "基於模型的強化學習（Model-based Reinforcement Learning）"
slug: model-based-reinforcement-learning
language: zh-TW
source: https://aiterms.tw/terms/model-based-reinforcement-learning
updated_at: 2026-06-22
tags: [強化學習, 模型訓練, 深度學習, 最佳化]
ipas_term: false
---

# 基於模型的強化學習（Model-based Reinforcement Learning）

學習環境模型（動態和獎賞），用模型進行規劃而非直接與環境互動的強化學習方法。

## 完整說明

基於模型的強化學習(Model-based RL)與無模型方法相對。智能體首先學習環境的轉移模型（狀態如何演化）和獎賞函數，然後利用模型進行規劃（如蒙地卡羅樹搜索）找到最優動作。優勢是樣本效率高，單次與環境互動能提取豐富信息；缺點是模型誤差累積，規劃成本高。兩類方法各有應用場景。

## 常見問題

### 基於模型的強化學習相比無模型方法的主要優勢是什麼？

主要優勢是樣本效率。無模型方法每個環境互動只得到一個獎賞信號，學習慢。基於模型方法用一次互動訓練模型，模型允許多次規劃，從單次經驗提取多個價值估計。例如環境互動一次得到s→s'轉移，無模型只得一個獎賞，模型方法能用模型預測該狀態對後續許多步的影響，信息利用率高得多。在樣本有限的場景（真實機器人、危險環境）優勢明顯。缺點是模型誤差累積，規劃成本高。選擇應基於環境互動成本與計算資源的權衡。

### 如何應對基於模型強化學習中的模型誤差問題？

應對模型誤差有多個策略。首先短地平線規劃限制誤差累積，只規劃若干步（如10步）而非完整軌跡，定期重規劃適應環境變化。其次魯棒規劃在最壞情況下優化，假設模型有擾動，找最壞情況下最優決策。第三模型不確定性估計，用集合模型或貝葉斯模型提供置信區間，在不確定區域減少信任模型。第四線上重校準，定期用環境新數據校準模型。第五混合無模型方法，用無模型策略梯度微調模型規劃的結果。綜合應用多種方法能顯著減小誤差影響。

### 蒙地卡羅樹搜索如何與深度學習結合達到超人性能？

AlphaGo和AlphaZero的成功結合了幾個關鍵要素。首先用深度神經網路學習遊戲模型（規則），使得樹搜索能在學習表示上進行。其次用價值網路評估局面，指導搜索優先選擇高價值分支，減少所需搜索深度。第三用策略網路快速預測下一步最可能的著法，減少搜索寬度。四、採用自玩，系統與自己對弈，不斷改進網路和搜索。MCTS的魯棒性結合深度學習的表示能力，使系統既能精確計劃又能學習通用策略。這是目前強化學習性能最優的方法之一。

---

來源：https://aiterms.tw/terms/model-based-reinforcement-learning
快查頁：https://aiterms.tw/terms/model-based-reinforcement-learning
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-model-based-reinforcement-learning