---
title: "離線強化學習（Offline Reinforcement Learning）"
slug: offline-reinforcement-learning
language: zh-TW
source: https://aiterms.tw/terms/offline-reinforcement-learning
updated_at: 2026-06-22
tags: [強化學習, 模型訓練, AI應用, 最佳化]
ipas_term: false
---

# 離線強化學習（Offline Reinforcement Learning）

從預先收集的固定資料集學習策略，不與環境互動，適合昂貴或危險環境。

## 完整說明

離線強化學習（Batch RL）從已有資料集學習，不需與環境互動。區別於在線強化學習邊探索邊學習，離線方法適合環境互動成本高（自動駕駛、醫療）或環境危險（核電廠控制）的場景。主要挑戰是出分佈(out-of-distribution)問題：資料集外的狀態行為對訓練無幫助，但可能在學習過程引入，導致策略崩潰。

## 常見問題

### 離線強化學習中出分佈問題為何危害如此之大？

出分佈問題導致價值過估計和策略崩潰。假設資料集只含狀態A和B的轉移，未含C的轉移。若學到的策略傾向進入C狀態，Q值對C狀態的估計基於線性外插，通常過於樂觀。系統在C狀態採取在訓練集中未見的行為，結果可能極壞但Q值預測很高。智能體被吸引進入，性能崩潰。例如在自動駕駛中，訓練集無極端天氣場景，學到的策略可能在雪地快速轉向（訓練集中無此數據），導致翻車。解決方法是強制策略留在資料分佈內，或對分佈外狀態保守估計。

### 保守Q學習（CQL）如何防止過估計？

CQL在貝爾曼更新的目標值中加入懲罰項，對非資料狀態的Q值進行下界估計。關鍵修改是從max(Q(s',a'))改為min(E[Q(s',a')] - λ·log(π(a'|s')))，或更直接的形式：Q(s,a) ← Q(s,a) + α[r - λ·log(exp(Q(s,a))/Z) + γV_target(s') - Q(s,a)]。第一項-λ·log(...)懲罰高Q值，鼓勵保守估計。λ控制保守程度，λ大時估計更保守，λ小時接近標準Q學習。這樣在資料集外狀態，Q值被迫低估，不會誘導策略進入。實驗表明CQL有效防止出分佈問題，成為離線RL標準方法。

### 如何評估離線強化學習策略的性能？

直接在環境測試不可行（成本或安全原因），需使用離線評估方法。常用方法包括：一、重要性採樣(IS)，用舊策略數據估計新策略性能，但在長軌跡時方差爆炸；二、帶權重的IS(WIS)減小方差，但引入偏差；三、雙魯棒估計(DR)結合Q值和IS，在兩者平衡；四、模型為基礎評估，學習環境模型用新策略在模擬器評估，模型誤差可能導致評估偏差。實踐中常用多種方法交叉驗證。評估越準確，越能信心做出部署決策。

---

來源：https://aiterms.tw/terms/offline-reinforcement-learning
快查頁：https://aiterms.tw/terms/offline-reinforcement-learning
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-offline-reinforcement-learning