---
title: "深度Q學習（Deep Q-Learning）"
slug: deep-q-learning
language: zh-TW
source: https://aiterms.tw/terms/deep-q-learning
updated_at: 2026-06-23
tags: [深度強化學習, 值函數, 離散控制, Atari遊戲]
ipas_term: false
---

# 深度Q學習（Deep Q-Learning）

結合深度神經網路與Q學習的強化學習算法，能在高維狀態空間中進行最優決策。

## 完整說明

深度Q學習（Deep Q-Learning, DQN）將深度神經網路用作Q函數的函數逼近器，解決了標準Q學習在高維狀態空間（如像素級影像）中的可擴展性問題。DQN 使用經驗回放與目標網路等技術穩定訓練，是現代強化學習的里程碑式算法。

## 常見問題

### 為什麼DQN需要經驗回放？直接用新樣本訓練不行嗎？

直接訓練會出現嚴重問題。強化學習的樣本是由智能體與環境交互產生，連續動作產生的狀態高度相關（今天的狀態與昨天非常相似）。若直接用相關樣本訓練神經網路，容易導致：第一，梯度更新方向偏差很大，網路發散；第二，網路對某類狀態過擬合；第三，樣本效率極低。經驗回放透過隨機抽樣打破相關性，使訓練就像處理獨立同分布的監督資料一樣穩定。

### DQN中為什麼不能用同一個網路同時作為線上網路和目標網路？

若用同一個網路，Bellman目標和預測會互相影響。假設網路剛剛提高了Q(s',a')的估計，那麼計算s的目標時會用這個高估的Q值，導致s的目標也被高估，接著這個高估又會影響其他狀態的目標計算。這個反饋迴圈使訓練振盪甚至發散。使用獨立的目標網路（定期複製，但更新慢）就能打破這個循環，目標變得更穩定。

### DQN的局限性是什麼？為什麼後來又有雙倍DQN、決鬥DQN等變體？

DQN存在高估（Overestimation）偏差：在max Q(s',a')運算中，選擇最高Q值的動作，如果這些估計都偏高，結果就會系統性地高估。高估導致智能體高估某些不良策略的價值，訓練時傾向採取這些策略，降低性能。雙倍DQN通過解耦動作選擇與評估來解決；決鬥DQN分離狀態價值與優勢估計以降低方差。這些改進逐步解決了DQN的問題。

---

來源：https://aiterms.tw/terms/deep-q-learning
快查頁：https://aiterms.tw/terms/deep-q-learning
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-deep-q-learning