---
title: "Q學習（Q-Learning）"
slug: q-learning
language: zh-TW
source: https://aiterms.tw/terms/q-learning
updated_at: 2026-06-22
tags: [強化學習, 模型訓練, 最佳化, AI基礎]
ipas_term: false
---

# Q學習（Q-Learning）

一種無模型的強化學習演算法，透過估計狀態-行為對的價值函數來找到最優策略。

## 完整說明

Q學習是強化學習中最基礎的演算法之一。它不需要環境模型，只透過與環境互動收集經驗，逐步更新狀態-行為對的價值估計（Q值），最終收斂到最優策略。使用貝爾曼方程更新Q值，是尋找離散決策問題最優解的有力工具。

## 常見問題

### 為什麼Q學習需要分別探索和利用？

純粹的貪心策略只選擇當前Q值最高的行為，容易陷入局部最優而無法發現更好的行為。但無限探索又浪費時間。折衷方案ε-貪心策略以小概率ε隨機探索，以大概率1-ε利用最優行為。這樣既能逐漸發現全局最優解，又不浪費太多時間在次優行為上。隨著學習進行逐漸降低ε，最終完全利用學到的策略。

### Q學習的收斂條件是什麼？

Q學習在滿足特定條件時能夠保證收斂到最優Q值。主要條件包括：一、所有狀態-行為對都被訪問無窮多次；二、學習率α按照特定速率遞減，通常要求Σα=∞且Σα²<∞。實踐中第一個條件最關鍵，需要充分探索。第二個條件通常設定為α_t = 1/t或類似遞減方案。在有限狀態空間中，這些條件易於滿足，Q值最終收斂。

### Q學習如何處理連續狀態空間？

標準Q學習用表格儲存Q值，無法直接處理無限連續狀態。解決方案有兩類：一是離散化，將連續空間分成有限格子，損失精度但保持簡單；二是函數逼近，用神經網路或其他函數估計Q(s,a)，這導向DQN等深度Q學習方法。DQN使用卷積神經網路從高維觀測直接學習Q值，大幅拓展了應用範圍。選擇哪種方案取決於問題的狀態空間維度和精度需求。

---

來源：https://aiterms.tw/terms/q-learning
快查頁：https://aiterms.tw/terms/q-learning
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-q-learning