---
title: "學習率預熱（Learning Rate Warmup）"
slug: learning-rate-warmup
language: zh-TW
source: https://aiterms.tw/terms/learning-rate-warmup
updated_at: 2026-06-22
tags: [模型訓練, 最佳化, 神經網路, 深度學習]
ipas_term: false
---

# 學習率預熱（Learning Rate Warmup）

訓練初期逐漸增加學習率，避免初始化不佳導致的訓練不穩定，通常在前幾個 epoch 內從 0 線性增加到目標值。

## 完整說明

Learning Rate Warmup 是一種訓練策略，在訓練初期使用較小的學習率，然後在固定步數內逐漸增加到目標學習率。這個過程稱為「預熱」或「熱身」。預熱的目的是讓模型參數從隨機初始化狀態逐漸適應訓練數據，避免過大的初始學習率導致梯度爆炸或訓練發散。

## 常見問題

### 預熱步數應該如何確定？

預熱步數應基於總訓練步數和問題特性。常見經驗法則是總步數的 5-10%。例如，若訓練 100 個 epoch，批量大小 256，數據集 100 萬張圖片，總步數約 390625，預熱約 20000 步（5%）。對於小數據集或簡單任務，預熱可更短；對於大規模 Transformer，可能需要更長預熱（4000-10000 步）。應通過驗證集表現調整。

### 預熱可以應用於所有最佳化器嗎？

是的，預熱與最佳化器的選擇（SGD、Adam、RMSProp 等）正交。無論使用何種最佳化器，預熱都可以應用。不過，不同最佳化器可能對預熱的敏感度不同。Adam 等自適應學習率優化器可能對預熱的需求稍弱，但在大規模訓練中仍然有益。

### 預熱期間是否應該同時應用學習率衰減？

標準做法是在預熱期間不應用衰減，只進行線性增加。預熱完成後再開始應用主衰減計劃（如 cosine annealing）。這樣的分離使得兩個過程各司其職：預熱負責穩定初期，衰減負責長期學習率調度。混合預熱和衰減會使訓練曲線複雜，不利於調試。

---

來源：https://aiterms.tw/terms/learning-rate-warmup
快查頁：https://aiterms.tw/terms/learning-rate-warmup
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-learning-rate-warmup