---
title: "權重衰減（Weight Decay）"
slug: weight-decay
language: zh-TW
source: https://aiterms.tw/terms/weight-decay
updated_at: 2026-06-22
tags: [深度學習, 模型訓練, 最佳化, 神經網路]
ipas_term: false
---

# 權重衰減（Weight Decay）

「權重衰減」是深度學習正則化技術，透過懲罰過大權重，防止模型過度擬合，提升泛化能力。

## 完整說明

權重衰減是一種深度學習正則化技術，透過在損失函數中加入權重L2範數懲罰項來限制模型權重大小。它用於抑制模型複雜度，能夠有效防止模型過度擬合，提升對未見資料的泛化能力。常見應用包括訓練各種深度學習模型如神經網路、CNN和RNN。

## 常見問題

### 權重衰減與L2正則化有何不同？

權重衰減在標準SGD優化器中與L2正則化在數學上等價，都是在損失函數中加入權重L2範數項。然而，在Adam等自適應優化器中，現代的權重衰減（如AdamW）是直接在參數更新步驟中衰減權重，獨立於梯度計算。這避免了L2正則化與自適應學習率的衝突，能提供更穩定的正則化效果，因此它們在實現細節和與優化器的交互上有所區別。

### 如何選擇合適的權重衰減率（λ）？

選擇合適的權重衰減率 λ 是一個超參數調優的過程。通常需要透過實驗來確定，常見方法包括網格搜索、隨機搜索或貝葉斯優化。建議從一個較小的非零值（如0.0001或0.001）開始嘗試，並觀察模型在驗證集上的性能。如果模型仍然過度擬合，可以適當增加 λ；如果模型欠擬合或訓練不穩定，則應減小 λ。交叉驗證是評估不同 λ 值效果的有效手段。

### 權重衰減是否應該應用於偏置項（bias）？

通常情況下，權重衰減不建議應用於偏置項（bias）。這是因為偏置項的數量相對較少，對模型的整體複雜度影響有限。對偏置項施加懲罰可能會導致模型欠擬合，使其難以學習到資料中的基本偏移或截距。大多數深度學習框架和庫在實現權重衰減時，預設只對權重參數進行衰減，而忽略偏置項。

---

來源：https://aiterms.tw/terms/weight-decay
快查頁：https://aiterms.tw/terms/weight-decay
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-weight-decay