---
title: "遺忘門（Forget Gate）"
slug: forget-gate
language: zh-TW
source: https://aiterms.tw/terms/forget-gate
updated_at: 2026-06-22
tags: [深度學習, 自然語言處理, 神經網路, 模型訓練]
ipas_term: false
---

# 遺忘門（Forget Gate）

長短期記憶網路（LSTM）的核心門機制，通過 sigmoid 激活函數產生 0-1 的控制信號，決定上一時步細胞狀態中有多少信息應被遺棄或保留，是解決梯度消失問題的關鍵元件。

## 完整說明

遺忘門是 LSTM 單元用於管理長期記憶的重要機制，控制前一時步細胞狀態對當前時步的影響程度。當遺忘門輸出為 0 時完全遺棄舊信息，為 1 時完全保留舊信息。它根據前一隱藏狀態和當前輸入做決策，使模型能根據序列內容動態決定哪些長期依賴應被記住。與輸入門和輸出門組成 LSTM 的三層門控機制，是現代循環神經網路的核心創新。

## 常見問題

### 為什麼遺忘門偏差通常初始化為正值（如 +1），這會怎樣影響訓練初期？

遺忘門初始化為正偏差（如 +1）意味著在訓練初期，sigmoid(1 + ...) ≈ 0.73，遺忘門值較高，約保留 73% 的舊細胞狀態。這個設計幫助 LSTM 在訓練初期保留長期信息，避免信息立即遺失。如果偏差初始化為 0，遺忘門值約 0.5，信息更新更快，可能導致長期依賴無法建立。實踐中，這個初始化技巧對收斂速度有明顯幫助。

### 遺忘門值全是 0 或全是 1 分別代表什麼問題？

遺忘門全為 1 表示模型完全保留舊狀態，新信息無法更新細胞狀態，等效於沒有遺忘門的退化 RNN，無法學習動態變化。遺忘門全為 0 表示完全遺棄舊信息，無法建立長期依賴，即使短句也會信息丟失。理想情況下，遺忘門應根據序列內容動態變化。若訓練後遺忘門分佈不合理，通常指示數據質量差、超參數不當或過擬合。

### 遺忘門如何幫助 LSTM 解決梯度消失問題？

傳統 RNN 的梯度反向傳播為：dL/dh_{t-1} = dL/dh_t · ∂h_t/∂h_{t-1} = dL/dh_t · W^T · diag(tanh'(...)，梯度必須通過權重矩陣的乘積逐時步回傳，會指數衰減（梯度消失）或爆炸。LSTM 的細胞狀態通過加法更新：C_t = f_t ⊙ C_{t-1} + i_t ⊙ c̃_t，梯度回傳為 dL/dC_{t-1} = dL/dC_t ⊙ f_t + dL/dC_t 的其他項，這是加法而非乘法。加法梯度流避免了長時間依賴的指數衰減，使梯度能流過 100+ 時步。

---

來源：https://aiterms.tw/terms/forget-gate
快查頁：https://aiterms.tw/terms/forget-gate
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-forget-gate