---
title: "滑動窗口注意力（Sliding Window Attention）"
slug: sliding-window-attention
language: zh-TW
source: https://aiterms.tw/terms/sliding-window-attention
updated_at: 2026-06-22
tags: [大型語言模型, 深度學習, 神經網路, 模型訓練]
ipas_term: false
---

# 滑動窗口注意力（Sliding Window Attention）

一種高效的注意力機制，限制每個位置只與一個固定大小的局部上下文窗口內的位置進行注意力計算，減少計算複雜度。

## 完整說明

滑動窗口注意力（Sliding Window Attention）是一種限制注意力範圍的優化技術，每個位置只與其周圍固定大小的窗口內的位置進行注意力計算。相比全注意力的二次方複雜度，滑動窗口注意力的複雜度降低為線性，使得模型能高效處理更長的序列。Mistral 等現代大型語言模型通過結合滑動窗口注意力和全注意力位置來平衡效率與長距離依賴學習，已成為長上下文模型的重要技術。

## 常見問題

### 滑動窗口注意力如何處理需要遠距離上下文的情況？

純滑動窗口的視野確實局限於固定窗口。現代實現通過多種方式擴展視野：首先，在多層堆疊的模型中，視野逐層擴大；其次，某些層使用全注意力或更大窗口；再次，特殊位置（如開始、結束令牌）可能有全局視野。例如，Mistral 7B 除了使用窗口大小 4096 的 SWA，還在特定層允許更遠的位置進行注意力計算。這樣，遠距離依賴通過多層傳播和特殊機制得以建立，從而在保持效率的同時不完全放棄遠距離建模能力。

### 窗口大小如何選擇？

窗口大小的選擇是效率與性能的權衡。較小的窗口（如 128）提供最高的計算效率，但可能丟失重要的上下文；較大的窗口（如 4096）保留更多上下文，但計算成本更高。在實踐中，應根據任務特點：對於需要精細局部信息的任務（如詞性標註），可選較小窗口；對於需要廣泛上下文的任務（如文檔分類、摘要），應選較大窗口。通常，預設選擇 256 到 2048 是合理的。Mistral 7B 選 4096，展示了對於通用大型語言模型，較大的窗口仍能保持可接受的效率。

### 使用滑動窗口注意力訓練的模型是否能用全注意力進行推理？

理論上可以，但不推薦。用 SWA 訓練的模型的注意力權重是針對窗口視野優化的。突然切換到全注意力可能導致性能不穩定，特別是對於遠距離位置對。如果必須轉換，通常需要進行微調以重新適應全注意力。反向轉換（全注意力訓練改用 SWA 推理）也有類似問題。最佳實踐是從一開始就確定使用何種注意力機制，然後貫徹訓練和推理全程。如果需要靈活性，可以設計模型支持多種注意力方式，並在訓練時同時優化。

---

來源：https://aiterms.tw/terms/sliding-window-attention
快查頁：https://aiterms.tw/terms/sliding-window-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-sliding-window-attention