---
title: "分組查詢注意力（Grouped Query Attention）"
slug: grouped-query-attention
language: zh-TW
source: https://aiterms.tw/terms/grouped-query-attention
updated_at: 2026-06-22
tags: [大型語言模型, 深度學習, 神經網路, 模型訓練]
ipas_term: false
---

# 分組查詢注意力（Grouped Query Attention）

一種高效的注意力機制，將多個查詢頭共享同一組鍵值頭，減少模型參數和記憶體消耗，同時保持性能不下降。

## 完整說明

分組查詢注意力（Grouped Query Attention, GQA）是對標準多頭注意力的優化改進，由 Google 在 2023 年提出。在標準多頭注意力中，每個查詢頭都有獨立的鍵值頭，導致大量參數。GQA 將多個查詢頭分組，各組內的查詢頭共享同一組鍵值頭，大幅減少鍵值頭的數量。這使得模型既能保持多頭注意力的表達能力，又能顯著降低模型大小和計算成本，特別適合部署和推理場景。

## 常見問題

### 為什麼 GQA 能在減少參數的同時不損失性能？

這涉及到注意力機制冗余的認識。在標準多頭注意力中，不同的頭往往學習到相似的注意力模式。研究表明，許多頭實際上是冗余的，它們捕捉的信息相近。GQA 通過讓多個 Q 頭共享 K/V 頭，强制它們在同一值空間上操作，反而有助於學習更多樣化的 Q 投影，而同時減少了 K/V 的冗余。這是一個有趣的發現：有時候，看似的「損失」反而能帶來更優的學習效果。

### GQA 的分組比例如何決定？

分組比例（即原 Q 頭數除以 K/V 頭數）通常在 2 到 8 之間選擇。比例越大，效率收益越大，但性能損失風險也越大。在實踐中，通常採用比例 4（即 Q 頭數 / K/V 頭數 = 4），這在模型效率和性能之間提供了良好的平衡。具體選擇應根據應用場景：對於推理成本敏感的應用，可選 8；對於性能要求高的應用，可選 2。

### GQA 與 Flash Attention 是否存在衝突或不兼容？

不存在衝突。GQA 和 Flash Attention 是兩個獨立的優化方向。GQA 優化的是注意力機制的結構（減少 K/V 頭數），Flash Attention 優化的是計算的記憶體層級和 IO 效率。兩者完全可以結合使用：既採用 GQA 的分組策略，也使用 Flash Attention 的計算優化。實際上，許多新模型（如 LLaMA 2、Mistral）同時使用兩種優化，相乘獲得更顯著的效率提升。

---

來源：https://aiterms.tw/terms/grouped-query-attention
快查頁：https://aiterms.tw/terms/grouped-query-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-grouped-query-attention