---
title: "解耦空間注意力（Disentangling Spatial Attention）"
slug: disentangling-spatial-attention
language: zh-TW
source: https://aiterms.tw/terms/disentangling-spatial-attention
updated_at: 2026-06-22
tags: [電腦視覺, 注意力機制, Transformer, 生成式AI, 表示學習, 可控生成, 解耦表示]
ipas_term: false
---

# 解耦空間注意力（Disentangling Spatial Attention）

將空間注意力機制中不同維度或語義因素的表示分離，使模型能獨立控制空間定位與內容特徵的技術。

## 完整說明

解耦空間注意力（Disentangling Spatial Attention）是電腦視覺與生成式 AI 中的技術方向，旨在將 Transformer 等架構中的空間注意力機制所混合的多種因素（如空間位置、語義內容、風格屬性）顯式地分離（disentangle）表示。透過這種分離，模型能夠對不同的控制因素進行獨立操作，例如在不改變圖像語義的情況下調整空間佈局，或在保持結構不變的情況下修改局部風格，應用於可控圖像生成、視覺編輯與醫學影像分析等場景。

## 常見問題

### 解耦空間注意力和標準的自注意力有什麼結構上的差異？

標準的自注意力（Self-Attention）讓每個位置的查詢向量（Query）與所有位置的鍵向量（Key）計算相似度，得到注意力權重後對值向量（Value）加權求和。這個過程中，位置資訊（通常透過 Positional Encoding 加入到輸入）與語義內容資訊高度混合在注意力計算中，難以獨立操作。解耦空間注意力的結構差異在於：通常引入兩個（或多個）並行的注意力分支，一個專注於空間關係（例如只使用位置嵌入計算相似度），另一個專注於語義內容（例如只使用內容特徵計算相似度），最後透過加法或乘法融合兩個分支的結果。這種結構使得可以分別調整空間注意力與內容注意力的權重，實現對空間佈局與語義內容的獨立控制。

### 在可控圖像生成中，解耦空間注意力如何幫助實現精確的空間定位控制？

在文生圖模型（如 Stable Diffusion）的標準交叉注意力中，文字 prompt 中的每個 token 通過注意力機制「影響」圖像的所有位置，但無法精確指定哪個詞控制圖像的哪個區域。解耦空間注意力的做法是引入顯式的空間條件：例如使用者提供邊界框（Bounding Box）標記「貓在左上、狗在右下」，模型為每個文字 token 分配一個對應的空間注意力遮罩，使「貓」相關的詞只強烈影響左上角的圖像 patch，而不干擾右下角。這樣，語義生成（生成什麼）與空間控制（放在哪裡）被解耦為兩個獨立的信號，使用者可以分別控制。ControlNet、GLIGEN 等架構都是在這個思路下設計的有效解決方案。

### 解耦空間注意力在醫學影像分析中有哪些具體應用？

醫學影像分析對精確的空間定位有極高要求，同時又需要豐富的語義理解，是解耦空間注意力的重要應用場景。具體應用包括：腫瘤分割中，解耦空間注意力幫助模型將「腫瘤邊界在哪裡」（空間定位）與「這個區域是什麼組織」（語義分類）的學習分開，在邊界模糊的情況下提升分割精度；多模態影像配準（如 CT-MRI 配準）中，解耦方法分離解剖結構的位置資訊與各模態特有的強度特性，使配準更加魯棒；以及在病理切片分析（Whole Slide Image，WSI）中，解耦局部 patch 的特徵（細胞型態）與全局空間分佈（腫瘤微環境的空間組織模式），有助於更全面地評估腫瘤異質性。這些應用共同體現了解耦空間注意力在需要「精確定位」且「語義複雜」的視覺任務中的核心價值。

---

來源：https://aiterms.tw/terms/disentangling-spatial-attention
快查頁：https://aiterms.tw/terms/disentangling-spatial-attention
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-disentangling-spatial-attention