---
title: "稀疏自動編碼器（SAE）"
slug: sae
language: zh-TW
source: https://aiterms.tw/terms/sae
updated_at: 2026-07-30
tags: [可解釋性AI, 稀疏自動編碼器, AI安全, 神經網路, 特徵工程, Anthropic]
ipas_term: false
---

# 稀疏自動編碼器（SAE）

一種透過稀疏性約束學習高維資料中可解釋潛在特徵的神經網路架構，近年廣泛應用於語言模型的可解釋性研究。

## 完整說明

稀疏自動編碼器（Sparse Autoencoder，SAE）是一種特殊形式的自動編碼器，在隱藏層的啟動值上施加稀疏性約束（即大多數神經元在任一時刻保持沉默，只有少數神經元被激活），迫使模型以稀疏、可解釋的方式表示輸入資料。SAE 在神經網路可解釋性（Mechanistic Interpretability）領域中被大量使用，用於解析大型語言模型內部的特徵表示，是當前 AI 安全與對齊研究的重要工具。

## 常見問題

### 稀疏自動編碼器（SAE）和一般的自動編碼器有什麼根本差異？

根本差異在於潛在表示的「密度」。標準自動編碼器學習到的潛在向量通常是稠密的，每個維度都有非零值且各維度語意糾纏在一起，難以解釋單個維度代表什麼概念。SAE 透過 L1 正則化或 Top-K 激活等機制強制潛在表示在任一時刻只有極少數維度激活（例如 50 個維度中只有 3 至 5 個非零），這種稀疏性使得每個激活的維度更可能對應一個獨立、可解釋的語意概念。為了補償稀疏帶來的表達能力損失，SAE 通常使用比輸入維度大幾倍甚至幾十倍的隱藏層，構成超完備字典。

### 為什麼 AI 安全研究機構對稀疏自動編碼器如此感興趣？

因為 SAE 提供了一個相對可行的方法來理解大型語言模型的內部表示，而不僅僅從輸入輸出行為觀察模型。AI 安全研究的核心問題之一是：模型在生成某個輸出時，其內部究竟在「思考」什麼？如果我們能理解模型的內部特徵，就有可能識別出與不安全行為相關的特徵（如「欺騙」「有害內容」等），進而設計干預手段在推論時抑制這些特徵。Anthropic 的研究已展示 SAE 可以從 Claude 中提取出數百萬個有語意意義的特徵，其中包括一些與概念如「自我保護本能」相關的特徵，這類研究對評估與改善 AI 對齊有重要意義。

### SAE 的「稀疏性」程度如何決定，太稀疏或太稠密有什麼問題？

稀疏性由超參數 λ（L1 正則化強度）或 K（Top-K 的 K 值）控制，需要在重建品質與特徵可解釋性之間取得平衡。太稀疏（λ 太大或 K 太小）：模型為維持稀疏性而犧牲重建精度，潛在表示無法充分捕捉輸入的全部資訊，特徵維度被迫過度壓縮多個概念，反而降低單義性。太稠密（λ 太小或 K 太大）：接近標準自動編碼器，潛在維度重新變得多語意糾纏，失去稀疏帶來的可解釋性優勢。實踐中通常透過網格搜尋，評估重建損失與特徵可解釋性得分的帕雷托前緣，選取在兩個目標間取得合理平衡的超參數值。

---

來源：https://aiterms.tw/terms/sae
快查頁：https://aiterms.tw/terms/sae
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-sae