---
title: "遮蔽自編碼器（Masked Autoencoder）"
slug: masked-autoencoder
language: zh-TW
source: https://aiterms.tw/terms/masked-autoencoder
updated_at: 2026-06-22
tags: []
ipas_term: false
---

# 遮蔽自編碼器（Masked Autoencoder）

計算機視覺領域的自監督學習方法，隨機遮蔽輸入影像的部分區域，訓練模型從可見像素重建被遮蔽區域，類似於視覺版的遮蔽語言模型。

## 完整說明

遮蔽自編碼器（Masked Autoencoder, MAE）是將遮蔽學習思想應用於計算機視覺領域的自監督學習方法。MAE 將影像分割成多個小塊（patches），隨機遮蔽 75% 的影像塊，然後訓練編碼器-解碼器架構根據可見的 25% 影像塊重建被遮蔽的區域。這種方法使得模型能在無標籤影像資料上學習豐富的視覺表示，為視覺分類、檢測等下游任務提供有效的預訓練權重。

## 常見問題

### 遮蔽自編碼器（MAE）的訓練目標是什麼？

遮蔽自編碼器的訓練目標是從部分可見的輸入重建完整輸入。以影像 MAE 為例，模型將影像分成固定大小的 patch，隨機遮蔽 75% 的 patch，只讓編碼器看到剩餘的 25% 可見 patch，然後用解碼器重建被遮蔽部分的像素值。這個任務難度極高，迫使模型學習影像的深層語意結構而非依賴局部紋理。訓練完成後，只保留編碼器部分，搭配少量標籤數據進行微調（fine-tuning），即可應用於分類、偵測等下游任務，達到與監督學習相近甚至更好的效果。

### 遮蔽自編碼器和 BERT 的遮蔽語言模型有什麼關聯？

遮蔽自編碼器（MAE）的設計靈感直接來自 BERT 的遮蔽語言模型（Masked Language Model）。BERT 在文字序列中隨機遮蔽一定比例的詞彙 token，讓模型根據上下文預測這些遮蔽詞；MAE 則將這個概念移植到影像領域，把影像切成 patch 後遮蔽大量 patch，讓模型重建像素值。兩者的核心思路相同：利用輸入自身作為監督信號，透過重建任務學習輸入的語意表示，無需人工標籤。MAE 的成功驗證了這個自監督學習範式在視覺模態同樣有效，推動了視覺基礎模型（Vision Foundation Model）的發展。

### 遮蔽自編碼器和去噪自編碼器（Denoising Autoencoder）有什麼不同？

遮蔽自編碼器（MAE）和去噪自編碼器（DAE）都是自監督學習方法，但策略不同。DAE 在輸入添加隨機雜訊（如高斯噪聲），讓模型學習重建乾淨輸入；MAE 則是直接遮蔽輸入的一大部分（通常 75% 的 patch），讓模型從可見部分預測遮蔽部分。MAE 的遮蔽比例遠大於 DAE 的噪聲比例，使模型必須學習更深層的語意結構。此外，MAE 通常採用非對稱架構：編碼器只處理可見 patch，解碼器才負責重建所有 patch，這讓計算效率比 DAE 更高。在影像任務上，MAE 的表示學習效果通常優於傳統 DAE。

---

來源：https://aiterms.tw/terms/masked-autoencoder
快查頁：https://aiterms.tw/terms/masked-autoencoder
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-masked-autoencoder